|
1 | 1 | import json |
| 2 | +import warnings |
2 | 3 | from types import SimpleNamespace |
3 | 4 | from typing import Any |
4 | | -from unittest.mock import MagicMock |
| 5 | +from unittest.mock import MagicMock, patch |
5 | 6 |
|
| 7 | +import pytest |
6 | 8 | from haystack.core.serialization import component_from_dict, component_to_dict |
| 9 | +from haystack.dataclasses import ByteStream |
7 | 10 |
|
8 | 11 | from haystack_integrations.components.converters.docling import DoclingConverter, ExportType |
9 | 12 |
|
@@ -213,3 +216,153 @@ def test_component_from_dict_custom_params() -> None: |
213 | 216 | assert restored.convert_kwargs == {"raises_on_error": False} |
214 | 217 | assert restored.export_type == ExportType.JSON |
215 | 218 | assert restored.md_export_kwargs == {"image_placeholder": "[img]"} |
| 219 | + |
| 220 | + |
| 221 | +def test_run_with_sources_parameter() -> None: |
| 222 | + converter_mock = MagicMock() |
| 223 | + chunker_mock = MagicMock() |
| 224 | + meta_extractor_mock = MagicMock() |
| 225 | + |
| 226 | + converter_mock.convert.return_value = SimpleNamespace(document="dl-doc") |
| 227 | + chunker_mock.chunk.return_value = [SimpleNamespace(text="chunk-1")] |
| 228 | + chunker_mock.contextualize.return_value = "contextualized-chunk-1" |
| 229 | + meta_extractor_mock.extract_chunk_meta.return_value = {} |
| 230 | + |
| 231 | + converter = DoclingConverter( |
| 232 | + converter=converter_mock, |
| 233 | + export_type=ExportType.DOC_CHUNKS, |
| 234 | + chunker=chunker_mock, |
| 235 | + meta_extractor=meta_extractor_mock, |
| 236 | + ) |
| 237 | + |
| 238 | + result = converter.run(sources=["file.pdf"]) |
| 239 | + assert len(result["documents"]) == 1 |
| 240 | + |
| 241 | + |
| 242 | +def test_run_paths_deprecated() -> None: |
| 243 | + converter_mock = MagicMock() |
| 244 | + chunker_mock = MagicMock() |
| 245 | + meta_extractor_mock = MagicMock() |
| 246 | + |
| 247 | + converter_mock.convert.return_value = SimpleNamespace(document="dl-doc") |
| 248 | + chunker_mock.chunk.return_value = [SimpleNamespace(text="chunk-1")] |
| 249 | + chunker_mock.contextualize.return_value = "contextualized-chunk-1" |
| 250 | + meta_extractor_mock.extract_chunk_meta.return_value = {} |
| 251 | + |
| 252 | + converter = DoclingConverter( |
| 253 | + converter=converter_mock, |
| 254 | + export_type=ExportType.DOC_CHUNKS, |
| 255 | + chunker=chunker_mock, |
| 256 | + meta_extractor=meta_extractor_mock, |
| 257 | + ) |
| 258 | + |
| 259 | + with warnings.catch_warnings(record=True) as caught: |
| 260 | + warnings.simplefilter("always") |
| 261 | + result = converter.run(paths=["file.pdf"]) |
| 262 | + |
| 263 | + assert len(result["documents"]) == 1 |
| 264 | + assert any(issubclass(w.category, DeprecationWarning) and "paths" in str(w.message) for w in caught) |
| 265 | + |
| 266 | + |
| 267 | +def test_run_meta_single_dict_doc_chunks() -> None: |
| 268 | + converter_mock = MagicMock() |
| 269 | + chunker_mock = MagicMock() |
| 270 | + meta_extractor_mock = MagicMock() |
| 271 | + |
| 272 | + converter_mock.convert.side_effect = [ |
| 273 | + SimpleNamespace(document="dl-doc-a"), |
| 274 | + SimpleNamespace(document="dl-doc-b"), |
| 275 | + ] |
| 276 | + chunker_mock.chunk.side_effect = lambda dl_doc: [SimpleNamespace(text=f"chunk-of-{dl_doc}")] |
| 277 | + chunker_mock.contextualize.side_effect = lambda chunk: chunk.text |
| 278 | + meta_extractor_mock.extract_chunk_meta.return_value = {"extractor_key": "extractor_val"} |
| 279 | + |
| 280 | + converter = DoclingConverter( |
| 281 | + converter=converter_mock, |
| 282 | + export_type=ExportType.DOC_CHUNKS, |
| 283 | + chunker=chunker_mock, |
| 284 | + meta_extractor=meta_extractor_mock, |
| 285 | + ) |
| 286 | + |
| 287 | + result = converter.run(sources=["a.pdf", "b.pdf"], meta={"custom": "value"}) |
| 288 | + documents = result["documents"] |
| 289 | + |
| 290 | + assert len(documents) == 2 |
| 291 | + for doc in documents: |
| 292 | + assert doc.meta["custom"] == "value" |
| 293 | + assert doc.meta["extractor_key"] == "extractor_val" |
| 294 | + |
| 295 | + |
| 296 | +def test_run_meta_list_of_dicts_markdown() -> None: |
| 297 | + converter_mock = MagicMock() |
| 298 | + meta_extractor_mock = MagicMock() |
| 299 | + |
| 300 | + dl_doc_a = MagicMock() |
| 301 | + dl_doc_a.export_to_markdown.return_value = "markdown-a" |
| 302 | + dl_doc_b = MagicMock() |
| 303 | + dl_doc_b.export_to_markdown.return_value = "markdown-b" |
| 304 | + |
| 305 | + converter_mock.convert.side_effect = [ |
| 306 | + SimpleNamespace(document=dl_doc_a), |
| 307 | + SimpleNamespace(document=dl_doc_b), |
| 308 | + ] |
| 309 | + meta_extractor_mock.extract_dl_doc_meta.return_value = {} |
| 310 | + |
| 311 | + converter = DoclingConverter( |
| 312 | + converter=converter_mock, |
| 313 | + export_type=ExportType.MARKDOWN, |
| 314 | + meta_extractor=meta_extractor_mock, |
| 315 | + ) |
| 316 | + |
| 317 | + result = converter.run( |
| 318 | + sources=["a.pdf", "b.pdf"], |
| 319 | + meta=[{"source_id": "doc-a"}, {"source_id": "doc-b"}], |
| 320 | + ) |
| 321 | + documents = result["documents"] |
| 322 | + |
| 323 | + assert len(documents) == 2 |
| 324 | + assert documents[0].meta["source_id"] == "doc-a" |
| 325 | + assert documents[1].meta["source_id"] == "doc-b" |
| 326 | + |
| 327 | + |
| 328 | +def test_run_meta_list_length_mismatch_raises() -> None: |
| 329 | + converter_mock = MagicMock() |
| 330 | + meta_extractor_mock = MagicMock() |
| 331 | + |
| 332 | + converter = DoclingConverter( |
| 333 | + converter=converter_mock, |
| 334 | + export_type=ExportType.MARKDOWN, |
| 335 | + meta_extractor=meta_extractor_mock, |
| 336 | + ) |
| 337 | + |
| 338 | + with pytest.raises(ValueError): |
| 339 | + converter.run(sources=["a.pdf", "b.pdf"], meta=[{"x": 1}]) |
| 340 | + |
| 341 | + |
| 342 | +def test_run_with_bytestream_source() -> None: |
| 343 | + converter_mock = MagicMock() |
| 344 | + meta_extractor_mock = MagicMock() |
| 345 | + |
| 346 | + dl_doc = MagicMock() |
| 347 | + dl_doc.export_to_markdown.return_value = "markdown-content" |
| 348 | + converter_mock.convert.return_value = SimpleNamespace(document=dl_doc) |
| 349 | + meta_extractor_mock.extract_dl_doc_meta.return_value = {} |
| 350 | + |
| 351 | + converter = DoclingConverter( |
| 352 | + converter=converter_mock, |
| 353 | + export_type=ExportType.MARKDOWN, |
| 354 | + meta_extractor=meta_extractor_mock, |
| 355 | + ) |
| 356 | + |
| 357 | + bytestream = ByteStream(data=b"%PDF-1.4 fake pdf content", meta={"file_path": "uploaded.pdf"}) |
| 358 | + |
| 359 | + with patch("os.unlink"): |
| 360 | + result = converter.run(sources=[bytestream]) |
| 361 | + |
| 362 | + documents = result["documents"] |
| 363 | + assert len(documents) == 1 |
| 364 | + # ByteStream meta is merged into the output document |
| 365 | + assert documents[0].meta["file_path"] == "uploaded.pdf" |
| 366 | + # docling was called with a temp file path, not the ByteStream directly |
| 367 | + call_args = converter_mock.convert.call_args |
| 368 | + assert call_args.kwargs["source"] != bytestream |
0 commit comments