Metadata-Version: 2.4
Name: langchain-pdfmux
Version: 0.1.0
Summary: LangChain document loader for pdfmux — self-healing PDF extraction
Project-URL: Homepage, https://pdfmux.com
Project-URL: Repository, https://github.com/NameetP/langchain-pdfmux
Project-URL: Issues, https://github.com/NameetP/langchain-pdfmux/issues
Author: Nameet Potnis
License-Expression: MIT
License-File: LICENSE
Keywords: document-loader,langchain,llm,pdf,pdfmux,rag
Classifier: Development Status :: 4 - Beta
Classifier: Intended Audience :: Developers
Classifier: License :: OSI Approved :: MIT License
Classifier: Programming Language :: Python :: 3
Classifier: Programming Language :: Python :: 3.11
Classifier: Programming Language :: Python :: 3.12
Classifier: Programming Language :: Python :: 3.13
Classifier: Topic :: Scientific/Engineering :: Artificial Intelligence
Classifier: Topic :: Text Processing :: Markup :: Markdown
Requires-Python: >=3.11
Requires-Dist: langchain-core>=0.2.0
Requires-Dist: pdfmux>=1.2.0
Description-Content-Type: text/markdown

# langchain-pdfmux

LangChain document loader for [pdfmux](https://pdfmux.com) — self-healing PDF extraction.

## Install

```bash
pip install langchain-pdfmux
```

## Usage

```python
from langchain_pdfmux import PDFMuxLoader

docs = PDFMuxLoader("report.pdf").load()
```

Each `Document` includes metadata: `source`, `title`, `page_start`, `page_end`, `tokens`, `confidence`.

### Options

```python
# High-quality extraction
loader = PDFMuxLoader("report.pdf", quality="high")

# Load all PDFs in a directory
loader = PDFMuxLoader("./papers/")

# Streaming with lazy_load
for doc in PDFMuxLoader("large.pdf").lazy_load():
    process(doc)
```

## License

MIT
