Parsing de PDF é a dependência não documentada em torno da qual todo pipeline RAG cresce. O docling-mcp envolve o Docling da IBM como uma ferramenta MCP padrão: instale com uvx mcp-server-docling, conecte ao Claude ou LM Studio, e seu agente chama convert_document para obter JSON estruturado com ordem de leitura, extração de tabelas e hierarquia de seções intacta.
Extração de texto plano sempre foi a abstração errada para agentes conscientes de documentos.
- Instalação:
uvx mcp-server-docling - Saída: JSON estruturado · ordem de leitura · tabelas · hierarquia de seções
Repositório
GitHub: docling-project/docling-mcp
#MCP #DocumentAI #RAG #AIEngineering #OpenSource
