Document-naar-Markdown converter met MCP-server en bidirectionele export
all2md, ontwikkeld door Thomas Villani, converteert complexe documentformaten naar gestructureerde Markdown voor LLM-inname en geautomatiseerde documentworkflows. De tool voert bidirectionele conversie uit over meer dan 40 formaten, draait een ingebouwde Model Context Protocol-server en biedt RAG-native chunking plus AST-gebaseerde transformaties voor hoge-fidelity parsing. Het omvat geavanceerd PDF-tabelherstel, optionele OCR-ondersteuning en CLI-batchhulpmiddelen. Doelgebruikers zijn LLM- en RAG-bouwers, Python-ontwikkelaars en power users die programmatische documentvoorbereiding afhandelen.
Transformeert complexe bestanden naar LLM-klaar Markdown voor RAG-inname
De tool converteert meer dan 40 bestandstypen, waaronder PDFs, DOCX, PPTX, HTML, e-mails en spreadsheets, naar schone, GitHub Flavored Markdown die is ontworpen voor modelcontextinname. De pijplijn gebruikt een abstracte syntaxisboom om de documentstructuur te behouden en programmatische transformaties mogelijk te maken, en het kan Markdown terugschrijven naar rijke formaten zoals DOCX en PDF, waardoor rondreisbewerking van modelgegenereerde inhoud mogelijk is.
Produceert gestructureerde outputs met meetbare trouw voor complexe lay-outs
PDF-verwerking richt zich op tabelherstel, analyse van meerkolomsindelingen en het verwijderen van kop- en voetteksten, wat de hoeveelheid spurious of 'uitgevonden' tekst vermindert in vergelijking met eenvoudigere parsers. Het project rapporteert benchmarking tegen Docling en pymupdf4llm en benadrukt lage uitgevonden-tekstratio's. RAG-native chunking biedt elf strategieën, waaronder semantische, kop- en token splitsingen, terwijl sectie- en pagina-oorsprong voor retrieval-workflows behouden blijft.
Vereist ontwikkelaarsvertrouwdheid maar biedt uitbreidbare, formaat-specifieke installaties
De tool is beschikbaar als een Python-bibliotheek en een CLI voor PC, macOS en Linux, en richt zich op Python 3.x omgevingen. De installer gebruikt een modulair afhankelijkheidssysteem zodat alleen de codecs die nodig zijn voor specifieke formaten worden geïnstalleerd, en OCR-extra's zoals Tesseract of EasyOCR zijn optioneel voor gescande PDFs. Een plugin-API en AST-transformaties stellen ontwikkelaars in staat om aangepaste formaten toe te voegen of het parsergedrag programmatisch aan te passen.
Past in AI-assistentpijplijnen via MCP en batchtools
De ingebouwde Model Context Protocol-server verbindt de conversiepijplijn rechtstreeks met AI-assistenten, en het project levert een eenklik MCPB-bundel voor klanten zoals Claude Desktop. Commandoregelhulpmiddelen ondersteunen directory-watching, batchconversie, semantische zoekopdrachten en documentdiffing om de inname te automatiseren. Deze integraties helpen gestructureerde Markdown in retrievalsystemen te voeden en stellen ontwikkelaars in staat om geconverteerde inhoud in downstream modelprompts of RAG-opslagplaatsen op te nemen.
Praktische keuze voor ontwikkelaars die modelinnamepijplijnen bouwen
Voor teams die retrieval- en contextlagen construeren, biedt het hulpmiddel meetbare controle over bronfideliteit en herkomst; het modulaire, code-eerste ontwerp is geschikt voor gescripte pijplijnen en batchbewerkingen. Niet-technische gebruikers zullen waarschijnlijk een steile opstartcurve tegenkomen. Praktisch advies: genereer GitHub Flavored Markdown en geef de voorkeur aan semantische of op koppen gebaseerde chunking om de herkomst intact te houden bij het importeren van documenten in modelcontextopslag. Schakel OCR-extra's in voor op afbeeldingen gebaseerde PDF's voordat batchruns worden uitgevoerd.





