Text und Tabellen aus PDF-Dateien extrahieren
Extrahieren Sie bereinigten Text und strukturierte Tabellendaten aus beliebigen PDFs. Ideal für Datenpipelines, Such-Indexierung, Inhaltsanalyse und KI/LLM-Modelle.
# JSON with tables — /v2/pdf/extract-text (recommended)
curl -X POST \
https://api.convertfilefast.com/v2/pdf/extract-text \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@report.pdf" \
-F "pages=1-5" \
-F "extract_tables=true"
# Plain text file — /v2/convert/pdf-to-txt
curl -X POST \
https://api.convertfilefast.com/v2/convert/pdf-to-txt \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@report.pdf" \
--output extracted.txtimport requests
# Option 1: JSON with tables (extract-text) — rich structured output
response = requests.post(
"https://api.convertfilefast.com/v2/pdf/extract-text",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("report.pdf", "rb")},
data={"pages": "1-5", "extract_tables": "true"}
)
data = response.json()
for page in data["pages"]:
print(f"Page {page['page_number']}: {page['text'][:100]}...")
# Option 2: Plain text file (pdf-to-txt) — simple .txt output
response = requests.post(
"https://api.convertfilefast.com/v2/convert/pdf-to-txt",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("report.pdf", "rb")}
)
with open("extracted.txt", "wb") as f:
f.write(response.content)const formData = new FormData();
formData.append("file", fs.createReadStream("report.pdf"));
formData.append("pages", "1-5");
formData.append("extract_tables", "true");
const response = await fetch(
"https://api.convertfilefast.com/v2/pdf/extract-text",
{
method: "POST",
headers: { "Authorization": "Bearer YOUR_API_KEY" },
body: formData,
}
);
const data = await response.json();
console.log(`Extracted ${data.total_pages} pages`);// n8n HTTP Request Node
{
"method": "POST",
"url": "https://api.convertfilefast.com/v2/pdf/extract-text",
"contentType": "multipart-form-data",
"bodyParameters": {
"parameters": [
{ "name": "file", "parameterType": "formBinaryData", "inputDataFieldName": "data" },
{ "name": "extract_tables", "value": "true" }
]
},
"options": { "response": { "responseFormat": "json" } }
}Vorteile
Warum unsere API verwenden?
Vollständige und zuverlässige Lösung für die Integration in jeden Tech-Stack.
Textextraktion
Extrahieren Sie bereinigten, strukturierten Text aus beliebigen PDFs mit korrekter Absatzerkennung.
Tabellenerkennung
Erkennt und extrahiert Tabellen automatisch als strukturierte Daten-Arrays zur Verarbeitung.
Seitenauswahl
Extrahieren Sie aus bestimmten Seiten (z.B. "1,3,5-7") oder allen Seiten in einer Anfrage.
Metadatenzugriff
Erhalten Sie PDF-Metadaten (Titel, Autor, Erstellungsdatum) zusammen mit dem extrahierten Text.
KI/LLM-Bereit
Ideal für die Einspeisung von extrahiertem Inhalt in ChatGPT, Claude oder benutzerdefinierte KI-Pipelines.
Pipeline-Integration
Einfache Integration in ETL-Pipelines mit n8n, Airflow oder benutzerdefinierten Verarbeitungsskripten.
Oder rufen Sie es aus Claude, Cursor oder einem beliebigen MCP-Client auf
Convert File Fast bringt einen nativen Model-Context-Protocol-Server mit. Übergeben Sie diese Konvertierung einem KI-Agenten als einzelnen Tool-Call — ohne HTTP-Client, ohne Binärdaten-Handling, mit API-Schlüssel pro Nutzer.
npx -y convertfilefast-mcpconvert_file({ target_format: "txt", source_url: "https://example.com/file.pdf" })Text aus PDFs extrahieren starten
Holen Sie sich Ihren API-Schlüssel und extrahieren Sie Text aus PDF-Dokumenten in Sekunden. Kostenloser Plan beinhaltet 10 Konvertierungen pro Monat.
Keine Kreditkarte. 10 kostenlose Konvertierungen im Free-Plan.