Extrae Texto y Tablas de Archivos PDF
Extrae texto limpio y datos de tablas estructuradas de cualquier PDF. Perfecto para pipelines de datos, indexación de búsqueda, análisis de contenido y alimentación de modelos de IA/LLM.
# JSON with tables — /v2/pdf/extract-text (recommended)
curl -X POST \
https://api.convertfilefast.com/v2/pdf/extract-text \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@report.pdf" \
-F "pages=1-5" \
-F "extract_tables=true"
# Plain text file — /v2/convert/pdf-to-txt
curl -X POST \
https://api.convertfilefast.com/v2/convert/pdf-to-txt \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@report.pdf" \
--output extracted.txtimport requests
# Option 1: JSON with tables (extract-text) — rich structured output
response = requests.post(
"https://api.convertfilefast.com/v2/pdf/extract-text",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("report.pdf", "rb")},
data={"pages": "1-5", "extract_tables": "true"}
)
data = response.json()
for page in data["pages"]:
print(f"Page {page['page_number']}: {page['text'][:100]}...")
# Option 2: Plain text file (pdf-to-txt) — simple .txt output
response = requests.post(
"https://api.convertfilefast.com/v2/convert/pdf-to-txt",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("report.pdf", "rb")}
)
with open("extracted.txt", "wb") as f:
f.write(response.content)const formData = new FormData();
formData.append("file", fs.createReadStream("report.pdf"));
formData.append("pages", "1-5");
formData.append("extract_tables", "true");
const response = await fetch(
"https://api.convertfilefast.com/v2/pdf/extract-text",
{
method: "POST",
headers: { "Authorization": "Bearer YOUR_API_KEY" },
body: formData,
}
);
const data = await response.json();
console.log(`Extracted ${data.total_pages} pages`);// n8n HTTP Request Node
{
"method": "POST",
"url": "https://api.convertfilefast.com/v2/pdf/extract-text",
"contentType": "multipart-form-data",
"bodyParameters": {
"parameters": [
{ "name": "file", "parameterType": "formBinaryData", "inputDataFieldName": "data" },
{ "name": "extract_tables", "value": "true" }
]
},
"options": { "response": { "responseFormat": "json" } }
}Ventajas
Por qué usar nuestra API?
Solución completa y confiable para integración en cualquier stack tecnológico.
Extracción de Texto
Extrae texto limpio y estructurado de cualquier PDF con detección adecuada de párrafos.
Detección de Tablas
Detecta y extrae automáticamente tablas como arrays de datos estructurados para procesamiento.
Selección de Páginas
Extrae de páginas específicas (ej: "1,3,5-7") o de todas las páginas en una solicitud.
Acceso a Metadatos
Obtén metadatos del PDF (título, autor, fecha de creación) junto con el texto extraído.
Listo para IA/LLM
Perfecto para alimentar contenido extraído a ChatGPT, Claude o pipelines de IA personalizados.
Integración con Pipelines
Integra fácilmente en pipelines ETL con n8n, Airflow o scripts de procesamiento personalizados.
O llámalo desde Claude, Cursor o cualquier cliente MCP
Convert File Fast incluye un servidor Model Context Protocol nativo. Entrega esta conversión a un agente de IA como una sola llamada de herramienta: sin cliente HTTP, sin manejar binarios, con clave de API por usuario.
npx -y convertfilefast-mcpconvert_file({ target_format: "txt", source_url: "https://example.com/file.pdf" })Empieza a Extraer Texto de PDFs
Obtén tu clave API y extrae texto de documentos PDF en segundos. El plan gratuito incluye 10 conversiones por mes.
Sin tarjeta de crédito. 10 conversiones gratis en plan Free.