テキスト & テーブル抽出
テキストとテーブルを PDFファイルから抽出
任意のPDFからクリーンなテキストと構造化テーブルデータを抽出。データパイプライン、検索インデックス、コンテンツ分析、AI/LLMモデルへの入力に最適。
# JSON with tables — /v2/pdf/extract-text (recommended)
curl -X POST \
https://api.convertfilefast.com/v2/pdf/extract-text \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@report.pdf" \
-F "pages=1-5" \
-F "extract_tables=true"
# Plain text file — /v2/convert/pdf-to-txt
curl -X POST \
https://api.convertfilefast.com/v2/convert/pdf-to-txt \
-H "Authorization: Bearer YOUR_API_KEY" \
-F "file=@report.pdf" \
--output extracted.txtimport requests
# Option 1: JSON with tables (extract-text) — rich structured output
response = requests.post(
"https://api.convertfilefast.com/v2/pdf/extract-text",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("report.pdf", "rb")},
data={"pages": "1-5", "extract_tables": "true"}
)
data = response.json()
for page in data["pages"]:
print(f"Page {page['page_number']}: {page['text'][:100]}...")
# Option 2: Plain text file (pdf-to-txt) — simple .txt output
response = requests.post(
"https://api.convertfilefast.com/v2/convert/pdf-to-txt",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("report.pdf", "rb")}
)
with open("extracted.txt", "wb") as f:
f.write(response.content)const formData = new FormData();
formData.append("file", fs.createReadStream("report.pdf"));
formData.append("pages", "1-5");
formData.append("extract_tables", "true");
const response = await fetch(
"https://api.convertfilefast.com/v2/pdf/extract-text",
{
method: "POST",
headers: { "Authorization": "Bearer YOUR_API_KEY" },
body: formData,
}
);
const data = await response.json();
console.log(`Extracted ${data.total_pages} pages`);// n8n HTTP Request Node
{
"method": "POST",
"url": "https://api.convertfilefast.com/v2/pdf/extract-text",
"contentType": "multipart-form-data",
"bodyParameters": {
"parameters": [
{ "name": "file", "parameterType": "formBinaryData", "inputDataFieldName": "data" },
{ "name": "extract_tables", "value": "true" }
]
},
"options": { "response": { "responseFormat": "json" } }
}2秒以内に変換完了
特徴
なぜ当社のAPIを使うのか?
あらゆる技術スタックへの統合に対応した完全で信頼性の高いソリューション。
テキスト抽出
適切な段落検出で任意のPDFからクリーンで構造化されたテキストを抽出。
テーブル検出
処理用の構造化データ配列としてテーブルを自動検出・抽出。
ページ選択
特定のページ(例:"1,3,5-7")またはすべてのページから一度に抽出。
メタデータアクセス
抽出テキストとともにPDFメタデータ(タイトル、著者、作成日)を取得。
AI/LLM対応
ChatGPT、Claude、カスタムAIパイプラインへの抽出コンテンツ入力に最適。
パイプライン統合
n8n、Airflow、カスタム処理スクリプトでETLパイプラインに簡単統合。
AI エージェント向け
Claude、Cursor など任意の MCP クライアントから呼び出すこともできます
Convert File Fast はネイティブの Model Context Protocol サーバーを提供しています。この変換を 1 回のツール呼び出しとして AI エージェントに任せられます。HTTP クライアントもバイナリ処理も不要で、API キーはユーザーごとに発行されます。
ローカルインストール
npx -y convertfilefast-mcpMCP ツール呼び出し
convert_file({ target_format: "txt", source_url: "https://example.com/file.pdf" })PDFからテキスト抽出を始める
APIキーを取得して数秒でPDFドキュメントからテキストを抽出。無料プランは毎月10回の変換を含む。
クレジットカード不要。Freeプランで10回無料変換。