---
title: "PDF Markdown 変換ツール"
description: "PDF Markdown 変換は、多段組みの読み順を RAG 向けの構造化 Markdown に再構築する変換ツールです。PDF 文字起こしや PDF OCR で扱う文書にも対応します。公開トライアルは最大 10 MB のファイルを受け付けます。"
url: https://markitdown.ai/pdf-to-markdown
updated: 2026-09-26
source: markitdown.ai
---

# PDF Markdown 変換ツール

> PDF Markdown 変換は、多段組みの読み順を RAG 向けの構造化 Markdown に再構築する変換ツールです。PDF 文字起こしや PDF OCR で扱う文書にも対応します。公開トライアルは最大 10 MB のファイルを受け付けます。

## PDF を Markdown に変換する方法

- PDF から Markdown への変換ツールで対応している元ファイルをアップロードします。結果と比較できるファイルを選び、始める前に匿名トライアルの上限を確認してください。
- PDF から Markdown への出力を元と照らし合わせて確認します。見出し、表のセル、最後の箇所を確認してから、他のツールに内容をコピーしてください。
- 確認した PDF から Markdown への出力を次の作業のためにコピーします。アカウントでの継続的な変換、保存履歴、一括処理、API アクセスには Lite、Pro、Max のサブスクリプションを選んでください。

## PDF Markdown 変換 を使う理由

- 読めるテキストとしての報告書 — 報告書の段落と対応している構造を、元の PDF と並べて確認・編集・保管できる Markdown にします。
- スキャンページ向けの OCR — 画像だけのページも OCR で認識できます。小さな文字、句読点、数値の表を元のスキャンと比較してください。
- 見出しの文脈 — ノートや検索のワークフロー向けに認識できる節を保ちつつ、視覚的に装飾した見出しが正しく解釈されたかを確認します。
- 確認すべき表 — 対応している表はテキスト表になります。複雑なセルや結合セルは、書き出した値を証拠として扱う前に確認してください。
- 再利用前にプレビュー — Markdown ソースとレンダリング表示を比較してから、ChatGPT、Claude、ドキュメントリポジトリにパッセージをコピーします。
- 繰り返せる API の経路 — ブラウザで代表的な出力を確認したうえで、取り込みスクリプトで PDF 変換の経路を使います。

## PDF 文字起こしと PDF OCR が崩れる理由

- 段組みが混ざる — 二段組みの報告書を上から下へ読むと左右の流れが混ざり、モデルはページに存在しなかった文を見ることになります。
- 表がグリッドを失う — PDF からのコピー＆ペーストは、結果の表を見出し行のない数値の羅列に変え、後段のパーサーを困らせます。
- スキャンにテキストレイヤーがない — 画像だけのページはグリフではなくピクセルを持つので、スキャンした PDF は今は OCR で処理されます。

## この PDF 変換ツールが保つもの

- 読み順の再構築 — PDF 変換は論理的な読み順の再構築を試みます。複雑な報告書や論文では、段組みの切り替わりを元と比較して確認してください。
- 表と見出し — PDF が構造メタデータを出す箇所では見出しレベルと表データを保ちます。フラットテキストの PDF はフラットテキストの出力になります。
- スキャンした PDF と画像だけの PDF — テキストレイヤーのない PDF（スキャンページや画像の挿入）は今は OCR で処理されます。精度はスキャンの品質に依存します。
- パスワード保護されたファイル — 暗号化された PDF は解析できません。アップロード前にパスワードを外してください。

## PDF Markdown 変換 の実際のワークフロー

- 調査ノート — 論文を編集できるノートに抽出し、引用した箇所を検証し、後で見直すために PDF の参照を保ちます。
- 報告書の取り込み — 表の見出し、節の文脈、元文書へのリンクを保ちながら、報告書をチャンク化できるよう整えます。
- 規定集 — 見直した規定を検索できるテキストに変換し、公開された PDF を権威ある版として保ちます。
- 文書の評価 — コレクションを自動化する前に、スキャン、段組み、難しい表を含む代表的な PDF を比較します。

## PDF Markdown 変換 API

x-api-key ヘッダーと対応している元ファイルを添えて POST /v1/convert/pdf を使います。完了したリクエストは出力をインラインで返すことがあります。HTTP 202 は変換がまだ実行中であることを意味します。レスポンスの Location ヘッダーを読み、ファイル出力にアクセスする前にポーリングしてください。multipart リクエストは最大 100 ファイルを受け付けます。サブスクリプションとリクエスト総量の上限も適用されます。API キーはサーバーの環境に保管してください。API アクセスには Lite、Pro、Max のサブスクリプションが必要です。

```bash
curl -i "https://api.markitdown.ai/v1/convert/pdf" \
  -H "x-api-key: $MARKITDOWN_API_KEY" \
  -F "file=@source.pdf"
# If HTTP 202, GET the Location URL with the same API key.
```

## 出力を確認する

証拠として使う前に、PDF から Markdown への出力を元の PDF と照らし合わせて確認します。簡単な表紙ではなく、段組み、脚注、表があるページから始めてください。一方の段の最後の文と次の段の最初の文を読み、PDF を人が読むのと同じ順序になっているかを確かめます。次に、表の見出し、負の値、単位を比較します。読める Markdown プレビューでも、OCR の置換やセルの位置ずれが残っていることがあります。財務や技術の判断に使う文書なら、PDF を Markdown と並べて保管し、引用しようとする箇所を検証してください。変換はテキストを扱いやすくしますが、原資料やその文字起こしを保証するものではありません。

## 何が変わるか

PDF から Markdown への変換は、視覚的な位置指定をテキスト構造に置き換えます。大きな見出しは見出し記号になり、段落は段落のまま、対応している表はパイプで区切られた行になります。ページの幾何、装飾的な罫線、フォントの選択、元の行折り返しは、出力の約束事ではありません。抽出した内容を編集したり検索インデックスを作ったりするときは役立ちますが、パンフレットをそのまま再現したいときには向きません。権威あるレイアウトとして元の PDF を保管してください。レイアウトを単純な Markdown の表で表せない場合は、短い説明や人手で確認した表のほうが後段で明確かどうかを検討します。

## RAG のソース

Markdown をパッセージに分割するときは、PDF のタイトルと意味のある節見出しを使って文脈を保ちます。「結果」だけを見出しにしたチャンクは、文書から離れると曖昧になりかねません。取り込みコードは、そのパッセージとともに文書名と親見出しを保持できます。表の見出しは行と一緒に保ち、条件の途中でリストを分割しないようにします。元の PDF への参照は別に保存し、検索結果から読者が原資料へ戻れるようにします。LangChain と LlamaIndex は自前の取り込み処理が生むテキストを消費できますが、分割器、埋め込みモデル、検索ポリシーの選択は依然としてあなたのアプリケーションの役割です。答えを PDF で確認済みの質問を使って、検索をテストしてください。

## PDF の選び方

読めるテキストが入っているなら、元の PDF の書き出しを優先します。その PDF のスクリーンショットは画像認識の工程をもう一段増やし、変換が始まる前に小さな文字を失うことがあります。スキャンした PDF では、回転したページをまっすぐにし、通常のズームで句読点と表の罫線が読める状態の版を使ってください。暗号化された PDF はアップロード前にパスワードを外します。長い報告書の一部だけが目的なら、該当する元ページを用意し、元の参照をメモに残します。同じ傷んだスキャンを繰り返しても欠けた細部は直りにくいので、まず元を良くしてから、新しい PDF から Markdown への出力を前回の結果と比べてください。

## チャンクの境界

検索品質は、人が読む文書と一致するチャンクの境界にかかっています。この変換ツールは段組みを並べ替え、見出しレベルを保つので、分割器は二段組み論文の断片を交互に出すのではなく、パッセージを出力できます。

- 平坦化したテキストの塊ではなく、チャンク化して埋め込む成果物として Markdown を使ってください。
- 標準ページと OCR ページは、ログイン済みのプランで 1 ページあたり 1 クレジットで課金されます。
- パスワード保護されたファイルはアップロード前にロックを解除してください。暗号化された PDF は拒否されます。

## 例：NIST Cybersecurity Framework 2.0、15 ページ

Source: https://nvlpubs.nist.gov/nistpubs/CSWP/NIST.CSWP.29.pdf

```markdown
## Appendix A. CSF Core

This appendix describes the Functions, Categories, and Subcategories of the CSF Core. Table 1 lists the CSF 2.0 Core Function and Category names and unique alphabetic identifiers. Each Function name in the table is linked to its portion of the appendix. The order of Functions, Categories, and Subcategories of the Core is not alphabetical; it is intended to resonate most with those charged with operationalizing risk management within an organization. The numbering of the Subcategories is intentionally not sequential; gaps in numbering indicate CSF 1.1 Subcategories that were relocated in CSF 2.0.

**Table 1. CSF 2.0 Core Function and Category names and identifiers**

|  Function | Category | Category Identifier  |
| --- | --- | --- |
|  **Govern (GV)** | Organizational Context | GV.OC  |
|   |  Risk Management Strategy | GV.RM  |
|   |  Roles, Responsibilities, and Authorities | GV.RR  |
|   |  Policy | GV.PO  |
|   |  Oversight | GV.OV  |
|   |  Cybersecurity Supply Chain Risk Management | GV.SC  |
|  **Identify (ID)** | Asset Management | ID.AM  |
|   |  Risk Assessment | ID.RA  |
|   |  Improvement | ID.IM  |
|  **Protect (PR)** | Identity Management, Authentication, and Access Control | PR.AA  |
|   |  Awareness and Training | PR.AT  |
|   |  Data Security | PR.DS  |
|   |  Platform Security | PR.PS  |
|   |  Technology Infrastructure Resilience | PR.IR  |
|  **Detect (DE)** | Continuous Monitoring | DE.CM  |
|   |  Adverse Event Analysis | DE.AE  |

```

## FAQ

### PDF から Markdown はどう動作しますか？

PDF から Markdown は、対応している元ファイルを確認と再利用のための読める Markdown に変換します。匿名トライアルは 1 ファイルあたり最大 10 MB・25 ページ、1 IP あたり 1 時間に 3 回、1 日 10 回までです。使う前に結果を元と比較してください。

### PDF の最大サイズはどれくらいですか？

公開変換ツールは最大 10 MB の PDF を受け付けます。Lite は最大 100 MB のファイルに対応し、Pro と Max はさらに高い上限があります。

### スキャンした PDF に対応していますか？

はい。画像ベースの PDF は今は OCR で処理されます。クリーンで高解像度のスキャンが最良の結果を生みます。

### 多段組みの研究論文は扱えますか？

はい。PDF から Markdown は読み順の再構築を試みます。複雑なレイアウトはまだ修正が必要なことがあるので、段組みの切り替わりを元と比較してください。

### 財務の表は残りますか？

構造メタデータを持つ PDF の表は Markdown の表に変換されます。画像として平坦化された表は OCR での復元が必要です。

### パスワード保護された PDF を変換できますか？

いいえ。暗号化された PDF は解析できません。アップロード前にパスワードを外してください。

### RAG 向けにチャンク化できる品質ですか？

Markdown は可能な箇所で見出し、リスト、表を保つので、コピー＆ペーストと比べてチャンク化と埋め込みが予測しやすくなります。

### コードから PDF を変換できますか？

はい。API キーを使ってファイルを直接 /v1/convert/pdf に POST し、レスポンスで Markdown を読み取ります。/developers を参照してください。

## Related

- [Markdown converter for documents and web pages.](https://markitdown.ai/)
