Công cụ chuyển đổi
Chuyển PDF sang Markdown
Chuyển PDF sang Markdown là công cụ dựng lại thứ tự đọc nhiều cột thành Markdown có cấu trúc cho RAG. Bản dùng thử công khai nhận file tối đa 10 MB.
Dùng thử một file trước khi chọn gói.
- Không tài khoản: tối đa 10 MB và 25 trang mỗi file, 3 lượt chuyển đổi mỗi giờ và 10 mỗi ngày, xem trước và sao chép trong trình duyệt.
- Đã đăng nhập: 20 lượt chuyển đổi miễn phí mỗi ngày, được lưu vào thư viện.
- Lite, Pro và Max bao gồm tín dụng chuyển đổi, xử lý hàng loạt, truy cập API và lịch sử được lưu. Lite bao gồm 30 ngày lịch sử.
Cách thực hiện
Cách chuyển PDF sang Markdown
Bạn có thể tải lên gì
- Loại file: .pdf
- Dùng thử không cần tài khoản: tối đa 10 MB và 25 trang mỗi file, 3 lượt chuyển đổi mỗi giờ và 10 mỗi ngày
- Lite nhận file tối đa 100 MB, Pro tối đa 200 MB
- Max không có giới hạn kích thước mỗi file; chuyển đổi bị giới hạn bởi tín dụng
Cần kiểm tra gì
- Dựng lại thứ tự đọc — Chuyển PDF cố gắng dựng lại một thứ tự đọc hợp lý.
- Bảng và tiêu đề — Cấp tiêu đề và dữ liệu dạng bảng được giữ ở nơi PDF phơi ra metadata cấu trúc; PDF văn bản phẳng cho ra đầu ra văn bản phẳng.
- PDF scan và chỉ có hình ảnh — PDF không có lớp văn bản (trang scan và ảnh chèn) được xử lý bằng OCR ngay hôm nay; độ chính xác phụ thuộc vào chất lượng bản scan.
- File được bảo vệ bằng mật khẩu — PDF mã hóa không thể phân tích; hãy gỡ mật khẩu trước khi tải lên.
Markdown đi đâu
- Sao chép Markdown thẳng từ bản xem trước
- Tải file .md và giữ nó trong thư viện sau khi đăng nhập
- Chuyển cả thư mục hoặc kho ZIP bằng Chuyển đổi hàng loạt
- Tự động hóa bằng POST /v1/convert/pdf và khóa API của bạn

Vì sao nên dùng
Vì sao nên dùng PDF sang Markdown
Báo cáo thành văn bản dễ đọc
Biến đoạn văn và cấu trúc được hỗ trợ của một báo cáo thành Markdown bạn có thể kiểm tra, chỉnh sửa và giữ bên cạnh PDF nguồn.
OCR cho trang scan
Trang chỉ có hình ảnh có thể được nhận dạng bằng OCR. Hãy so sánh chữ nhỏ, dấu câu và bảng số với bản scan gốc.
Ngữ cảnh tiêu đề
Giữ những mục dễ nhận ra cho ghi chú và quy trình truy xuất, đồng thời kiểm tra xem tiêu đề được định kiểu thị giác có được diễn giải đúng không.
Bảng để xem xét
Bảng được hỗ trợ trở thành bảng văn bản. Hãy kiểm tra ô phức tạp hay gộp trước khi coi các giá trị đã xuất là bằng chứng.
Xem trước trước khi tái sử dụng
So sánh mã nguồn Markdown với bản đã kết xuất trước khi sao chép một đoạn vào ChatGPT, Claude hay một kho tài liệu.
Một tuyến API lặp lại được
Dùng tuyến chuyển PDF trong một script nạp dữ liệu sau khi đã xem xét các đầu ra đại diện trên trình duyệt.
Vấn đề
Vì sao các cột PDF phá vỡ mô hình ngôn ngữ
Các cột xen kẽ
Một báo cáo hai cột đọc từ trên xuống trộn hai luồng trái và phải, nên model thấy một câu chưa từng tồn tại trên trang.
Bảng mất lưới
Sao chép-dán từ PDF biến một bảng kết quả thành một chuỗi số không có hàng tiêu đề cho bộ phân tích hạ nguồn.
Bản scan không có lớp văn bản
Trang chỉ có hình ảnh mang điểm ảnh, không phải glyph, nên PDF scan được xử lý bằng OCR ngay hôm nay.

Những gì được giữ lại
Những gì công cụ chuyển PDF này giữ lại
- Dựng lại thứ tự đọc
- Chuyển PDF cố gắng dựng lại một thứ tự đọc hợp lý. Hãy xem lại các chuyển tiếp cột so với bản gốc, nhất là với báo cáo và bài báo phức tạp.Source: ISO 32000-2 (PDF 2.0)
- Bảng và tiêu đề
- Cấp tiêu đề và dữ liệu dạng bảng được giữ ở nơi PDF phơi ra metadata cấu trúc; PDF văn bản phẳng cho ra đầu ra văn bản phẳng.Source: CommonMark Spec
- PDF scan và chỉ có hình ảnh
- PDF không có lớp văn bản (trang scan và ảnh chèn) được xử lý bằng OCR ngay hôm nay; độ chính xác phụ thuộc vào chất lượng bản scan.Source: product pipeline
- File được bảo vệ bằng mật khẩu
- PDF mã hóa không thể phân tích; hãy gỡ mật khẩu trước khi tải lên.Source: ISO 32000-2 (PDF 2.0)
Ví dụ: NIST Cybersecurity Framework 2.0, trang 15· https://nvlpubs.nist.gov/nistpubs/CSWP/NIST.CSWP.29.pdf
## Appendix A. CSF Core This appendix describes the Functions, Categories, and Subcategories of the CSF Core. Table 1 lists the CSF 2.0 Core Function and Category names and unique alphabetic identifiers. Each Function name in the table is linked to its portion of the appendix. The order of Functions, Categories, and Subcategories of the Core is not alphabetical; it is intended to resonate most with those charged with operationalizing risk management within an organization. The numbering of the Subcategories is intentionally not sequential; gaps in numbering indicate CSF 1.1 Subcategories that were relocated in CSF 2.0. **Table 1. CSF 2.0 Core Function and Category names and identifiers** | Function | Category | Category Identifier || --- | --- | --- || **Govern (GV)** | Organizational Context | GV.OC || | Risk Management Strategy | GV.RM || | Roles, Responsibilities, and Authorities | GV.RR || | Policy | GV.PO || | Oversight | GV.OV || | Cybersecurity Supply Chain Risk Management | GV.SC || **Identify (ID)** | Asset Management | ID.AM || | Risk Assessment | ID.RA || | Improvement | ID.IM || **Protect (PR)** | Identity Management, Authentication, and Access Control | PR.AA || | Awareness and Training | PR.AT || | Data Security | PR.DS || | Platform Security | PR.PS || | Technology Infrastructure Resilience | PR.IR || **Detect (DE)** | Continuous Monitoring | DE.CM || | Adverse Event Analysis | DE.AE | Trường hợp sử dụng
PDF sang Markdown trong quy trình thực tế
Ghi chú nghiên cứu
Trích xuất một bài báo thành ghi chú có thể chỉnh sửa, xác minh các đoạn được trích dẫn và giữ tham chiếu PDF để xem lại sau.
Nạp báo cáo
Chuẩn bị báo cáo để chia đoạn, đồng thời giữ tiêu đề bảng, ngữ cảnh mục và liên kết đến tài liệu gốc.
Thư viện chính sách
Chuyển một chính sách đã xem xét thành văn bản tìm kiếm được và giữ PDF đã công bố làm phiên bản có thẩm quyền.
Đánh giá tài liệu
So sánh các PDF đại diện trước khi tự động hóa một tập, gồm bản scan, nhiều cột và một bảng khó.

API
API PDF sang Markdown
Dùng POST /v1/convert/pdf với header x-api-key và một file nguồn được hỗ trợ. Một yêu cầu đã hoàn tất có thể trả về đầu ra nội tuyến; HTTP 202 nghĩa là chuyển đổi vẫn đang chạy. Hãy đọc header phản hồi Location và thăm dò nó trước khi truy cập đầu ra file. Một yêu cầu multipart nhận tối đa 100 file; giới hạn của gói đăng ký và tổng yêu cầu cũng áp dụng. Hãy giữ khóa API trong môi trường máy chủ của bạn. Truy cập API cần một gói đăng ký Lite, Pro hoặc Max.
Đọc hướng dẫn APIcurl -i "https://api.markitdown.ai/v1/convert/pdf" \ -H "x-api-key: $MARKITDOWN_API_KEY" \ -F "file=@source.pdf"# If HTTP 202, GET the Location URL with the same API key.Hướng dẫn
Xem lại đầu ra
Hãy đối chiếu đầu ra PDF sang Markdown với PDF gốc trước khi dùng nó làm bằng chứng. Bắt đầu từ một trang có cột, chú thích và bảng thay vì một trang tiêu đề dễ. Đọc câu cuối của một cột và câu đầu của cột kế tiếp: chúng phải tạo thành cùng một trình tự mà một người theo trong PDF. Rồi so sánh một tiêu đề bảng, một giá trị âm và một đơn vị. Một bản xem trước Markdown dễ đọc vẫn có thể chứa một thay thế do OCR hoặc một ô bị đặt sai. Nếu tài liệu dẫn dắt một quyết định tài chính hay kỹ thuật, hãy giữ PDF bên cạnh Markdown và kiểm chứng đoạn bạn định trích dẫn. Chuyển đổi làm văn bản dễ làm việc hơn; nó không chứng nhận nguồn hay bản ghi lại của nguồn.
Những gì thay đổi
Chuyển PDF sang Markdown thay thế vị trí thị giác bằng một cấu trúc văn bản. Một tiêu đề lớn có thể trở thành dấu tiêu đề, đoạn văn trở thành đoạn văn, và một bảng được hỗ trợ trở thành các hàng phân tách bằng dấu sổ. Hình học trang, đường kẻ trang trí, lựa chọn phông và cách ngắt dòng gốc không nằm trong hợp đồng đầu ra. Điều này hữu ích khi bạn muốn chỉnh sửa một trích đoạn hoặc dựng một chỉ mục truy xuất, nhưng không phù hợp khi mục tiêu là tái tạo chính xác một tờ rơi. Hãy giữ PDF gốc cho bố cục có thẩm quyền của nó. Khi một bố cục không thể được biểu diễn bằng một bảng Markdown đơn giản, hãy kiểm tra xem một lời giải thích ngắn hay một bảng được xem xét thủ công có phải là bản trình bày hạ nguồn rõ ràng hơn không.
Nguồn cho RAG
Hãy dùng tiêu đề PDF và các tiêu đề mục có ý nghĩa để giữ ngữ cảnh khi chia Markdown thành các đoạn. Một đoạn chỉ có tiêu đề Kết quả có thể mơ hồ sau khi rời tài liệu; mã nạp dữ liệu của bạn có thể giữ tên tài liệu và tiêu đề cha cùng đoạn đó. Hãy giữ tiêu đề bảng cùng các hàng của nó và tránh cắt đôi một danh sách ngay giữa một điều kiện. Lưu tham chiếu PDF gốc riêng để một câu trả lời được truy xuất có thể dẫn người đọc về nguồn. LangChain và LlamaIndex có thể dùng văn bản từ quy trình nạp dữ liệu của chính bạn, nhưng việc chọn bộ chia, model nhúng và chính sách truy xuất vẫn là việc của ứng dụng bạn. Hãy thử truy xuất bằng những câu hỏi mà bạn đã kiểm chứng câu trả lời trong PDF.
Chọn PDF
Hãy ưu tiên bản xuất PDF gốc khi nó chứa văn bản đọc được. Ảnh chụp màn hình của PDF đó thêm một bước nhận dạng hình ảnh nữa và có thể làm mất các ký tự nhỏ trước khi chuyển đổi bắt đầu. Với PDF scan, hãy làm thẳng các trang bị xoay và dùng một phiên bản mà dấu câu cùng đường viền bảng còn đọc được ở mức thu phóng thường. Gỡ mật khẩu trước khi tải lên một PDF được mã hóa. Nếu chỉ một phần của một báo cáo dài là liên quan, hãy chuẩn bị các trang nguồn liên quan và giữ tham chiếu gốc của chúng trong ghi chú. Gửi lại cùng một bản scan hỏng khó có thể sửa được chi tiết bị thiếu; hãy cải thiện nguồn trước, rồi so sánh đầu ra PDF sang Markdown mới với kết quả trước đó.
Ranh giới đoạn
Chất lượng truy xuất phụ thuộc vào ranh giới đoạn khớp với tài liệu mà con người sẽ đọc. Công cụ này sắp xếp lại các cột và giữ cấp tiêu đề để bộ chia có thể phát ra các đoạn thay vì những mảnh xen kẽ từ một bài báo hai cột.
- Hãy dùng Markdown làm sản phẩm bạn chia đoạn và nhúng, không phải một đống văn bản bị làm phẳng.
- Trang tiêu chuẩn và trang OCR được tính ở mức 1 tín dụng mỗi trang trên các gói có đăng nhập.
- File được bảo vệ bằng mật khẩu phải được mở khóa trước khi tải lên; PDF mã hóa bị từ chối.
Thêm công cụ chuyển đổi Markdown
- Word → MarkdownDOCX với tiêu đề và danh sách
- PPT → MarkdownVăn bản slide, ghi chú và bảng
- Excel → MarkdownMỗi sheet thành một bảng
- Image → MarkdownOCR cho bản scan và ảnh chụp màn hình
- HTML → MarkdownDán hoặc tải HTML lên
- URL → MarkdownMọi trang web công khai, đã làm sạch
- Markdown → HTMLHTML sạch, ngữ nghĩa
- Markdown → TextVăn bản thuần không markup
- Markdown → PDFIn ra PDF cục bộ
Need it in your code? Use the developer API. Converting at scale? See plans and pricing.
FAQ
Câu hỏi về PDF sang Markdown
Chuyển PDF sang Markdown hoạt động thế nào?
Chuyển PDF sang Markdown biến nguồn được hỗ trợ thành Markdown dễ đọc để xem xét và tái sử dụng. Dùng thử ẩn danh nhận tối đa 10 MB và 25 trang mỗi file, với 3 lượt chuyển đổi mỗi IP mỗi giờ và 10 mỗi ngày. Hãy so kết quả với nguồn trước khi dùng.
Kích thước PDF tối đa là bao nhiêu?
Công cụ chuyển công khai nhận file PDF tối đa 10 MB. Lite hỗ trợ file tối đa 100 MB; Pro và Max có giới hạn cao hơn.
Nó có xử lý PDF scan không?
Có. PDF dạng hình ảnh được xử lý bằng OCR ngay hôm nay; bản scan sạch, độ phân giải cao cho kết quả tốt nhất.
Bài báo nghiên cứu nhiều cột có được xử lý không?
Có. Chuyển PDF sang Markdown cố gắng dựng lại thứ tự đọc. Hãy so các chuyển tiếp cột với nguồn, vì bố cục phức tạp vẫn có thể cần chỉnh sửa.
Bảng tài chính có sống sót không?
Bảng trong PDF mang metadata cấu trúc được chuyển thành bảng Markdown. Bảng bị làm phẳng thành ảnh cần OCR để khôi phục.
Tôi có thể chuyển PDF được bảo vệ bằng mật khẩu không?
Không. PDF mã hóa không thể phân tích. Hãy gỡ mật khẩu trước khi tải lên.
Đầu ra có đủ tốt để chia đoạn cho RAG không?
Markdown giữ tiêu đề, danh sách và bảng khi có thể để việc chia đoạn và nhúng vẫn dễ đoán hơn so với sao chép-dán.
Tôi có thể chuyển PDF từ mã không?
Có. Dùng khóa API để POST file thẳng tới /v1/convert/pdf và đọc Markdown trả về trong phản hồi. Xem /developers.
Chuyển PDF sang Markdown ở quy mô lớn.
Dùng thử miễn phí — không cần đăng ký.