转换器
URL 转 Markdown 转换器
URL 转 Markdown 是一款免费转换器,把公开可访问的网页变成干净、结构化的 Markdown,可直接用于 LLM、RAG 流程和笔记。试用无需注册;试用允许每个 IP 每小时 3 次转换、每天 10 次。
如何操作
如何把网页转成 Markdown
可以粘贴什么
- 任意公开的 http(s) 页面 —— 文章、文档、博客文章
- 需要登录或位于付费墙后的页面无法抓取
- 页面在我们的服务器上抓取,不会执行其 JavaScript
- 无需账号即可试用:单文件最大 10 MB、25 页,每小时 3 次、每天 10 次转换
需要检查什么
- 服务端抓取 —— 页面在服务端被抓取,然后像 HTML 文件一样被转换;无需浏览器插件或本地工具。
- 仅限公开页面 —— 位于身份验证、付费墙或登录墙之后的页面无法抓取。只支持公开可访问的 URL。
- 依赖 JavaScript 的页面 —— 严重依赖客户端 JavaScript 渲染内容的页面可能无法完整转换,因为抓取器接收的是初始的服务端渲染 HTML。
- 大小与身份 —— 抓取的页面受响应大小限制约束,过大时会被拒绝。抓取器的 user agent 记录在 /docs/fetcher。
Markdown 的去向
- 直接从预览中复制 Markdown
- 下载 .md 文件;登录后会保存到你的资料库
- 在 POST /v1/convert/url 上用 urls 数组一次转换多个页面
- 用 POST /v1/convert/url 和你的 API key 自动完成

为什么使用
为什么使用这款 URL 转 Markdown 转换器
网页是写给浏览器看的。Markdown 是写给人看、给模型读的。这款转换器保留承载含义的部分,丢掉它们周围的标记。
能留存下来的结构
标题、列表、链接、表格和代码块都以 Markdown 形式呈现,页面仍然像一个大纲一样可读。
抓取公开页面
文章、文档、博客和产品页。页面在服务端抓取——无需安装扩展或本地工具。
免费试用,无需登录
无需账号即可预览并复制 Markdown,每小时最多 3 次转换、每天 10 次。登录后可下载 .md 文件。
预览或原始源码
在把内容复制进提示词、笔记库或代码仓库前,在渲染后的 Markdown 和它的原始文本之间切换。
有礼、表明身份的抓取器
每次请求都会用有文档记录的 user agent 表明身份,站点所有者可以屏蔽它——见文档里的抓取器页面。
与 API 同一套引擎
本页的转换器和 POST /v1/convert/url 运行同一份代码,所以脚本每次调用最多可转换 20 个 URL。
问题所在
为什么在线页面对模型来说很嘈杂
页面很嘈杂
在线网页把内容埋在导航、广告、横幅和脚本之下。
标记很乱
手写和生成的 HTML 很少能干净地映射为可读结构。
AI 需要的是文章
RAG 和 agent 想要的是文章本身,而不是它周围的页面外壳——而且它们想要一个 URL,而不是手动保存。

保留什么
这款 URL 转换器抓取什么
- 服务端抓取
- 页面在服务端被抓取,然后像 HTML 文件一样被转换;无需浏览器插件或本地工具。Source: RFC 9110: HTTP Semantics
- 仅限公开页面
- 位于身份验证、付费墙或登录墙之后的页面无法抓取。只支持公开可访问的 URL。Source: RFC 9110: HTTP Semantics
- 依赖 JavaScript 的页面
- 严重依赖客户端 JavaScript 渲染内容的页面可能无法完整转换,因为抓取器接收的是初始的服务端渲染 HTML。Source: HTML Living Standard
- 大小与身份
- 抓取的页面受响应大小限制约束,过大时会被拒绝。抓取器的 user agent 记录在 /docs/fetcher。Source: product pipeline
示例:通过 URL 抓取 markitdown.ai 博客文章· https://markitdown.ai/blog/why-pdfs-break-llms
# Why PDFs break LLMs — and what clean Markdown fixes Jun 12, 2026 · The markitdown.ai team · 3 min read A PDF renders perfectly for a human and falls apart the moment a model reads it. The page you see — columns, tables, headers, footnotes — is a *visual* arrangement, not a logical one. When you pull raw text out of it, that visual order rarely survives, and whatever you feed a language model is only as good as the text it actually receives. ## What actually goes wrong When teams pipe documents straight into an LLM or a retrieval index, a few failure modes show up again and again: - **Reading order breaks.** Multi-column layouts interleave. A two-column page becomes "line 1 left, line 1 right, line 2 left, line 2 right…", so a sentence a human reads top-to-bottom arrives at the model scrambled.- **Tables collapse.** Copy-paste turns a table into a loose run of numbers. The relationship between a header and its cell — the entire point of a table — is gone.- **Headings disappear.** The visual hierarchy (this is a section, this is a subsection) is encoded as font size and weight, not structure. Strip the styling and you get one undifferentiated wall of text.- **Noise creeps in.** Page numbers, running headers, hyphenated line breaks, and stray ligatures end up inline, polluting prompts and embeddings alike. 使用场景
网页转 Markdown 的使用场景
从 AI agent 到内容迁移,把网页变成 Markdown 是许多工作流都依赖的一小步。
AI 与 LLM 流程
把文章和文档作为带完整标题的干净文本喂给 RAG 索引、agent 工具和提示词,而不是原始 HTML。
研究与笔记
把来源保存为 Markdown,用于引用、批注或留在 Obsidian 或笔记仓库里——原始链接依然在位。
内容团队
把文章和帮助中心页面从一个 CMS 迁到另一个,或把参考资料拉进基于 Markdown 的文档站。
开发者
在你已有的摄取任务和爬虫里调用 API,拿到与浏览器转换器显示的同一份 Markdown。

API
面向开发者的 URL 转 Markdown API
要从代码转换页面?把一个 URL——或 urls 数组里最多 20 个——发到带 API 密钥的 POST /v1/convert/url。页面在等待窗口内完成时,Markdown 会在同一个响应里返回;否则你会拿到一个可轮询的转换,或它尘埃落定时的一个 webhook。API 访问在付费套餐上提供。
阅读 API 指南curl -X POST https://api.markitdown.ai/v1/convert/url \ -H "x-api-key: mdai_…" \ -H "content-type: application/json" \ -d '{"url":"https://markitdown.ai/blog/why-pdfs-break-llms"}'指南
检查输出结果
把 URL 转 Markdown 的输出与你提交的公开页面对照。确认文章或文档文本存在,然后检查开头和结尾有没有导航、Cookie 提示和重复的页脚链接。转换器从服务器接收 HTML;它不执行页面应用去加载仅在 JavaScript 运行后才出现的内容。如果输出里除了一个导航外壳几乎什么都没有,就核实该页面是如何交付它的文章的。可读的导出仍可能包含正文之外的材料,所以在使用前先决定哪些内容属于你的笔记或检索索引。把来源 URL 与 Markdown 一起保留,让读者能回到原始页面。
保留来源上下文
在你自己的工作流里,把提交的 URL 和你的检索日期与 URL 转 Markdown 的结果一起保留。公开页面在你转换之后可能改动,后来的访客可能看到修改过的段落。API 的 metadata 字段可以携带你提供的上下文,但它不会自动从页面提取经过核实的作者身份或发布日期。如果你的研究需要这些事实,请在来源处核对。在引用一张表或一段话之前,先与页面对照,并保留足够的周边上下文以免改变含义。Markdown 让网页内容更易复用;它并不确立该页面是否准确,也不确立你是否有权转载它。
保存的 HTML 与 URL
当你已经拥有需要处理的确切页面快照时,选择 HTML 转换器。当公开可访问的地址就是本次转换的输入时,选择 URL 转 Markdown。这是两种相关但来源控制不同的工作流:保存的文件固定了你提交的输入,而 URL 则取决于网站在请求时返回什么。两条路径都不会绕过访问限制,也不保证移除广告。如果某个站点拒绝抓取器或要求登录,请使用你有授权通过合适工作流获取的材料。不要反复重试一个无法访问的 URL,仿佛再转换一次就能获得访问权限。
LLM 研究
研究者粘贴的是一个来源,而不是一个文件。这个转换器抓取你提交的 URL,转换服务端渲染的 HTML,并返回你可以引用、切分或放进笔记库的 Markdown。它不登录付费墙,也不执行页面的客户端 JavaScript。
- 只支持公开可访问的 URL。
- 抓取器会表明自身身份;运营方可以拒绝该 user agent——见 /docs/fetcher。
- 保存的 HTML 文件属于 /html-to-markdown,不属于这里。
更多 Markdown 转换器
- PDF → Markdown正文、表格与扫描件
- Word → Markdown保留标题与列表的 DOCX
- PPT → Markdown幻灯片文字、备注与表格
- Excel → Markdown每个工作表一张表
- Image → Markdown扫描件与截图的 OCR
- HTML → Markdown粘贴或上传 HTML
- Markdown → HTML干净、语义化的 HTML
- Markdown → Text去掉标记的纯文本
- Markdown → PDF本地打印为 PDF
Need it in your code? Use the developer API. Converting at scale? See plans and pricing.
FAQ
URL 转 Markdown 常见问题
URL 转 Markdown 是怎么工作的?
粘贴一个公开网页 URL。页面在服务端被抓取并解析成 Markdown——无需上传文件。
它会从在线页面里去掉广告和导航吗?
目前不能可靠地做到。当前转换器可能把导航、广告和页脚文字与正文一起保留。
抓取的页面有大小限制吗?
公开转换器对公开网页生效。抓取的页面受响应大小限制约束,过大时会被拒绝。
对登录后的页面有效吗?
无效。只支持公开可访问的 URL。位于身份验证、付费墙或登录墙之后的页面无法抓取。
依赖 JavaScript 渲染的页面呢?
转换器抓取初始的服务端渲染 HTML。依赖客户端 JavaScript 加载内容的页面可能无法完整转换。
可以一次转换多个 URL 吗?
把最多 20 个公开 URL 的 urls 数组发到 POST /v1/convert/url。逐个跟踪文件结果并处理异步响应。见 /developers。
URL 转 Markdown 免费吗?
免费。无需账号即可预览并复制 Markdown,每小时最多 3 次转换、每天 10 次;下载 .md 文件需要登录。仅限公开网页(不支持内网或私有 URL)。
转换器保留哪些内容?
标题、段落、列表、链接、表格和代码块都会变成 Markdown。脚本和样式会被丢弃。导航、页脚和广告仍可能出现在正文旁边。
有 URL 转换 API 吗?
有。可以通过 REST API 以 URL 编程转换网页。见 /developers。保存的 HTML 文件请改用 /html-to-markdown。