转换器

URL 转 Markdown 转换器

URL 转 Markdown 是一款免费转换器,把公开可访问的网页变成干净、结构化的 Markdown,可直接用于 LLM、RAG 流程和笔记。试用无需注册;试用允许每个 IP 每小时 3 次转换、每天 10 次。

还没有转换任何页面
在上方粘贴 URL 并点击转换。Markdown 会显示在这里。

如何操作

如何把网页转成 Markdown

可以粘贴什么

  • 任意公开的 http(s) 页面 —— 文章、文档、博客文章
  • 需要登录或位于付费墙后的页面无法抓取
  • 页面在我们的服务器上抓取,不会执行其 JavaScript
  • 无需账号即可试用:单文件最大 10 MB、25 页,每小时 3 次、每天 10 次转换
URL 转 Markdown 转换器:把网页 URL 转成 Markdown 窗口

为什么使用

为什么使用这款 URL 转 Markdown 转换器

网页是写给浏览器看的。Markdown 是写给人看、给模型读的。这款转换器保留承载含义的部分,丢掉它们周围的标记。

能留存下来的结构

标题、列表、链接、表格和代码块都以 Markdown 形式呈现,页面仍然像一个大纲一样可读。

抓取公开页面

文章、文档、博客和产品页。页面在服务端抓取——无需安装扩展或本地工具。

免费试用,无需登录

无需账号即可预览并复制 Markdown,每小时最多 3 次转换、每天 10 次。登录后可下载 .md 文件。

预览或原始源码

在把内容复制进提示词、笔记库或代码仓库前,在渲染后的 Markdown 和它的原始文本之间切换。

有礼、表明身份的抓取器

每次请求都会用有文档记录的 user agent 表明身份,站点所有者可以屏蔽它——见文档里的抓取器页面。

与 API 同一套引擎

本页的转换器和 POST /v1/convert/url 运行同一份代码,所以脚本每次调用最多可转换 20 个 URL。

问题所在

为什么在线页面对模型来说很嘈杂

页面很嘈杂

在线网页把内容埋在导航、广告、横幅和脚本之下。

标记很乱

手写和生成的 HTML 很少能干净地映射为可读结构。

AI 需要的是文章

RAG 和 agent 想要的是文章本身,而不是它周围的页面外壳——而且它们想要一个 URL,而不是手动保存。

网页转 Markdown:复制粘贴后的错乱文本与干净的 Markdown 结构对比

保留什么

这款 URL 转换器抓取什么

服务端抓取
页面在服务端被抓取,然后像 HTML 文件一样被转换;无需浏览器插件或本地工具。Source: RFC 9110: HTTP Semantics
仅限公开页面
位于身份验证、付费墙或登录墙之后的页面无法抓取。只支持公开可访问的 URL。Source: RFC 9110: HTTP Semantics
依赖 JavaScript 的页面
严重依赖客户端 JavaScript 渲染内容的页面可能无法完整转换,因为抓取器接收的是初始的服务端渲染 HTML。Source: HTML Living Standard
大小与身份
抓取的页面受响应大小限制约束,过大时会被拒绝。抓取器的 user agent 记录在 /docs/fetcher。Source: product pipeline

示例:通过 URL 抓取 markitdown.ai 博客文章· https://markitdown.ai/blog/why-pdfs-break-llms

# Why PDFs break LLMs — and what clean Markdown fixes Jun 12, 2026 · The markitdown.ai team · 3 min read A PDF renders perfectly for a human and falls apart the moment a model reads it. The page you see — columns, tables, headers, footnotes — is a *visual* arrangement, not a logical one. When you pull raw text out of it, that visual order rarely survives, and whatever you feed a language model is only as good as the text it actually receives. ## What actually goes wrong When teams pipe documents straight into an LLM or a retrieval index, a few failure modes show up again and again: - **Reading order breaks.** Multi-column layouts interleave. A two-column page becomes "line 1 left, line 1 right, line 2 left, line 2 right…", so a sentence a human reads top-to-bottom arrives at the model scrambled.- **Tables collapse.** Copy-paste turns a table into a loose run of numbers. The relationship between a header and its cell — the entire point of a table — is gone.- **Headings disappear.** The visual hierarchy (this is a section, this is a subsection) is encoded as font size and weight, not structure. Strip the styling and you get one undifferentiated wall of text.- **Noise creeps in.** Page numbers, running headers, hyphenated line breaks, and stray ligatures end up inline, polluting prompts and embeddings alike. 

使用场景

网页转 Markdown 的使用场景

从 AI agent 到内容迁移,把网页变成 Markdown 是许多工作流都依赖的一小步。

AI 与 LLM 流程

把文章和文档作为带完整标题的干净文本喂给 RAG 索引、agent 工具和提示词,而不是原始 HTML。

研究与笔记

把来源保存为 Markdown,用于引用、批注或留在 Obsidian 或笔记仓库里——原始链接依然在位。

内容团队

把文章和帮助中心页面从一个 CMS 迁到另一个,或把参考资料拉进基于 Markdown 的文档站。

开发者

在你已有的摄取任务和爬虫里调用 API,拿到与浏览器转换器显示的同一份 Markdown。

网站转 Markdown:把一个 Markdown 文件接入 RAG 索引、提示词和笔记

API

面向开发者的 URL 转 Markdown API

要从代码转换页面?把一个 URL——或 urls 数组里最多 20 个——发到带 API 密钥的 POST /v1/convert/url。页面在等待窗口内完成时,Markdown 会在同一个响应里返回;否则你会拿到一个可轮询的转换,或它尘埃落定时的一个 webhook。API 访问在付费套餐上提供。

阅读 API 指南
curl -X POST https://api.markitdown.ai/v1/convert/url \  -H "x-api-key: mdai_…" \  -H "content-type: application/json" \  -d '{"url":"https://markitdown.ai/blog/why-pdfs-break-llms"}'

检查输出结果

把 URL 转 Markdown 的输出与你提交的公开页面对照。确认文章或文档文本存在,然后检查开头和结尾有没有导航、Cookie 提示和重复的页脚链接。转换器从服务器接收 HTML;它不执行页面应用去加载仅在 JavaScript 运行后才出现的内容。如果输出里除了一个导航外壳几乎什么都没有,就核实该页面是如何交付它的文章的。可读的导出仍可能包含正文之外的材料,所以在使用前先决定哪些内容属于你的笔记或检索索引。把来源 URL 与 Markdown 一起保留,让读者能回到原始页面。

保留来源上下文

在你自己的工作流里,把提交的 URL 和你的检索日期与 URL 转 Markdown 的结果一起保留。公开页面在你转换之后可能改动,后来的访客可能看到修改过的段落。API 的 metadata 字段可以携带你提供的上下文,但它不会自动从页面提取经过核实的作者身份或发布日期。如果你的研究需要这些事实,请在来源处核对。在引用一张表或一段话之前,先与页面对照,并保留足够的周边上下文以免改变含义。Markdown 让网页内容更易复用;它并不确立该页面是否准确,也不确立你是否有权转载它。

保存的 HTML 与 URL

当你已经拥有需要处理的确切页面快照时,选择 HTML 转换器。当公开可访问的地址就是本次转换的输入时,选择 URL 转 Markdown。这是两种相关但来源控制不同的工作流:保存的文件固定了你提交的输入,而 URL 则取决于网站在请求时返回什么。两条路径都不会绕过访问限制,也不保证移除广告。如果某个站点拒绝抓取器或要求登录,请使用你有授权通过合适工作流获取的材料。不要反复重试一个无法访问的 URL,仿佛再转换一次就能获得访问权限。

LLM 研究

研究者粘贴的是一个来源,而不是一个文件。这个转换器抓取你提交的 URL,转换服务端渲染的 HTML,并返回你可以引用、切分或放进笔记库的 Markdown。它不登录付费墙,也不执行页面的客户端 JavaScript。

  • 只支持公开可访问的 URL。
  • 抓取器会表明自身身份;运营方可以拒绝该 user agent——见 /docs/fetcher。
  • 保存的 HTML 文件属于 /html-to-markdown,不属于这里。

FAQ

URL 转 Markdown 常见问题

URL 转 Markdown 是怎么工作的?

粘贴一个公开网页 URL。页面在服务端被抓取并解析成 Markdown——无需上传文件。

它会从在线页面里去掉广告和导航吗?

目前不能可靠地做到。当前转换器可能把导航、广告和页脚文字与正文一起保留。

抓取的页面有大小限制吗?

公开转换器对公开网页生效。抓取的页面受响应大小限制约束,过大时会被拒绝。

对登录后的页面有效吗?

无效。只支持公开可访问的 URL。位于身份验证、付费墙或登录墙之后的页面无法抓取。

依赖 JavaScript 渲染的页面呢?

转换器抓取初始的服务端渲染 HTML。依赖客户端 JavaScript 加载内容的页面可能无法完整转换。

可以一次转换多个 URL 吗?

把最多 20 个公开 URL 的 urls 数组发到 POST /v1/convert/url。逐个跟踪文件结果并处理异步响应。见 /developers。

URL 转 Markdown 免费吗?

免费。无需账号即可预览并复制 Markdown,每小时最多 3 次转换、每天 10 次;下载 .md 文件需要登录。仅限公开网页(不支持内网或私有 URL)。

转换器保留哪些内容?

标题、段落、列表、链接、表格和代码块都会变成 Markdown。脚本和样式会被丢弃。导航、页脚和广告仍可能出现在正文旁边。

有 URL 转换 API 吗?

有。可以通过 REST API 以 URL 编程转换网页。见 /developers。保存的 HTML 文件请改用 /html-to-markdown。

大规模将 URL 转换为 Markdown。

免费试用——无需注册。