Convertitore

Convertire PDF in Markdown online

Convertire PDF in Markdown è un convertitore che ricostruisce l'ordine di lettura su più colonne in Markdown strutturato per il RAG ed è ideale per estrarre testo da PDF. La prova pubblica accetta file fino a 10 MB.

Non hai ancora convertito nessun documento
Carica un file per vedere qui il Markdown pulito.
Descrizione immagine con IA OCR ad alta precisione Accedi per usare i miglioramenti

Prova un file prima di scegliere un piano.

  • Senza account: fino a 10 MB e 25 pagine per file, 3 conversioni all'ora e 10 al giorno, con anteprima e copia nel browser.
  • Con accesso: 20 conversioni gratuite al giorno, salvate nella tua libreria.
  • Lite, Pro e Max includono crediti di conversione, elaborazione in batch, accesso API e cronologia salvata. Lite include 30 giorni di cronologia.

Come si fa

Come convertire PDF in Markdown

Cosa puoi caricare

  • Tipi di file: .pdf
  • Provalo senza account: fino a 10 MB e 25 pagine per file, 3 conversioni all'ora e 10 al giorno
  • Lite supporta file fino a 100 MB e Pro fino a 200 MB
  • Max non ha limiti di dimensione per file; le conversioni sono limitate dai crediti
Convertire PDF in Markdown: pagina PDF a due colonne diventa titoli Markdown e una tabella

Perché usarlo

Perché usare PDF in Markdown

Report come testo leggibile

Trasforma i paragrafi e la struttura supportata di un report in Markdown che puoi ispezionare, modificare e conservare accanto al PDF di origine.

OCR per pagine scansionate

Le pagine di sole immagini possono essere riconosciute con l'OCR. Confronta testo piccolo, punteggiatura e tabelle numeriche con la scansione originale.

Contesto dei titoli

Conserva sezioni riconoscibili per appunti e flussi di recupero, verificando al tempo stesso se i titoli formattati visivamente sono stati interpretati correttamente.

Tabelle da rivedere

Le tabelle supportate diventano tabelle di testo. Controlla le celle complesse o unite prima di trattare i valori esportati come prova.

Anteprima prima del riutilizzo

Confronta il sorgente Markdown con la sua resa prima di copiare un passaggio in ChatGPT, Claude o un repository di documentazione.

Una rotta API ripetibile

Usa la rotta di conversione PDF in uno script di ingestione dopo aver revisionato in browser risultati rappresentativi.

Il problema

Perché le colonne di un PDF spezzano i modelli linguistici

Le colonne si interlacciano

Un report a due colonne letto dall'alto verso il basso mescola il flusso di sinistra e quello di destra, così il modello vede una frase che non è mai esistita nella pagina.

Le tabelle perdono la griglia

Copiare e incollare da un PDF trasforma una tabella di risultati in una sequenza di numeri senza riga di intestazione per un parser a valle.

Le scansioni non hanno livello di testo

Le pagine solo immagine contengono pixel, non glifi, quindi oggi i PDF scansionati vengono elaborati con l'OCR.

PDF in Markdown: testo incollato in modo confuso accanto a una struttura Markdown pulita

Cosa viene conservato

Cosa conserva questo convertitore di PDF

Ricostruzione dell'ordine di lettura
La conversione PDF tenta di ricostruire un ordine di lettura logico. Confronta i passaggi tra le colonne con l'originale, soprattutto per report e articoli complessi.Source: ISO 32000-2 (PDF 2.0)
Tabelle e titoli
I livelli dei titoli e i dati tabellari vengono conservati dove il PDF espone metadati strutturali; i PDF di solo testo producono un output di solo testo.Source: CommonMark Spec
PDF scansionati e solo immagine
I PDF senza livello di testo (pagine scansionate e immagini inserite) vengono elaborati oggi con l'OCR; la precisione dipende dalla qualità della scansione.Source: product pipeline
File protetti da password
I PDF cifrati non possono essere analizzati; rimuovi la password prima di caricarli.Source: ISO 32000-2 (PDF 2.0)

Esempio: NIST Cybersecurity Framework 2.0, pagina 15· https://nvlpubs.nist.gov/nistpubs/CSWP/NIST.CSWP.29.pdf

## Appendix A. CSF Core This appendix describes the Functions, Categories, and Subcategories of the CSF Core. Table 1 lists the CSF 2.0 Core Function and Category names and unique alphabetic identifiers. Each Function name in the table is linked to its portion of the appendix. The order of Functions, Categories, and Subcategories of the Core is not alphabetical; it is intended to resonate most with those charged with operationalizing risk management within an organization. The numbering of the Subcategories is intentionally not sequential; gaps in numbering indicate CSF 1.1 Subcategories that were relocated in CSF 2.0. **Table 1. CSF 2.0 Core Function and Category names and identifiers** |  Function | Category | Category Identifier  || --- | --- | --- ||  **Govern (GV)** | Organizational Context | GV.OC  ||   |  Risk Management Strategy | GV.RM  ||   |  Roles, Responsibilities, and Authorities | GV.RR  ||   |  Policy | GV.PO  ||   |  Oversight | GV.OV  ||   |  Cybersecurity Supply Chain Risk Management | GV.SC  ||  **Identify (ID)** | Asset Management | ID.AM  ||   |  Risk Assessment | ID.RA  ||   |  Improvement | ID.IM  ||  **Protect (PR)** | Identity Management, Authentication, and Access Control | PR.AA  ||   |  Awareness and Training | PR.AT  ||   |  Data Security | PR.DS  ||   |  Platform Security | PR.PS  ||   |  Technology Infrastructure Resilience | PR.IR  ||  **Detect (DE)** | Continuous Monitoring | DE.CM  ||   |  Adverse Event Analysis | DE.AE  | 

Casi d'uso

PDF in Markdown nei flussi di lavoro reali

Note di ricerca

Estrai un articolo in note modificabili, verifica i passaggi citati e conserva il riferimento PDF per una revisione successiva.

Ingestione di report

Prepara i report per la suddivisione in blocchi conservando intestazioni di tabella, contesto di sezione e un link al documento originale.

Biblioteche di policy

Converti una policy revisionata in testo ricercabile e conserva il PDF pubblicato come versione autorevole.

Valutazione di documenti

Confronta PDF rappresentativi prima di automatizzare una raccolta, incluse scansioni, colonne e una tabella difficile.

Estrarre testo da PDF: online nel browser, un file Markdown alimenta indice RAG, prompt e note

API

PDF in Markdown API

Usa POST /v1/convert/pdf con un'intestazione x-api-key e un file di origine supportato. Una richiesta completata può restituire gli output in linea; un HTTP 202 significa che la conversione è ancora in corso. Leggi l'intestazione Location della risposta e interrogala prima di accedere ai file di output. Una richiesta multipart accetta al massimo 100 file; si applicano anche i limiti di abbonamento e di richieste totali. Conserva le chiavi API nell'ambiente del tuo server. L'accesso all'API richiede un abbonamento Lite, Pro o Max.

Leggi la guida API
curl -i "https://api.markitdown.ai/v1/convert/pdf" \  -H "x-api-key: $MARKITDOWN_API_KEY" \  -F "file=@source.pdf"# If HTTP 202, GET the Location URL with the same API key.

Rivedere il risultato

Controlla il risultato di PDF in Markdown rispetto al PDF originale prima di usarlo come prova. Inizia da una pagina con colonne, una nota a piè di pagina e una tabella invece di una semplice copertina. Leggi l'ultima frase di una colonna e la prima di quella successiva: dovrebbero formare la stessa sequenza che una persona segue nel PDF. Poi confronta un'intestazione di tabella, un valore negativo e un'unità. Un'anteprima Markdown leggibile può comunque contenere una sostituzione OCR o una cella fuori posto. Se il documento orienta una decisione finanziaria o tecnica, conserva il PDF accanto al Markdown e verifica il passaggio che intendi citare. La conversione semplifica il lavoro sul testo; non certifica la fonte né la sua trascrizione.

Cosa cambia con Convertire PDF in Markdown

Convertire PDF in Markdown sostituisce il posizionamento visivo con una struttura testuale. Un titolo grande può diventare un indicatore di titolo, i paragrafi restano paragrafi e una tabella supportata diventa righe separate da pipe. La geometria della pagina, le righe decorative, la scelta dei font e l'originale ritorno a capo non fanno parte del contratto di output. È utile quando vuoi modificare un estratto o costruire un indice di recupero, ma non è adatto quando l'obiettivo è riprodurre esattamente un opuscolo. Conserva il PDF originale per il suo layout autorevole. Quando un layout non può essere rappresentato con una semplice tabella Markdown, valuta se una breve spiegazione o una tabella rivista a mano sia la rappresentazione a valle più chiara.

Fonti per RAG

Usa il titolo del PDF e titoli di sezione significativi per conservare il contesto quando dividi il Markdown in passaggi. Un blocco intitolato solo Risultati può risultare ambiguo quando esce dal documento; il tuo codice di ingestione può conservare il nome del documento e il titolo padre insieme a quel passaggio. Mantieni un'intestazione di tabella insieme alle sue righe ed evita di spezzare un elenco a metà di una condizione. Archivia separatamente il riferimento al PDF originale, così una risposta recuperata può riportare il lettore alla fonte. LangChain e LlamaIndex possono consumare il testo dal tuo processo di ingestione, ma scegliere lo splitter, il modello di embedding e la policy di recupero resta compito della tua applicazione. Prova il recupero con domande le cui risposte hai verificato nel PDF.

Scegliere il PDF

Preferisci il PDF originale esportato quando contiene testo leggibile. Uno screenshot di quel PDF aggiunge un ulteriore passaggio di riconoscimento dell'immagine e può perdere caratteri piccoli prima che inizi la conversione. Per i PDF scansionati, raddrizza le pagine ruotate e usa una versione in cui punteggiatura e bordi delle tabelle restino leggibili a uno zoom normale. Rimuovi la password prima di caricare un PDF cifrato. Se solo una parte di un lungo report è rilevante, prepara le pagine di origine pertinenti e conserva il loro riferimento originale nei tuoi appunti. Ripetere la stessa scansione danneggiata difficilmente correggerà il dettaglio mancante; migliora prima la fonte, poi confronta il nuovo output di PDF in Markdown con il risultato precedente.

Confini dei chunk

La qualità del recupero dipende da confini dei chunk che corrispondano al documento che leggerebbe una persona. Questo convertitore riordina le colonne e conserva i livelli dei titoli, così uno splitter può produrre passaggi invece di frammenti interlacciati di un articolo a due colonne.

  • Usa il Markdown come artefatto da suddividere e indicizzare, non come un dump di testo appiattito.
  • Le pagine standard e le pagine OCR vengono fatturate a 1 credito per pagina nei piani con accesso effettuato.
  • I file protetti da password devono essere sbloccati prima del caricamento; i PDF cifrati vengono rifiutati.

FAQ

Domande su Convertire PDF in Markdown

Come funziona Convertire PDF in Markdown?

Convertire PDF in Markdown trasforma la fonte supportata in Markdown leggibile da rivedere e riutilizzare. La prova anonima accetta fino a 10 MB e 25 pagine per file, con 3 conversioni per IP all'ora e 10 al giorno. Confronta il risultato con la fonte prima di usarlo.

Qual è la dimensione massima di un PDF?

Il convertitore pubblico accetta file PDF fino a 10 MB. Lite supporta file fino a 100 MB; Pro e Max hanno limiti più alti.

Gestisce i PDF scansionati?

Sì. I PDF basati su immagine vengono elaborati oggi con l'OCR; le scansioni nitide e ad alta risoluzione danno i risultati migliori.

Gli articoli di ricerca su più colonne sono gestiti?

Sì. Convertire PDF in Markdown tenta di ricostruire l'ordine di lettura. Confronta i passaggi tra le colonne con la fonte, perché i layout complessi possono comunque richiedere correzioni.

Le tabelle finanziarie sopravvivono?

Le tabelle nei PDF che contengono metadati strutturali vengono convertite in tabelle Markdown. Le tabelle in immagine appiattita richiedono l'OCR per essere recuperate.

Posso convertire PDF protetti da password?

No. I PDF cifrati non possono essere analizzati. Rimuovi la password prima di caricarli.

L'output è abbastanza buono per essere suddiviso per il RAG?

Il Markdown conserva titoli, elenchi e tabelle dove possibile, così la suddivisione in chunk e l'indicizzazione restano prevedibili rispetto a copiare e incollare.

Posso convertire PDF dal codice?

Sì. Usa una chiave API per inviare il file direttamente a /v1/convert/pdf e leggere il Markdown nella risposta. Vedi /developers.

Converti PDF in Markdown su larga scala.

Provalo gratis: non serve registrarsi.