Unlimited-OCR di Baidu: cosa significa elaborare documenti lunghi in un'unica pipeline
Il progetto open source Unlimited-OCR propone il parsing di immagini e PDF multipagina con un modello vision-language. Requisiti, promesse e controlli necessari.
Scritto da Daniel Vedovato · Revisionato il 22 luglio 2026
Articolo preparato con assistenza AI, verificato e revisionato da Daniel Vedovato.
Il punto non è leggere una pagina, ma mantenere il contesto del documento
Il repository open source Unlimited-OCR di Baidu si presenta come un progetto per il parsing OCR a lungo orizzonte. Invece di limitarsi a estrarre testo da un’immagine singola, documenta anche un flusso per più immagini e PDF: le pagine vengono convertite in immagini e passate insieme alla procedura infer_multi.
Questa promessa merita attenzione perché molti documenti reali non sono una fotografia isolata. Fatture, contratti, manuali, referti, report e archivi digitalizzati hanno tabelle che proseguono, intestazioni ripetute, note a piè pagina e riferimenti distribuiti su più pagine. Un OCR che conserva il contesto potrebbe ridurre il lavoro necessario per ricostruire una struttura dopo l’estrazione.
Non significa però che il modello trasformi automaticamente un PDF complesso in dati affidabili. Il repository fornisce codice e istruzioni di inferenza, non una certificazione di accuratezza per ogni lingua, layout o processo amministrativo. “One-shot long-horizon parsing” descrive una direzione tecnica, non un livello di qualità garantito.
Cosa offre concretamente il progetto
La fonte primaria dichiara supporto per inferenza con Transformers su GPU NVIDIA, per vLLM e per SGLang. Il README elenca un ambiente testato con Python 3.12.3, CUDA 12.9 e versioni specifiche di PyTorch, Transformers, Pillow, PyMuPDF e altre dipendenze. Il caricamento del modello usa trust_remote_code=True: una scelta pratica, ma da trattare con attenzione perché consente l’esecuzione del codice definito dal repository del modello.
Per una singola immagine sono documentate due configurazioni, chiamate gundam e base. Per il parsing multipagina il README usa la configurazione base, con una finestra di ripetizione più ampia. Nel flusso PDF, PyMuPDF trasforma ogni pagina in PNG, poi il modello riceve l’elenco delle immagini. Il limite di lunghezza mostrato negli esempi è 32.768.
| Elemento | Cosa dice la fonte | Cosa va ancora verificato |
|---|---|---|
| Input | Immagini, liste di immagini e PDF convertiti | Quali layout degradano il risultato |
| Runtime | Transformers, vLLM e SGLang | Compatibilità con l’infrastruttura propria |
| Output | Risultati salvati in una directory | Schema stabile e qualità dei campi estratti |
| Licenza | MIT nel repository | Licenze di pesi e dipendenze usate |
Perché PDF multipagina è un problema diverso
Il testo estratto non basta sempre. Un sistema documentale deve sapere se una cifra appartiene alla riga giusta, se una nota modifica una clausola precedente e se una tabella continua alla pagina successiva. Quando l’OCR spezza il contesto, un’applicazione successiva può collegare elementi incompatibili con risultati che sembrano plausibili ma sono errati.
Un modello vision-language può aiutare a interpretare struttura e testo insieme. Può anche introdurre errori diversi da quelli dell’OCR classico: una ricostruzione troppo sicura di una cella mancante, una normalizzazione non richiesta o un ordine dei contenuti non più fedele all’originale. Per documenti ad alto impatto, il file sorgente resta il riferimento e l’output deve essere tracciabile fino a pagina e regione di origine.
Prova pilota: cosa misurare
Un test utile non parte dal documento più sensibile. Si crea un set di PDF pubblici o sintetici con casi noti: testo semplice, colonne, tabelle, immagini, pagine inclinate e una tabella che attraversa due pagine. Per ogni caso si confronta l’output con una trascrizione di riferimento e si annotano sia gli errori di carattere sia quelli strutturali.
Le metriche possono essere semplici: percentuale di campi corretti, righe di tabella conservate, pagine processate al minuto, memoria GPU, costo per documento e numero di correzioni umane. È importante registrare i fallimenti. Un sistema che non sa quando è incerto può essere più rischioso di uno che restituisce meno testo ma conserva segnali di qualità.
Sicurezza, privacy e manutenzione
Un PDF può contenere dati personali, contratti, dati sanitari o segreti industriali. Prima di inviarlo a un servizio esterno o a un endpoint compatibile OpenAI, bisogna definire dove avviene l’inferenza, chi può leggere gli output e per quanto tempo restano nei log. Il codice di esempio crea directory temporanee per le pagine: anche questi file intermedi richiedono una politica di pulizia e permessi corretti.
Le dipendenze e i modelli cambiano rapidamente. Una prova riproducibile deve fissare versioni, immagine container, hardware e configurazione. Conviene anche verificare aggiornamenti di sicurezza e non usare trust_remote_code in ambienti con privilegi eccessivi senza revisione.
Unlimited-OCR è interessante perché rende visibile un flusso concreto per documenti lunghi e multipagina. Il suo valore reale dipende però da validazione per dominio: accuratezza sui documenti propri, controllo dei dati e possibilità di correggere ogni estrazione. Nessuna demo elimina questa fase.