PageIndex: RAG documentale senza indice vettoriale, cosa verificare
PageIndex propone un indice gerarchico basato sulla struttura del documento. Vantaggi, limiti e test necessari prima di usarlo su documenti finanziari o normativi.
Scritto da Redazione Daniel Vedovato · Revisionato il 21 luglio 2026
Articolo preparato con assistenza AI, verificato e revisionato da Daniel Vedovato.
PageIndex è un progetto per retrieval documentale che propone un’alternativa alla segmentazione piatta con embedding e database vettoriale. Il repository descrive un indice costruito a partire dalla struttura del documento: capitoli, sezioni e relazioni gerarchiche diventano il percorso con cui un modello cerca il contesto. L’obiettivo è particolarmente rilevante per PDF lunghi, report, contratti e documenti dove titolo, gerarchia e tabelle portano informazione che un chunk isolato può perdere.
Non è però una scorciatoia per rendere affidabile un sistema RAG. Togliere il database vettoriale non toglie i problemi di parsing, aggiornamento, autorizzazioni e valutazione. Cambia il modo di recuperare contesto, e quindi richiede un confronto esplicito con l’indice usato oggi.
Perché la struttura può aiutare
In un RAG a chunk, una domanda su un’eccezione può recuperare il paragrafo che contiene una parola simile ma perdere la definizione poche pagine prima. Un indice gerarchico può prima individuare la sezione pertinente e poi restringere la lettura. Per documenti con un sommario affidabile, questo rende il percorso della risposta più comprensibile: non solo “quale pezzo di testo ha avuto embedding vicino”, ma “quale capitolo e quale sottosezione sostengono la risposta”.
Questo vantaggio dipende da una condizione: la struttura deve essere estratta bene. PDF scansionati, intestazioni ripetute, colonne, note e tabelle possono produrre una gerarchia falsa. Se il capitolo viene identificato male, un retrieval basato sulla struttura può essere elegantemente sbagliato.
Test prima dell’adozione
La prova corretta usa un corpus piccolo ma realistico, con documenti che contengono formati difficili. Prepara domande con risposta verificabile e indica quali pagine o sezioni sono attese. Poi confronta PageIndex con il sistema esistente usando lo stesso modello generativo, le stesse istruzioni e le stesse regole di citazione.
| Misura | Cosa osservare | Perché conta |
|---|---|---|
| Recall | la sezione giusta è recuperata? | senza fonte, la risposta non è difendibile |
| Fedeltà | la risposta segue il testo? | riduce affermazioni inventate |
| Citazione | pagina e sezione sono mostrate? | permette verifica umana |
| Latenza | tempo fino al contesto utile | determina l’esperienza utente |
| Aggiornamento | un documento sostituito sparisce? | evita risposte basate su versioni vecchie |
Per documenti finanziari o regolatori, aggiungi domande sui valori, sulle date e sulle eccezioni. Sono le aree dove un riassunto plausibile ma impreciso diventa un rischio concreto. La valutazione dovrebbe essere svolta anche da chi conosce il dominio, non soltanto da chi ha costruito l’indice.
Provenienza e autorizzazioni
Ogni record indicizzato deve mantenere URL o archivio di origine, data della versione, pagina, permesso di accesso e hash del contenuto. È essenziale quando una persona chiede perché l’assistente ha dato una risposta o quando un documento viene rettificato. Un indice ben fatto rende anche possibile cancellare in modo selettivo un file senza dover ricostruire tutto il corpus.
L’accesso deve essere applicato prima del retrieval, non dopo la generazione. Se un utente non può aprire una sezione, quella sezione non deve entrare nel contesto del modello. Restituire una risposta con un link non accessibile non è una protezione: parte dell’informazione può essere già stata esposta nel testo generato.
Limiti del modello di recupero
La ricerca gerarchica può essere meno efficace su raccolte di pagine brevi, documenti senza titoli affidabili o domande che collegano concetti dispersi. Un indice vettoriale può restare utile come segnale complementare. Non occorre scegliere un dogma architetturale: l’alternativa migliore è quella che migliora le risposte sul corpus e sul rischio effettivo.
Va considerato anche il costo del modello usato per costruire o navigare l’indice. Se il sistema chiama un LLM per molte fasi, la latenza e il costo possono crescere con dimensione e numero di documenti. Misura quindi il costo per domanda completa, compresi parsing, aggiornamento e controlli, non il solo tempo di ricerca.
Decisione operativa
PageIndex merita un pilota quando il team lavora con documenti lunghi e strutturati e fatica a mostrare una fonte precisa nelle risposte. Il successo non è una demo con una domanda facile. È una percentuale misurabile di risposte corrette, citabili e aggiornabili su casi reali.
Se il pilota non migliora recall, citazioni o manutenzione rispetto a un indice più semplice, non c’è motivo di aggiungere un componente. Se invece rende visibile il percorso dal documento alla risposta, può diventare una buona base per un assistente che deve spiegare le proprie fonti.