I motori di ricerca basati su IA possono sembrare sicuri pur citando fonti interrotte o di bassa qualità, dimostra un rapido test
Un semplice controllo della provenienza su tre popolari strumenti di ricerca basati su IA ha rivelato che due di essi puntavano a link interrotti o supportavano le proprie risposte con siti di scarsa credibilità, nonostante tutti e tre mostrassero lo stesso tono sicuro e una serie di "chip" delle fonti.
Il test che ha scatenato la sorpresa
Ho posto una domanda fattuale e recente: “Cosa è cambiato nell'EU AI Act nel 2026?” La risposta esiste nel testo ufficiale dell'emendamento, quindi o c'è o non c'è. Ho sottoposto la query a tre motori di ricerca IA che mostrano citazioni: Perplexity, la modalità IA di Google e Brave Search.
Tutti e tre hanno restituito fatti identici — stesse date, stessa descrizione — quindi si sono pareggiati sulla pura correttezza. La divergenza è emersa solo quando ho esaminato le fonti citate.
Come ho valutato la qualità delle fonti
Ho creato un sistema di punteggio a tre livelli che pesa ogni citazione in base al tipo di host:
- Primaria (peso 3) – il sito che pubblica effettivamente la legge (ad es. il registro ufficiale dell'UE).
- Ufficiale (peso 2) – l'istituzione che emana o supervisiona la legge (domini governativi, siti di agenzie).
- Contenuti generati dagli utenti (UGC, peso 0) – piattaforme come YouTube o Reddit.
Il punteggio complessivo di ogni motore è la media del peso degli URL visualizzati.
| Motore | Fonti riportate | Punteggio |
|---|---|---|
| Perplexity | Domini governativi ufficiali | 2.00 |
| Google AI mode | Società di consulenza e un video YouTube | 1.00 |
| Brave Search | Fonte primaria | 3.00 |
Sulla carta Brave sembrava perfetto, Perplexity era discreto e Google restava indietro.
Il fallimento nascosto: link interrotti
La mappa dei livelli considera solo il nome del dominio; non verifica se la pagina collegata si carichi effettivamente. Ho seguito ogni URL. La citazione "primaria" di Brave ha restituito un corpo vuoto: il link era interrotto. Il motore sosteneva di puntare alla legge, ma non ha fornito nulla.
Perplexity ha utilizzato domini governativi ufficiali.
Google ha utilizzato società di consulenza e un video YouTube.
Sono emersi due problemi distinti:
- Un dominio di alta qualità non garantisce una pagina raggiungibile.
- Un riassunto ben scritto può essere supportato da fonti di scarsa credibilità.
L'interfaccia utente nasconde entrambi i problemi. Tutti e tre gli strumenti presentano lo stesso paragrafo sicuro e una riga uniforme di chip delle fonti, senza alcun segnale visivo che un chip rimandi a una pagina interrotta o che un altro punti a un tutorial di YouTube invece che al testo normativo.
Perché la provenienza è importante per gli sviluppatori
Gli sviluppatori possono trasformare la provenienza in una metrica testabile:
- Assegnare un punteggio a ogni risposta utilizzando una ponderazione a livelli simile a quella sopra indicata.
- Validare lo stato dei link automaticamente; segnalare risposte vuote o errori HTTP.
- Attivare avvisi quando il punteggio di provenienza di una risposta scende al di sotto di una soglia configurabile.
Questo approccio è più concreto rispetto alla caccia alle "allucinazioni": il modello può generare una frase plausibile, ma il controllo della provenienza ti dice esattamente quale citazione (o la sua mancanza) ha causato il problema, permettendo una correzione mirata.
Conclusione
Un breve test di provenienza dimostra che i motori di ricerca IA possono apparire autorevoli pur citando fonti interrotte o di bassa qualità. Gli sviluppatori che si affidano a questi motori dovrebbero trattare la qualità delle citazioni come una proprietà misurabile, non come una garanzia implicita, e integrare controlli automatizzati nelle proprie pipeline. Verificare che una fonte "primaria" si carichi effettivamente può fare la differenza tra una risposta affidabile e una silenziosa trappola di disinformazione.
