Azienda

Ricerca agentica. Risultati più accurati ed efficienti dai suoi sistemi di IA.

August 20, 2026

By Mistral

Summary

Mistral Agentic Search offre risultati di ricerca più accurati riducendo turni, uso di token e latenza sui benchmark FinanceBench e OfficeQA Pro. Agentic Search è il layer di retrieval che consente ai sistemi di AI di navigare, leggere e verificare le informazioni anche all’interno dei documenti più complessi. Disponibile tramite Mistral Search Toolkit e Librerie.

Mistral Agentic Search aiuta le aziende a ottenere risultati migliori dai loro sistemi di AI consentendo ai modelli di cercare e navigare nei dati e nei documenti più complessi dell’organizzazione. Agentic Search introduce un ciclo di retrieval multi-step per trovare, ispezionare e verificare informazioni tra diverse fonti di dati, ovunque siano archiviate. Agentic Search è disponibile tramite Mistral Search Toolkit, integrato in Libraries sia in Studio sia in Vibe, e offre:

  • Supporto per dati sensibili specifici del dominio. Gli strumenti portabili e aperti di Mistral aiutano a liberare valore dai dati senza oltrepassare i confini di isolamento nel cloud o on-premises.

  • Risultati di ricerca migliorati. I modelli possono cercare e navigare nei dati oltre i chunk recuperati, all’interno di documenti lunghi e densi o tra più fonti.

  • Accesso agli indici esistenti. Agentic Search si basa sull’indice di ricerca esistente utilizzando cinque strumenti: search, open, navigate, read e grep.

  • Maggiore accuratezza. Agentic Search raggiunge fino a 3 volte la correttezza sui documenti finanziari, passando dal 26,7% all’86%, secondo FinanceBench. Sulle domande OfficeQA Pro con molte tabelle e più documenti, misuriamo un incremento di +45,6 punti (dal 6,3% al 51,9%).

  • Minore latenza e utilizzo dei token. La navigazione mirata consente ad Agentic Search di ridurre la latenza p90 fino al 39,6%. Meno ricerche ripetute riducono il consumo di token fino a un terzo. 

I dati creano vantaggio competitivo

Il vantaggio competitivo si costruisce su anni di operazioni reali: i Suoi dati, i Suoi processi e la Sua competenza di dominio. La conoscenza proprietaria è al tempo stesso critica per il successo e altamente riservata: per questo risiede dietro confini di isolamento, deployment segmentati e piattaforme self-hosted. Si accumula in documenti finanziari, contratti legali, risorse interne e registri governativi: documenti lunghi e densi che i metodi di ricerca tradizionali non riescono a navigare in modo efficace. 

Gli agent che apprendono e migliorano continuamente possono aiutare a consolidare il vantaggio competitivo, ma spesso sono separati dai dati riservati e dalla conoscenza proprietaria per motivi di sicurezza. Ottenere un impatto reale dall’AI significa combinare un ragionamento all’avanguardia con strumenti di retrieval capaci di raggiungere in sicurezza i materiali più sensibili. 

Il RAG tradizionale non è sufficiente

Il RAG tradizionale one-shot recupera un insieme fisso di chunk di testo e chiede a un modello di rispondere in un singolo passaggio. Funziona quando la risposta compare in uno dei risultati principali, ma mostra limiti quando il modello deve navigare un report lungo, seguire riferimenti, confrontare più documenti o verificare le evidenze sottostanti.

Il limite è più marcato su dati e documenti densi e complessi. Le informazioni necessarie per rispondere a una domanda possono essere distribuite tra documenti o nascoste in una specifica tabella, nota a piè di pagina o clausola. La ricerca basata su RAG one-shot non riesce a sfruttare tutta la potenza dell’AI all’avanguardia né a fornire risposte affidabili per tre ragioni:

  • Retrieval senza ragionamento: Il modello deve rispondere a partire dai chunk selezionati durante il retrieval iniziale, anche quando sono incompleti o non pertinenti. Non può decidere di avere bisogno di un documento diverso, di un’altra sezione o di più contesto prima di rispondere, il che limita l’impatto del ragionamento del modello. 

  • Limite a livello di chunk: I dati critici sono spesso contenuti in documenti multimodali complessi. Alla domanda “Qual era l’aliquota fiscale effettiva dell’azienda nel Q3?” un indice può trovare il documento corretto ma non può aprirlo, navigare fino alla tabella, leggere il contesto circostante o verificare la risposta.  

  • Nessuna iterazione: Molte domande richiedono più di un passaggio di retrieval per ottenere la risposta corretta. Il modello potrebbe dover affinare la ricerca, ispezionare un documento promettente, seguire un riferimento, confrontare più fonti, tenere traccia di ciò che ha visto e provare un nuovo percorso quando i primi risultati sono insufficienti. Il RAG one-shot non offre un modo per compiere questi passaggi successivi.

Without Agentic Search (one-shot retrieval)

Using specifically only the reported values for all individual calendar months in 1953, what is the total sum of these values of expenditures for U.S. national defense and associated activities (in millions of nominal dollars)?

Trajectory 1 tool_call (search only)

search("national defense expenditures monthly 1953") → 10 hits: a scatter of monthly bulletins (Table 3), each framed fiscal-year, covering only part of 1953.

I found January–June 1953 data. But I need July–December 1953 monthly values to compute an answer.

With Agentic Search

Using specifically only the reported values for all individual calendar months in 1953, what is the total sum of these values of expenditures for U.S. national defense and associated activities (in millions of nominal dollars)?

Trajectory 3 tool_calls (2× search → read)

search("national defense expenditures monthly 1953") → per-month bulletins (partial year)

search("…1953 November December 1954 to date") → surfaces treasury_bulletin_1954_02.pdfp.15 (Table 3, all 12 months of 1953)

read(treasury_bulletin_1954_02.pdf, p.15) → pulls the complete Table 3

Monthly Values for 1953

Table 3, in $millions

JanFebMarAprMayJunJulAugSepOctNovDec
3,6323,5013,7893,8913,7464,0563,8903,5193,7873,6473,5403,465

Sum = 44,463.

Come funziona Agentic Search

Mistral Search Toolkit fornisce moduli aperti per ingerire, creare embedding e indicizzare dati critici e complessi nel cloud o on-premises. Agentic Search si basa su questo indice fornendo al modello cinque strumenti simili a operazioni familiari del file system:

  • search trova documenti pertinenti nell’intero corpus usando l’indice esistente.

  • open apre un documento specifico.

  • navigate si sposta a una pagina, sezione o area al suo interno.

  • read recupera il contenuto in quella posizione.

  • grep trova un pattern all’interno di un documento aperto.

Invece di rispondere solo a partire dai risultati top-k iniziali, il modello può ispezionare ciò che trova, affinare la ricerca, aprire documenti pertinenti, navigare verso sezioni specifiche e leggere il materiale sorgente prima di rispondere. L’indice identifica le fonti probabili; Agentic Search determina cosa ispezionare al loro interno e tra di esse.

RAG one-shot

Agentic Search

Questi strumenti non richiedono fine-tuning né training specifico per modello. Man mano che i modelli migliorano nel ragionamento e nell’uso degli strumenti, anche i retrieval migliorano senza modifiche all’infrastruttura. È una proprietà chiave: la qualità del retrieval scala con la capacità del modello invece di essere limitata dalla strategia di chunking.

Usi Agentic Search per

  • Documenti lunghi. Documenti depositati, contratti, manuali, specifiche tecniche e report in cui la risposta può comparire in una pagina specifica o in una tabella, clausola, figura o nota a piè di pagina particolare.

  • Domande su più fonti. Ricerche che richiedono al modello di trovare, confrontare o riconciliare evidenze da diversi documenti prima di arrivare a una risposta.

  • Risposte che devono essere verificate. Dati finanziari, clausole legali, riferimenti normativi e dati operativi, in cui la risposta può essere collegata a una posizione stabile e specifica nel documento.

  • Tabelle e documenti strutturati. Bilanci, registri governativi e PDF scansionati in cui il significato dipende da righe, colonne, posizione nella pagina o contesto circostante, non solo dal testo narrativo.

Il retrieval indicizzato è il punto di partenza corretto per

  • Lookup diretti. Documenti brevi e puliti in cui è probabile che la risposta compaia in uno dei primi chunk recuperati.

  • Ricerca ad alto volume. Lookup per parole chiave o semantici che devono restituire passaggi pertinenti senza ragionare su di essi o navigarli.

  • Domande semplici e prevedibili. Casi d’uso in cui la fonte e la posizione probabili della risposta sono note in anticipo e ulteriori passaggi di retrieval difficilmente migliorerebbero il risultato.

Il RAG one-shot è spesso sufficiente per queste ricerche. Aggiunga Agentic Search quando le domande richiedono al modello di andare oltre i risultati iniziali e investigare il materiale sorgente. In entrambi i casi, un indice ben configurato resta la base corretta. 

Risultati più pertinenti, più rapidamente

Abbiamo valutato Agentic Search su due benchmark standard di settore, usando lo stack Mistral Search Toolkit out-of-the-box: chunking predefinito, ranking predefinito, nessun tuning. Questi risultati sono soglie minime, non massimi, il che significa che è possibile migliorare ulteriormente la qualità dei risultati con tuning specifico per il caso d’uso.

Con questi benchmark, abbiamo testato due modelli usando Mistral Search Toolkit: Mistral Medium 3.5 (MM 3.5) e Z.ai GLM-5.2 (GLM-5.2), mostrando le prestazioni di un modello più piccolo (MM 3.5) e di un modello più grande (GLM-5.2). 

I risultati dei benchmark sono coerenti: il ciclo agentic offre miglioramenti sostanziali della qualità e gli strumenti di navigazione aumentano l’accuratezza riducendo al contempo token, turni e latenza sprecati. Osserviamo gli stessi pattern di prestazioni nei modelli proprietari e di terze parti, il che indica che Agentic Search è model-agnostic e che la qualità della ricerca dovrebbe migliorare con i nuovi modelli. 

FinanceBench: 368 documenti SEC, 150 domande

FinanceBench (Islam et al., 2023) valuta il question answering finanziario su 368 documenti SEC (10-K / 10-Q / 8-K), con una media di circa 147 pagine ciascuno, per un totale di circa 53.900 pagine: documenti finanziari lunghi e ricchi di tabelle. Le risposte sono valutate da un LLM judge calibrato su etichette umane.

Abbiamo rilevato che:

  • Il loop agentico basato solo sulla ricerca è la leva qualitativa più importante. Passare da un RAG one-shot a un loop solo di ricerca aumenta l’accuratezza di +47,3 pp per MM 3.5 e di +52,6 pp per GLM-5.2: un miglioramento di circa 3 volte per entrambi i modelli. Poiché i modelli possono eseguire ricerche in modo iterativo, possono recuperare da primi risultati deboli, perfezionare le query e usare l’indice come strumento attivo.

  • La navigazione aggiunge accuratezza. L’aggiunta di apertura, navigazione, lettura e grep aumenta nuovamente l’accuratezza (+8,7 pp per MM 3.5, +6,7 pp per GLM-5.2). Questo significa che una ricerca mirata in profondità supera ricerche ampie ripetute nei documenti complessi.

  • L’efficienza in termini di token e prestazioni migliora con strumenti di retrieval migliori. Il loop completo con Navigation risponde correttamente a più domande usando meno token rispetto al loop solo di ricerca (MM 3.5: -23,9% di utilizzo dei token, GLM-5.2: -33,7%). Gli strumenti di retrieval non sono overhead aggiuntivo: sostituiscono tentativi di ricerca sprecati con una navigazione precisa.

  • La latenza diminuisce dove conta. In FinanceBench, l’aggiunta di strumenti di retrieval per la navigazione migliora la latenza: il p90 scende da 255 s → 154 s e la latenza media scende da 108 s → 71 s. In generale, osserviamo che i loop solo di ricerca eseguono ricerche ampie ripetute, mentre la navigazione aiuta il modello a individuare le evidenze più rapidamente.

OfficeQA Pro: 696 Bollettini del Tesoro, 133 domande

OfficeQA Pro è un benchmark numerico verificabile basato sui Treasury Bulletins storici degli Stati Uniti: PDF governativi finanziari scansionati, ricchi di tabelle, in un corpus di 696 documenti e circa 89.000 pagine. Riportiamo il primo passaggio per il sottoinsieme "pro" di 133 domande.

Abbiamo rilevato che:

  • Agentic Search e il loop agentico + Navigation hanno successo su un benchmark più difficile e verificabile. OfficeQA Pro include risposte numeriche, PDF scansionati e ricerche approfondite in tabelle. Anche qui, il loop agentico completo aumenta in modo significativo l’accuratezza rispetto al RAG one-shot, raggiungendo 51,9% per GLM-5.2 (+45,6 pp) e aumentando di +27,1 pp per MM 3.5.

  • Navigation migliora la qualità riducendo gli sprechi. L’uso del loop completo (loop agentico + Navigation) migliora l’accuratezza di fino al 35,6% (+7,5 pp, MM 3.5; +8,3 pp, 19,0% GLM-5.2), riducendo al contempo il consumo di token. I turni sono diminuiti di fino al 7,0% (MM 3.5, 2,3% GLM-5.2).

  • Più il benchmark è difficile, più il loop di retrieval diventa importante. OfficeQA Pro è costruito attorno a risposte numeriche in documenti scansionati e ricchi di tabelle. Il RAG one-shot riesce appena a iniziare, mentre il loop agentico consente al modello di cercare in modo iterativo, ispezionare le evidenze e ottenere miglioramenti sostanziali dell’accuratezza.

  • Lo stack di strumenti produce un impatto sostanziale sulla document intelligence e sulle prestazioni di ricerca. Secondo la ricerca di Kimi, GLM-5.2 ottiene il 41,4% su OfficeQA Pro con l’harness Claude Code, rispetto al 51,9% sull’harness Mistral: +10,5 pp sullo stesso modello sottostante.

Per iniziare

Scopra di più su Agentic Search nella documentazione. Può iniziare con deployment cloud e on-premises usando una delle seguenti opzioni:

  • Mistral Search Toolkit. Integri Agentic Search nei Suoi agenti, workflow e deployment per i clienti.

  • Librerie. Usi Agentic Search out-of-the-box in Studio e Vibe, senza creare autonomamente il sistema di retrieval.

Il modo più rapido per testare Search Toolkit è con la Search Starter App. Crea un indice locale per il Suo corpus usando una configurazione predefinita, così può provare Agentic Search senza dover essere esperti di ricerca. Quando è pronto per configurare il Suo caso d’uso, può: