Solutions
Speech
Intelligenza vocale che supera il test umano.
Trascrizione di frontiera, sintesi vocale e agenti vocali per interazioni naturali, espressive e articolate grazie all'IA vocale.
Tre soluzioni di IA vocale fondamentali per qualsiasi conversazione.
Perché Mistral Speech?
Generazione e replica vocale che catturano personalità, ritmo e agilità emotiva.

Trascrizione che rimane accurata anche in condizioni reali e rumorose e che riconosce chi ha detto cosa.

Nove lingue per la generazione vocale, 13 per la trascrizione, con adattamento translinguistico e dialettale.

Modelli open‑weight, ottimizzazione per dominio e implementazione on‑premise. Controllo completo su ogni componente della pipeline.





Come i team utilizzano Mistral Speech oggi.
Per caso d'uso.
Per settore.
Chiudere il cerchio sull'intelligenza audio.
Agenti vocali.

Parla per essere ascoltato.
Conversazioni vocali in tempo reale che ascoltano, ragionano e rispondono con la voce, il tono e le conoscenze di dominio del tuo brand.
Sfrutta la tecnologia che ti serve.
Soluzioni componibili che possono essere eseguite end-to-end o inserite nello stack STT + LLM esistente.
Sintesi vocale.
Trova la tua voce.
Voce emotivamente espressiva che cattura la personalità del parlante. Scegli tra le voci preimpostate o crea la tua.

Clonazione vocale.
Replica qualsiasi voce a partire da un campione di appena 3 secondi, catturandone tono, ritmo e personalità. Genera contenuti vocali in una lingua mai utilizzata prima da chi parla, senza alterarne l'accento e l'identità.

Trascrizione vocale.
Trasmetti in streaming o invia il risultato.
Trascrizione in tempo reale con latenza inferiore a 200 ms o trascrizione in batch di registrazioni lunghe svariate ore con output strutturati.

Trascrizioni ponderate.
La diarizzazione del parlante consente di comprendere chi ha detto cosa e di aggiungere i riferimenti temporali. La funzionalità di contestualizzazione supporta fino a 100 termini personalizzati, per comprendere il tuo linguaggio.

Primi passi con Mistral Speech.
Domande frequenti.
Prova la generazione e la trascrizione vocale nell'ambiente audio di Mistral Studio, integra tramite API o scarica i modelli open‑weight per l'hosting autonomo.
Sì, due. Voxtral Mini Transcribe 2 per la trascrizione in blocco con diarizzazione dei parlanti e ponderazione contestuale e Voxtral Realtime per la trascrizione in live streaming con latenza inferiore a 200 ms.
Sì, puoi fornire un campione vocale anche di soli 3 secondi e Voxtral TTS, il nostro modello di sintesi vocale, si adatterà per catturare il tono, il ritmo e la personalità del parlante. Puoi anche usare voci preimpostate o creare la tua libreria vocale.
La trascrizione supporta 13 lingue, tra cui inglese, francese, tedesco, spagnolo, cinese, hindi, arabo, portoghese, russo, giapponese, coreano, italiano e olandese.
La generazione vocale supporta 9 lingue con espressioni dialettali in inglese, francese, tedesco, spagnolo, olandese, portoghese, italiano, hindi e arabo.
Un esempio di combinazione di modelli Voxtral per formare una pipeline speech-to-speech è:
Voxtral Realtime trascrive il parlato in ingresso, un altro Mistral LLM elabora la trascrizione e determina una risposta, e Voxtral TTS genera l'output vocale.
Ogni componente è personalizzabile e distribuibile in modo indipendente.
L'adattamento vocale multilingue significa che la pipeline può gestire anche la traduzione in tempo reale preservando accento e identità del parlante.
Sì, puoi eseguire in hosting autonomo Mistral Speech o distribuirlo su Mistral Compute.






