#Finsubito news dalla rete – Presentazione di Mistral Large 4


Le Chonk 

Oggi lanciamo un’anteprima pubblica di Mistral Large 4. Ufficiosamente ML4, ufficialmente a tutti gli effetti: le Chonk. ML4 porta le prestazioni dei modelli a pesi aperti a nuovi livelli. È possibile provare l’API in anteprima già oggi su Mistral Studio. I pesi saranno disponibili alla fine di questo mese.

Prestazioni all’avanguardia

ML4 è un modello nativamente multimodale da 1.000 miliardi di parametri, di cui 49 miliardi attivi. È il nostro modello più grande e più capace a oggi, e continua a migliorare rapidamente grazie al nostro lavoro di perfezionamento.

Il modello offre prestazioni eccezionali nella codifica, nei flussi di lavoro agentici e nella comprensione multimodale. Già oggi raggiunge prestazioni competitive con i migliori modelli open source a livello globale, superando nettamente qualsiasi modello a pesi aperti sviluppato negli Stati Uniti o in Europe. Nei carichi di lavoro aziendali critici, tra cui sicurezza informatica, finanza e diritto, risulta all’avanguardia tra i modelli aperti. In alcuni ambiti, come il grounding visivo, si spinge ancora oltre, superando persino i modelli chiusi più avanzati.

Rilasceremo i pesi entro la fine del mese. Nel frattempo, sottoponiamo il modello ad attività di red teaming in contesti reali con leader della sicurezza informatica, partner selezionati e autorità statali, che avranno accesso allo stesso modello con una moderazione ridotta e funzionalità ampliate per la sicurezza informatica.

Forgiato in Europe. Progettato per la sovranità dell’IA.

ML4 è stato addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell nei data center di Mistral in Europe. L’anteprima pubblica è erogata sulla stessa infrastruttura. È una tappa importante del nostro investimento a lungo termine in infrastrutture, ricerca e sviluppo di prodotti: prestazioni all’avanguardia in settori critici, offerte attraverso pesi aperti e progettate per dare ai clienti il controllo sulla propria IA.

Questo è particolarmente importante nella sicurezza informatica, dove i rifiuti imposti dal fornitore possono bloccare attività legittime di ricerca sulle vulnerabilità e di risposta agli incidenti, e dove perdere l’accesso a una funzionalità nel corso di un incidente può diventare di per sé un rischio critico per la sicurezza. ML4 unisce prestazioni di primo livello nella sicurezza informatica a pesi aperti e alla possibilità di deployment autonomo, offrendo alle organizzazioni sia le capacità sia l’autonomia necessarie per svolgere attività avanzate di sicurezza secondo le proprie policy.

Il modello sarà disponibile in più regioni a livello globale, incluso un deployment europeo gestito interamente da Mistral, in modo indipendente da altri fornitori di servizi digitali e nel rispetto del diritto europeo. Una curiosità: una parte significativa dei dati di addestramento di ML4 era multilingue e copriva oltre 160 lingue, incluse tutte le lingue ufficiali dell’Unione europea. 

Per addestrare ML4 abbiamo collaborato a stretto contatto con aziende leader di tutto il mondo nei settori della finanza, della progettazione, della produzione, della logistica, della farmaceutica, della ricerca, del trasporto marittimo, del settore pubblico e di altri ambiti mission-critical. Il modello utilizza infatti lo stesso ambiente di addestramento, personalizzazione e apprendimento per rinforzo (RL) che offriamo ai nostri clienti tramite Mistral Forge.

Lo provi oggi

Altre novità sono in arrivo. Mentre lavoriamo al rilascio dei pesi, condivideremo ulteriori dettagli sull’architettura del modello, altri benchmark e la nostra metodologia di post-addestramento.

Questo modello sarà anche la base di una nuova generazione di modelli Mistral specializzati e ottimizzati. Nel frattempo, La invitiamo a provare l’API in anteprima e a condividere il Suo feedback con noi sui social media.

Approfondimento sulle funzionalità

Sicurezza informatica

ML4 è uno dei modelli di IA più avanzati al mondo per la sicurezza informatica. Nell’Artificial Analysis Cyber Index, una valutazione indipendente della capacità dei modelli di IA di individuare e correggere falle di sicurezza in software reali, si colloca tra i primi cinque modelli a livello globale e supera con ampio margine i modelli a pesi aperti sviluppati al di fuori della Cina. In uno dei test dell’indice, che richiede al modello di riprodurre una vulnerabilità reale in un software open source e poi correggerla, ML4 ottiene l’82%, il punteggio più alto tra tutti i modelli. Risolve inoltre il 93% delle sfide di Cybench, un insieme di 40 esercizi tratti da competizioni di sicurezza informatica: uno dei punteggi più alti registrati per un modello a pesi aperti.

Questo primato si traduce in un vantaggio concreto. Diversi modelli chiusi di punta, tra cui Claude Opus 5.5 e GPT-6 Astra, ottengono punteggi prossimi allo zero nello stesso test perché rifiutano di svolgere il compito. Eppure, proteggere un software inizia spesso dal dimostrare che una falla è reale: proprio il tipo di attività che i filtri di sicurezza dei modelli chiusi possono bloccare. Questo aspetto è ancora più importante ora che gli attori malevoli ricorrono sempre più al jailbreak di quegli stessi modelli per supportare attività informatiche offensive: chi difende i sistemi ha bisogno di strumenti con capacità equivalenti, senza essere vincolato dagli stessi rifiuti. ML4 può svolgere queste attività e le sue capacità vanno oltre quelle per cui è stato esplicitamente addestrato: nei test interni si è dimostrato utile per analizzare malware, definire le priorità delle vulnerabilità e scrivere regole di rilevamento. Le organizzazioni che necessitano di un’IA sovrana e verificabile per le operazioni di sicurezza potranno eseguirlo su cloud privato o on-premise.

ML4 a confronto con gli altri modelli: ragionamento efficiente su sfide complesse e diversificate
Reverse engineering del malware: risoluzione di un compito di analisi fuori distribuzione

Sviluppo con agenti IA

ML4 eccelle nell’ingegneria del software, nella comprensione dei repository e nei flussi di lavoro complessi da terminale, ottenendo il 61,7% su DeepSWE v1.1, il 59,4% su SWE-Atlas-QnA e il 28,3% su Terminal-Bench 4. Il suo punteggio complessivo del 49,8% nel Coding Agent Index lo colloca davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max.

Abbiamo inoltre condotto con Surge AI una valutazione umana in cieco sulla qualità della codifica: annotatori professionisti hanno valutato gli output dei modelli su una scala da 1 a 5, senza conoscerne l’identità. ML4 Preview si è classificato secondo su cinque modelli (3,74), davanti a Kimi K3 (3,59), GLM-5.3 (3,60) e GLM-5.2 (3,40), e dietro soltanto a Claude Opus 5 (4,22).

Flussi di lavoro agentici

ML4 esegue agenti generalisti che raccolgono informazioni, utilizzano strumenti e producono risultati pronti all’uso nell’ambito di flussi di lavoro complessi. Su AutomationBench, che comprende 657 flussi di lavoro aziendali su app come Gmail, Google Sheets, Slack e Salesforce, ottiene il 59,9%, davanti a Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro.

È altrettanto efficace nel produrre i materiali professionali tipici del lavoro intellettuale: fogli di calcolo, presentazioni e PDF. Su AA-Briefcase, che valuta attività di lavoro intellettuale su orizzonti temporali lunghi, raggiunge un punteggio Elo di 1.393, davanti a DeepSeek V4 Pro.

Multimodale

ML4 segna un salto di qualità nella capacità dei nostri modelli di comprendere le immagini. Offre un ragionamento avanzato su documenti complessi, grafici e immagini naturali, e porta la visione artificiale nei settori in cui la percezione è fondamentale, come la progettazione, la produzione e l’osservazione della Terra.

Il modello può inoltre combinare il grounding visivo con capacità agentiche: dall’ispezione di immagini satellitari da gigapixel, aiutando i team di risposta alle catastrofi ad agire quando il tempo è decisivo, all’analisi di disegni tecnici, ingrandendo, esaminando e verificando fino a ottenere una risposta esatta. Nelle demo riportate sopra, ML4 individua elementi in scene naturali dense, verifica componenti meccanici nei disegni tecnici, recupera evidenze dai PDF e analizza enormi immagini geospaziali alla ricerca degli oggetti più difficili da individuare.

In particolare nel grounding visivo, ML4 risulta uno dei modelli più capaci che abbiamo testato: supera, ad esempio, GPT-6-Astra su Dense 200 (42% contro 41%).

Ricerca e matematica

ML4 offre solide capacità scientifiche, sviluppate combinando metodi basati sull’IA con le competenze dei nostri ricercatori in matematica, fisica e chimica.

È altamente competente nello sviluppo con agenti IA per attività scientifiche come l’analisi dei dati, la modellazione e la simulazione della realtà fisica, consentendo ai ricercatori di concentrarsi sulle domande anziché sui dettagli implementativi. Nei benchmark, ML4 è all’avanguardia su SciCode-Verified tra i modelli a pesi aperti. In pratica, può generare in un unico passaggio una simulazione Hartree–Fock completa: un’attività chimica complessa e articolata in più fasi, basata su una serie di routine avanzate.

Anche le capacità matematiche di ML4 sono più solide, sia nel ragionamento formale sia nella matematica applicata. Nelle nostre valutazioni umane ragiona con maggiore precisione e struttura rispetto a GLM-5.3, ed è in grado di portare avanti attività prolungate di matematica applicata specifiche di un dominio, incluse quelle pertinenti alla fisica teorica più avanzata.

Nel loro insieme, queste capacità rendono ML4 un valido assistente di ricerca lungo l’intero workflow tecnico, dalla prima domanda al risultato finale.

SciCode-Verified testa la capacità dei modelli di implementare in codice flussi di lavoro scientifici complessi in ambiti come la fisica, la matematica, la scienza dei materiali e la biologia. 

Valutazione interna di ML4 a confronto con GLM5.3 su attività STEM (matematica e fisica)

Lavoro intellettuale

ML4 è il nostro modello più capace per le attività concrete che i professionisti affrontano ogni giorno. Può creare, modificare e correggere fogli di calcolo e documenti complessi, offrendo prestazioni esemplari nei benchmark sia legali sia finanziari.

In particolare, abbiamo valutato ML4 tramite valutatori indipendenti (vals.ai) su attività rappresentative in ambito sia legale sia finanziario, riscontrando che il modello supera GPT-6-Astra in entrambi i casi. Nel benchmark Legal Agent di HarveyAI, ML4 supera tutti i modelli open source.

FinWorkBench testa le capacità dei modelli di creare e modificare fogli di calcolo per casi d’uso reali in ambito finanziario e contabile.

L’analisi finanziaria richiede precisione e la capacità di sintetizzare informazioni provenienti da fonti multiple, un processo che ancora oggi risulta dispendioso in termini di tempo in molte istituzioni finanziarie. In questa demo, ML4, a confronto con altri modelli OSS di punta, affronta la stessa sfida multistep di finanza aziendale, effettuando ricerche nei documenti depositati dalle società quotate e nei report finanziari, come quelli disponibili tramite EDGAR e banche dati europee equivalenti. Una mappa semantica animata traccia il percorso di ciascun modello verso la soluzione, evidenziando ogni documento recuperato lungo il tragitto. La posizione di ciascuna traccia riflette le evidenze raccolte, i risultati dei calcoli e le questioni ancora irrisolte. Gli spettatori possono seguire lo svolgimento delle indagini e confrontare i percorsi distinti che ciascun modello segue prima di giungere alla risposta finale.

Sicurezza del modello

ML4 ha saturato i nostri benchmark sulla robustezza ai prompt injection indiretti, posizionandolo all’avanguardia tra i modelli OSS (rispetto a GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3, DS-V4-Pro-0813). Sul B3 AI Security Benchmark pubblico di Lakera, ML4 resiste al 93,3% degli attacchi – non osserviamo punteggi più alti tra i concorrenti.

ML4 interagisce inoltre con gli utenti in modo più responsabile rispetto a tutti i nostri modelli precedenti. Mettiamo in evidenza i nostri risultati sul KORA Benchmark, dove ML4 si attesta nuovamente sul punteggio più alto che abbiamo mai misurato tra i modelli OSS (1,691, dove 2 rappresenta il massimo, indicato come “Esemplare”).

Di particolare rilevanza è la propensione del modello a rifiutare richieste dannose in materia di sicurezza informatica. Nonostante le solide prestazioni sui benchmark cyber, il tasso medio di rifiuto del modello sui prompt cyber provenienti da JailbreakBench, StrongREJECT e AgentHarm è superiore a quello di tutti i modelli OSS.

Valutazione umana

Abbiamo condotto una valutazione interna in cui annotatori esperti di codifica, progettazione assistita da computer (CAD), finanza, matematica e fisica hanno confrontato Mistral Large 4 con GLM-5.3. ML4 è stato preferito nel CAD e nelle discipline STEM, mentre in finanza e codifica ha ottenuto prestazioni pari o vicine a quelle di GLM-5.3.

Apprendimento per rinforzo su larga scala

I modelli base migliorano rapidamente e il nostro post-training deve tenere il passo. Una ricetta calibrata sul modello di ieri lascia capacità inespresse con i modelli all’avanguardia di oggi, perché i campioni di ground truth che un tempo spingevano un modello al suo limite non lo fanno più. Utilizziamo l’apprendimento per rinforzo (RL) perché si adatta man mano che il modello evolve: ci addestriamo sugli esiti dei tentativi compiuti dal modello stesso e possiamo aumentare la difficoltà e l’ampiezza dei compiti man mano che diventa più potente.

La nostra libreria RL è stata progettata per rendere semplice aggiungere nuovi ambienti e addestrarli su larga scala. Un’interfaccia condivisa e componibile consente a un singolo run di addestramento di combinare attività che spaziano dalla chat a turno singolo e dalla risoluzione di problemi scientifici complessi fino all’allineamento sulla sicurezza, alla fattualità e all’uso di strumenti su orizzonti lunghi. Questi ambienti condividono scaffold e risorse come sandbox di codice, ricerca web e API esterne. La stessa componibilità si estende alla verifica, con modelli di reward, unit test, giudici LLM e controlli statici combinati in base alle esigenze di ciascun compito.

In fase di esecuzione, una flotta autoscaling di attori genera decine di migliaia di rollout in parallelo mentre l’addestramento dei modelli procede in modo asincrono. La pipeline di generazione e addestramento è ottimizzata per le traiettorie lunghe: supporta budget di rollout di milioni di token attraverso più compattazioni, mantenendo al contempo basso lo staleness. Metodi innovativi e ottimizzazioni applicati a entrambe le fasi riducono al minimo la deriva off-policy e consentono un RL stabile su orizzonti lunghi.

Alla nostra scala attuale (3k GPU), un singolo run di addestramento produce circa 33 miliardi di token al giorno, di cui circa 16 miliardi sono token di completamento addestrabili dopo il filtraggio e il masking. Possiamo vedere l’avanzamento del run direttamente nei rollout di addestramento: i reward di addestramento crescono in diversi ambienti rappresentativi man mano che la policy impara a risolvere compiti sempre più complessi. Di seguito alcuni esempi.

I miglioramenti non sono specifici degli ambienti su cui ci addestriamo: si trasferiscono alle valutazioni a valle e il modello finale li deve a entrambe le fasi di post-training (fine-tuning supervisionato e RL), come mostrato nei grafici.

I prossimi passi

Questo è solo l’inizio. ML4 è il primo traguardo della roadmap finanziata dal nostro round di Serie D da 3 miliardi di euro — il più grande round di equity mai raccolto da un’azienda tecnologica europea. Quel capitale è già all’opera: stiamo ampliando significativamente la nostra capacità di compute nei nostri datacenter europei e molto altro entrerà in funzione nei prossimi mesi.

Più compute significa più addestramento. Il run di apprendimento per rinforzo alla base di questa preview è ancora in corso e il modello non mostra alcun segno di saturazione — resta ancora un ampio margine di crescita. Man mano che scaliamo l’addestramento sulla nostra infrastruttura potenziata, ci aspettiamo miglioramenti importanti e rapidi nelle settimane e nei mesi a venire.

Rilasceremo i pesi entro la fine del mese, insieme a ulteriori dettagli sull’architettura, a benchmark aggiuntivi e alla nostra metodologia di post-training. E ML4 è solo il fondamento: fungerà da base per una nuova generazione di modelli Mistral specializzati e ottimizzati, pensati per i settori e i carichi di lavoro che contano di più per i nostri clienti.

Da qui in avanti il ritmo di avanzamento sarà rapido. Restate sintonizzati.


#Adessonews seleziona nella rete articoli di particolare interesse.
Se vuoi leggere l’articolo completo clicca sul seguente link

Source link

🚀 #Finsubito | Gruppo Retefin

Affianchiamo imprese e professionisti in tutta Italia nell’accesso alle migliori opportunità di Finanza d’Impresa, Finanza Agevolata, Sostenibilità e Compliance. 🇮🇹

💼 Operiamo esclusivamente attraverso mediatori e operatori autorizzati, offrendo un servizio professionale, trasparente e orientato alle reali esigenze della tua impresa.

✨ Consulenza gratuita e zero costi di istruttoria: analizziamo la situazione della tua azienda, individuiamo le opportunità più adatte e ti supportiamo nella valorizzazione del tuo profilo finanziario e aziendale nei confronti di banche e partner.

📈 Dalla diagnosi iniziale alla strategia finanziaria, siamo al tuo fianco per trasformare le esigenze della tua impresa in concrete opportunità di crescita, investimento e sviluppo.

🔎 Scopri come possiamo supportare la tua impresa. 👉 Contattaci per una prima valutazione.

เติมเกม