Istituti per la sicurezza dell'IA del Regno Unito e degli Stati Uniti scoprono che Kimi K3 si avvicina alla frontiera nelle capacità informatiche, ma è in ritardo nell'esecuzione degli exploit
AI News

Istituti per la sicurezza dell'IA del Regno Unito e degli Stati Uniti scoprono che Kimi K3 si avvicina alla frontiera nelle capacità informatiche, ma è in ritardo nell'esecuzione degli exploit

6 min
25/07/2026
AI SecurityCyber CapabilitiesKimi K3Moonshot AI

Introduzione: Un nuovo punto di riferimento nella capacità informatica open-weight

Una valutazione congiunta dell'UK Artificial Intelligence Security Institute (UK AISI) e dello U.S. Center for AI Standards and Innovation (CAISI) ha fatto nuova luce sulle capacità informatiche dell'ultimo modello open-weight di Moonshot AI, Kimi K3. Rilasciato il 16 luglio 2026, e previsto per il rilascio open-weight entro il 27 luglio 2026, il modello ha già suscitato un notevole dibattito all'interno delle comunità tecnologiche e di sicurezza.

La valutazione preliminare, pubblicata sul sito web del NIST, si concentra sulla capacità di Kimi K3 di sviluppare exploit e condurre attacchi informatici autonomi. I risultati collocano il modello in una posizione unica: supera tutti i precedenti modelli open-weight ma è ancora in ritardo rispetto ai più capaci sistemi di frontiera closed-weight statunitensi in aree critiche.

Sviluppo di exploit: Supera i rivali open-weight, ma fallisce all'ultimo ostacolo

Il fulcro della valutazione si è concentrato su ExploitBench, un benchmark pubblico sviluppato dalla Carnegie Mellon University che misura la capacità di un modello di progredire attraverso la scala dello sfruttamento del software. Ciò include passaggi come copertura e riproduzione di crash, lettura/scrittura arbitraria, dirottamento del flusso di controllo ed esecuzione arbitraria di codice (ACE). Il benchmark ha testato i modelli su 41 vulnerabilità recenti (post-2023) nel motore V8, che alimenta Chrome.

Kimi K3 ha ottenuto un punteggio del 32% su ExploitBench, superando GLM-5.2, il modello open-weight più capace dal punto di vista informatico a giugno 2026, che ha ottenuto il 24%. Tuttavia, il risultato più sorprendente è stato che Kimi K3 non è riuscito a sviluppare exploit che raggiungessero l'esecuzione arbitraria di codice (ACE) su nessuno dei 41 campioni. ACE è il risultato più grave, che concede agli aggressori la capacità di dirottare completamente un sistema target. Al contrario, i modelli closed-weight statunitensi più capaci dal punto di vista informatico hanno raggiunto ACE in media su 20 dei 41 campioni.

Ciò indica che, sebbene Kimi K3 possa navigare efficacemente le fasi iniziali e intermedie dello sviluppo di exploit, ha difficoltà con il passaggio finale, il più critico. L'UK AISI e il CAISI notano che il punteggio complessivo di capacità informatica del modello ha un intervallo di confidenza più ampio rispetto ad altri modelli perché è stato stimato da un singolo benchmark (ExploitBench) con 41 attività, mentre altri modelli sono stati valutati su un insieme più ampio di domini.

Attacco informatico autonomo: Un successo in un tentativo su dieci

La valutazione ha incluso anche un test su un cyber range chiamato "The Last Ones" (TLO), un attacco a una rete aziendale simulata in 32 passaggi che si estende su 4 sottoreti e circa 20 host. Questo scenario, che richiederebbe a un esperto umano circa 20 ore per essere completato, misura la capacità di un modello di condurre attacchi informatici end-to-end in modo autonomo.

In media, Kimi K3 ha raggiunto il passaggio 17 del percorso di attacco in 32 passaggi, significativamente al di sotto dei principali modelli statunitensi capaci dal punto di vista informatico, che hanno raggiunto una media di 28,5 passaggi. Tuttavia, il modello ha superato GLM-5.2, che ha raggiunto solo il passaggio 11 in media. In un caso anomalo degno di nota, Kimi K3 ha completato con successo l'intero cyber range TLO in un tentativo su dieci entro il limite di 100 milioni di token. Ciò dimostra che il modello è in grado di attaccare autonomamente piccoli sistemi aziendali debolmente difesi e vulnerabili quando gli viene concesso l'accesso iniziale alla rete e gli viene dato l'ordine di farlo.

I valutatori avvertono che TLO differisce dagli ambienti reali in diversi modi critici: manca di difensori attivi e strumenti difensivi, non impone alcuna penalità per azioni che attiverebbero avvisi di sicurezza e contiene un percorso di attacco intenzionale. Nonostante queste avvertenze, il fatto che Kimi K3 abbia risolto TLO è comunque significativo. Test precedenti hanno mostrato che solo quattro modelli closed-weight rilasciati pubblicamente avevano risolto TLO, con i modelli più capaci che lo risolvevano in modo più affidabile in 6/10 e 7/10 tentativi. Il tasso di successo di 1/10 di Kimi K3 lo colloca in una nuova categoria di modelli open-weight in grado di effettuare attacchi informatici autonomi.

continua a leggere sotto...

Implicazioni più ampie: Un modello di progresso dell'IA cinese

I risultati dell'UK AISI e del CAISI sono in linea con valutazioni indipendenti di altre organizzazioni. L'azienda svizzera Aikido Security ha riferito che Kimi K3 ha scoperto 23 delle 26 vulnerabilità note in un test privato, eguagliando le prestazioni del GPT-5.6 Terra di fascia media di OpenAI, funzionando a un quarto del costo del modello di punta Sol. Il ricercatore di Aikido Philippe Dourassov ha notato che le prestazioni riflettono "un grandissimo balzo in avanti nelle capacità dei modelli Kimi" e che "i modelli open-source non sono più indietro".

Le capacità del modello stanno rinnovando le domande sull'efficacia delle restrizioni all'esportazione tecnologica statunitensi. Gli analisti sottolineano che Kimi K3 sfida la convinzione del settore che l'IA all'avanguardia richieda forti investimenti in data center e chip avanzati, che gli Stati Uniti hanno limitato. Moonshot AI ha negato le suggestioni di aver utilizzato modelli americani per addestrare Kimi K3.

Wei Sun, analista principale di IA presso Counterpoint Research, ha affermato che il divario generale tra i modelli cinesi e americani si è ridotto a tre-sei mesi, sebbene vari significativamente a seconda dell'attività. Il significato più ampio, come ha notato un analista, è che "DeepSeek assomiglia sempre più all'inizio di un modello. DeepSeek è stata una sorpresa. K3 è la prova che il progresso della Cina sta diventando più ripetibile."

Impatto sul mercato e impennata della domanda

Il rilascio di Kimi K3 non è passato inosservato al mercato. La popolarità del modello è aumentata così rapidamente che Moonshot AI ha dovuto sospendere le nuove sottoscrizioni a causa della domanda schiacciante. Lian Jye Su, analista capo di Omdia, ha notato che la sospensione probabilmente deriva dal fatto che Moonshot non ha pienamente anticipato l'impennata di popolarità e gli impegnativi requisiti di calcolo del modello. In termini di capacità di codifica front-end, Kimi K3 ha raggiunto la vetta della classifica sulla piattaforma di valutazione Arena dopo il suo rilascio pubblico.

La combinazione di disponibilità open-weight e prestazioni quasi di frontiera posiziona Kimi K3 per un'adozione più ampia a livello globale, in particolare tra le organizzazioni che apprezzano la capacità di ospitare autonomamente i modelli e mantenere il controllo sui dati sensibili. Ciò contrasta con la maggior parte dei modelli proprietari americani, che si trovano dietro abbonamenti a pagamento e sono soggetti a controlli di utilizzo più severi.

Conclusione: Un campanello d'allarme per la sicurezza dell'IA

La valutazione congiunta di UK AISI e CAISI di Kimi K3 fornisce un quadro sfumato dello stato attuale delle capacità informatiche dell'IA. Sebbene il modello non eguagli ancora i più capaci sistemi closed-weight statunitensi nei compiti di sviluppo di exploit più critici, le sue prestazioni rappresentano un salto significativo per i modelli open-weight. Il fatto che possa attaccare autonomamente una rete aziendale simulata, anche se solo in un tentativo su dieci, sottolinea i crescenti rischi per la sicurezza posti dai modelli open-weight.

Mentre il divario tra i modelli di IA cinesi e americani continua a ridursi, e mentre i modelli open-weight diventano più capaci, i risultati di questa valutazione probabilmente informeranno i dibattiti politici in corso sulla sicurezza dell'IA, i controlli all'esportazione e la necessità di solide misure di sicurezza. L'era in cui le capacità informatiche di frontiera erano esclusive di un piccolo insieme di modelli attentamente controllati sta chiaramente volgendo al termine.