Needle 2: LLM da 14 MB su Dispositivo Porta l'IA Agente su Hardware Economico
AI News

Needle 2: LLM da 14 MB su Dispositivo Porta l'IA Agente su Hardware Economico

4 min
11/08/2026
on-device AIedge AIagentic LLMtool calling

Needle 2: Un LLM Agente da 14 MB per i Dispositivi di Cui Nessuno Parla

L'AI per l'edge computing ha un problema di marketing. Per gran parte del settore, "su dispositivo" significa eseguire un modello da 7 miliardi di parametri su un MacBook o uno smartphone di punta. Ma Cactus Compute sta scommettendo diversamente: che il vero edge sono i 21 miliardi di dispositivi IoT connessi—telefoni economici, Raspberry Pi, microcontrollori e indossabili—che vengono venduti per meno di 200 dollari e non hanno GPU, NPU e solo poche centinaia di megabyte di RAM.

Oggi, l'azienda ha rilasciato Needle 2, un modello linguistico da 45 milioni di parametri che si comprime in un singolo binario da 14 MB ed esegue una sessione completa in soli 28 MB di RAM. È progettato per un compito specifico: la chiamata di funzioni agente. Accendere una luce, inviare un messaggio o controllare un robot non richiede conoscenza del mondo o prosa aperta—richiede mappare una frase confusa su una funzione con gli argomenti giusti. Questa formulazione ristretta è il motivo per cui 45 milioni di parametri possono competere con modelli da 5 a 70 volte più grandi.

Prestazioni che Superano la Sua Categoria di Peso

Su benchmark come Google Mobile Actions e Seal-Tools, Needle 2 scambia vittorie con modelli come FunctionGemma 270M, LFM2.5 230M e Foundation Model di Apple—tutti eseguiti a precisione f16 mentre Needle funziona a 2 bit. Su Mobile Actions (961 righe), Needle 2 raggiunge il 63,7% di accuratezza, quasi eguagliando il 69,1% di LFM2.5 pur essendo 5 volte più piccolo. Su Seal-Tools fuori dominio, Needle è addirittura in testa con il 28,7% contro il 17,0% di LFM2.5.

I numeri di velocità sono altrettanto impressionanti. Needle decodifica a oltre 500 token/sec su un Raspberry Pi 5, tra 400 e 1.500 token/sec su dispositivi VR come Meta Quest 3S e Apple Vision Pro, e 300–700 token/sec su telefoni sotto i 200 dollari come la serie Samsung A. Funziona persino su microcontrollori con RAM esterna, come l'ESP32-P4.

L'Architettura: Simple Attention Networks e Quantizzazione a 2 Bit Senza Perdita

Needle 2 è costruito sulla Simple Attention Network (SAN), una nuova architettura dettagliata nel documento di ricerca di Cactus. L'intuizione chiave è sostituire le proiezioni MLP dense con una trasformata di Walsh-Hadamard fissa e diagonali apprese, riducendo drasticamente i costi di miscelazione dei canali. Un trasformatore convenzionale delle dimensioni di Needle spende 164 MFLOP per token; Needle ne spende solo 70.

Il modello utilizza anche un sistema di memoria n-gram con hash ("engrammi") che memorizza la conoscenza del mondo in tabelle lette poche righe per token—una capacità quasi gratuita al momento della decodifica. Questo è importante su dispositivi dove ogni megabyte letto dalla flash costa durata della batteria.

Ma l'innovazione più interessante è la quantizzazione a 2 bit senza perdita. La maggior parte dei modelli piccoli si rompe sotto quantizzazione post-hoc, quindi Cactus ha addestrato Needle contro i loro Cactus Quants dal pre-addestramento al post-addestramento—pesi, attivazioni e cache KV allo stesso modo. Il modello a 2 bit che distribuisci è il modello che è stato addestrato, non un'approssimazione degradata.

continua a leggere sotto...

Un Approccio Pragmatico alla Collaborazione Edge-Cloud

Nessun modello piccolo copre tutto, e Needle non finge il contrario. Ogni risposta porta un punteggio di confidenza appreso; le richieste fuori tema restituiscono una chiamata vuota. Sopra la tua soglia, agisci localmente. Sotto di essa, scala al cloud. La maggior parte delle richieste dei dispositivi sono controlli di routine, quindi la scalatura rimane rara e il percorso predefinito rimane privato, istantaneo e gratuito.

Questo è un design rinfrescante e onesto. Invece di allucinare risposte, Needle dice "Non lo so" e passa a un modello più grande. È il tipo di ingegneria pragmatica che rende i modelli piccoli praticabili in produzione.

Pronto per la Produzione: L'Anello Index di Pebble Lo Usa Già

Needle non è solo un progetto di ricerca. Pebble, il pioniere degli indossabili moderni, esegue Needle 2 localmente nella sua app Index 01 per trasformare richieste vocali in azioni senza dipendere da una connessione di rete. L'Anello Index non ha schermo, quindi l'azione deve avvenire ogni volta, con o senza internet.

"Eseguiamo Cactus Needle localmente nell'app, invece di affidarci al cloud," ha detto un rappresentante di Pebble. "L'impronta del modello è minuscola e le prestazioni non ci deludono mai."

Perché Questo è Importante

L'industria dell'AI è ossessionata dalle leggi di scala e dai modelli da trilioni di parametri. Ma la stragrande maggioranza dei dispositivi informatici nel mondo sono piccoli, economici e con vincoli di potenza. Needle 2 dimostra che l'AI agente non richiede hardware all'avanguardia—richiede solo l'architettura giusta e la volontà di specializzarsi.

Con licenza Apache 2.0, pesi su Hugging Face e un repository GitHub con un singolo binario C++ senza dipendenze che funziona da Cortex-M a x86 a WebAssembly, Needle 2 è posizionato per diventare il modello di chiamata di funzioni predefinito per l'era IoT. L'azienda sta già parlando con produttori di hardware su schemi di strumenti personalizzati e post-addestramento.

Per gli sviluppatori che costruiscono dispositivi smart home, indossabili, robot o sistemi automobilistici, Needle 2 offre una combinazione rara: impronta ridotta, bassa latenza, affidabilità offline e capacità genuina. È un passo significativo verso la realizzazione di un'AI su dispositivo veramente ubiqua.