AMD acquisisce Taalas per potenziare l'inferenza AI con silicio modellato
AMD scommette forte sul silicio specifico per modello per rivoluzionare l'inferenza AI
Advanced Micro Devices (AMD) ha annunciato giovedì l'acquisizione di Taalas, una startup di chip AI con sede a Toronto che adotta un approccio radicalmente diverso all'accelerazione dell'inferenza. L'accordo, annunciato dopo la chiusura dei mercati il 6 agosto 2026, rappresenta una sfida diretta al dominio di Nvidia nell'hardware AI e arriva appena sette mesi dopo l'accordo di licenza da 20 miliardi di dollari di Nvidia con Groq.
Taalas ha sviluppato quelli che chiama circuiti integrati specifici per modello (MSIC)—chip che incidono i pesi del modello direttamente nel silicio anziché fare affidamento sulla memoria ad alta larghezza di banda (HBM) come le GPU tradizionali. Questo approccio promette di aumentare le prestazioni di inferenza di un ordine di grandezza o più, rendendolo una tecnologia potenzialmente rivoluzionaria per il dispiegamento dell'AI.
La tecnologia: incidere i modelli nel silicio
Fondata nel 2023, l'architettura di Taalas è fondamentalmente diversa dalle GPU convenzionali o dai progetti dataflow utilizzati da concorrenti come Groq e Cerebras. Invece di memorizzare i pesi del modello in HBM, la startup li incorpora direttamente nel silicio del chip, creando un'implementazione cablata di un modello AI specifico.
Nel febbraio 2026, Taalas ha svelato il suo primo chip di test, l'HC1, realizzato con il processo a 6 nm di TSMC. Il chip a dimensione di reticolo ha servito il modello Llama 3.1 8B di Meta a una velocità sorprendente di 16.960 token al secondo—48 volte più veloce delle GPU Nvidia e 8,5 volte più veloce degli acceleratori Cerebras dell'epoca.
Il chip è composto da due regioni principali: il tessuto di richiamo mask-ROM, dove sono incisi i pesi del modello, e il tessuto di richiamo SRAM, che memorizza le cache KV e gli adattatori di fine-tuning. Questo design consente una generazione di token estremamente rapida, mantenendo al contempo flessibilità per piccole regolazioni del modello.
Prestazioni e scalabilità
Il chip di seconda generazione di Taalas, l'HC2, dovrebbe aumentare la capacità di parametri a 20 miliardi di parametri per chip. Sebbene ciò possa sembrare modesto rispetto ai modelli all'avanguardia, l'architettura scala in modo efficiente: un modello con un trilione di parametri richiederebbe solo 50 acceleratori HC2 utilizzando il parallelismo pipeline.
Ciò rappresenta un significativo vantaggio in termini di spazio ed efficienza energetica rispetto alle soluzioni concorrenti. A titolo di confronto, i sistemi LPX recentemente svelati da Nvidia avrebbero bisogno di alcune decine di GPU e almeno 2.000 LPU Groq per servire lo stesso modello.
AMD prevede di integrare la tecnologia di Taalas nei suoi sistemi rack-scale Helios, abbinando GPU Instinct con acceleratori basati su Taalas in un'architettura disaggregata. Ciò scaricherebbe l'elaborazione computazionalmente intensiva del prompt sulle GPU, mentre la generazione di token viene eseguita sui chip specializzati Taalas.
La logica strategica
"AMD sta costruendo una piattaforma AI full-stack che offre ai clienti la flessibilità di implementare le soluzioni di calcolo giuste per ogni carico di lavoro AI", ha dichiarato Vamsi Boppana, SVP AI di AMD, in una nota. L'acquisizione si basa sui recenti investimenti di AMD, tra cui l'acquisto da 665 milioni di dollari di Silo AI nel 2024 e l'acquisizione da 4,9 miliardi di dollari di ZT Systems, che ha fornito le basi per la piattaforma Helios.
L'accordo rispecchia l'accordo di licenza di Nvidia con Groq del dicembre 2025, incentrato sul rendere i servizi di inferenza "premium" più veloci ed economici da eseguire. Entrambe le mosse segnalano un più ampio spostamento del settore dall'hardware incentrato sull'addestramento all'accelerazione specializzata dell'inferenza, mentre i modelli AI entrano in fase di dispiegamento su larga scala.
Compromessi e limitazioni
La tecnologia presenta un'importante avvertenza: una volta che un modello è inciso nel silicio, è essenzialmente bloccato. Qualsiasi modifica sostanziale all'architettura del modello richiede una riprogettazione del chip, che è sia costosa che dispendiosa in termini di tempo. Tuttavia, Taalas sostiene che solo due strati di metallo devono essere modificati per i nuovi modelli, rendendo il processo considerevolmente più economico di una riprogettazione completa.
Questa limitazione rende la tecnologia più adatta per modelli stabili e ampiamente distribuiti, dove il costo della riprogettazione dei chip viene ammortizzato su volumi massicci di inferenza. La startup ha suggerito che incidere i pesi di un modello nel silicio è 100 volte meno costoso che addestrare un modello all'avanguardia.
Perché è importante
L'acquisizione ha implicazioni significative per il mercato delle infrastrutture AI. Offrendo miglioramenti di 10-20x nella velocità di generazione dei token e nell'efficienza dei costi, la tecnologia di Taalas potrebbe consentire un uso più aggressivo del test-time scaling—una tecnica che riduce le allucinazioni permettendo ai modelli di "pensare" più a lungo prima di rispondere.
Le strette relazioni di AMD con i principali sviluppatori di modelli come OpenAI, Anthropic e Meta—tutti clienti Instinct—la posizionano bene per implementare questa tecnologia per servizi di inferenza ad alte prestazioni. L'accordo dovrebbe chiudersi nel quarto trimestre 2026, soggetto all'approvazione normativa.
Mentre il mercato dei chip AI continua a frammentarsi in acceleratori specializzati, l'acquisizione di Taalas da parte di AMD rappresenta una scommessa audace su un futuro in cui i modelli non sono solo eseguiti sull'hardware, ma diventano l'hardware stesso.
Related News

Perché le comunità di programmazione hobbistica si oppongono ai LLM

Modelli Open Superano GPT-5.6 Sol nel Recupero a Costi 100x Inferiori

Untitled

Gli LLM non sanno saltare: perché il balzo creativo dell'AI resta fuori portata

Untitled

