Qwen 3.8 27B su Cerebras: 1500 token/s con contesto 128k
Qwen 3.8 27B ora disponibile su Cerebras: 1500 token/s e contesto 128k
Cerebras ha aggiunto silenziosamente Qwen 3.8 27B ai suoi endpoint di inferenza pubblici, offrendo agli sviluppatori un nuovo modello a pesi aperti con una velocità impressionante: ~1500 token al secondo. L'annuncio, notato nel catalogo modelli aggiornato dell'azienda, affianca il modello da 27 miliardi di parametri al già esistente gpt-oss-120b, che gira a circa 3000 token/s. Per i team che sviluppano applicazioni basate su AI, questo è più di un semplice incremento delle specifiche: è un segnale che l'inferenza ad alto throughput per modelli aperti sta diventando un'opzione mainstream.
Il modello è disponibile sia nel piano di prova gratuito che in quello pay-as-you-go, soggetto a limiti di frequenza e prezzi per token. Nel piano a pagamento, la lunghezza del contesto arriva a 128k token, il doppio dei 64k offerti nel piano gratuito. Si tratta di un salto significativo per applicazioni che richiedono elaborazione di documenti lunghi, ragionamento multi-turn o flussi di lavoro agentici complessi.
Perché il throughput conta più del numero di parametri
A prima vista, potrebbe sembrare strano che un modello da 27B giri a metà velocità di un modello da 120B sulla stessa architettura. Ma come sottolinea l'analisi di iMasters, il throughput su Cerebras dipende da come un modello viene mappato sull'architettura Wafer Scale Engine (WSE), non solo dalla dimensione grezza dei parametri. La memoria massiccia on-chip e l'interconnessione personalizzata della WSE consentono ad alcuni modelli di ottenere una scalabilità quasi lineare, mentre altri affrontano colli di bottiglia nel routing o nella larghezza di banda della memoria.
Per gli sviluppatori, ciò significa che la scelta del modello non riguarda solo la qualità o la dimensione, ma la latenza e il costo per token in produzione. Un modello da 27B a 1500 token/s abilita applicazioni in tempo reale come chat in streaming, completamento del codice o agenti interattivi che sarebbero impraticabili su infrastrutture più lente. Il fatto che Cerebras abbia scelto di aggiungere Qwen 3.8 27B suggerisce che vede una forte domanda per modelli di medie dimensioni che bilanciano capacità e velocità.
Trasparenza sulla compressione del modello: non potato, quantizzato solo in archiviazione
Cerebras ha anche chiarito la sua posizione sulla compressione dei modelli, cruciale per i team che necessitano di riproducibilità e garanzie di qualità. Nella documentazione aggiornata, l'azienda afferma: "Tutti i modelli serviti tramite i nostri endpoint pubblici sono le versioni originali, non potate." Questa è una risposta diretta alle preoccupazioni sull'uso di modelli potati senza divulgazione.
L'azienda utilizza quantizzazione selettiva solo dei pesi durante l'archiviazione, il che significa che i pesi sono memorizzati in precisione parziale a 16, 8 o 4 bit, ma i layer sensibili rimangono a piena precisione e vengono dequantizzati al volo. Le attivazioni, l'attenzione e la cache KV rimangono a piena precisione e non quantizzate. Questo approccio preserva la qualità del modello riducendo l'ingombro di memoria, un compromesso pragmatico tra FP16 grezzo e quantizzazione aggressiva.
È interessante notare che Cerebras non ospita modelli potati sugli endpoint pubblici. La loro ricerca su tecniche di potatura come REAP (Router-weighted Expert Activation Pruning) è condivisa su Hugging Face per scopi di ricerca, ma queste non fanno parte dell'API di produzione. Questa trasparenza è un cambiamento gradito in un settore in cui i modelli "compressi" vengono talvolta serviti senza piena divulgazione.
Cosa significa per il panorama dell'inferenza AI
L'aggiunta di Qwen 3.8 27B al catalogo di Cerebras è una mossa chiara per espandere l'ecosistema di modelli a pesi aperti disponibili ad alta velocità. Con gpt-oss-120b e ora qwen-3.8-27b, Cerebras si sta posizionando come la piattaforma di riferimento per gli sviluppatori che vogliono modelli aperti senza sacrificare le prestazioni.
Questo mette anche pressione sui fornitori di inferenza basati su GPU. Sebbene le GPU siano versatili, spesso faticano a eguagliare il throughput grezzo di token del silicio personalizzato di Cerebras per carichi di lavoro specifici. Per startup e aziende, la capacità di servire un modello da 27B a 1500 token/s potrebbe ridurre significativamente i costi dell'infrastruttura e migliorare l'esperienza utente.
Tuttavia, ci sono avvertenze. Il limite di contesto di 64k del piano gratuito potrebbe essere restrittivo per alcuni casi d'uso e si applicano limiti di frequenza. Gli sviluppatori dovrebbero anche valutare se la qualità del modello soddisfa le loro esigenze: la velocità è solo una parte dell'equazione. Qwen 3.8 27B è un modello di fascia media solido, ma per attività che richiedono ragionamento profondo, modelli più grandi come gpt-oss-120b potrebbero essere ancora preferibili.
Specifiche tecniche in sintesi
- Modello: Qwen 3.8 27B
- ID modello:
qwen-3.8-27b - Parametri: 27 miliardi
- Contesto (gratuito/a pagamento): 64k / 128k token
- Velocità: ~1500 token/s
- Disponibilità: Piani di prova gratuita e pay-as-you-go
- Compressione: Non potato, quantizzazione selettiva solo dei pesi per l'archiviazione
Prospettive future
L'arrivo di Qwen 3.8 27B su Cerebras è un promemoria che la corsa all'inferenza AI non riguarda solo modelli più grandi, ma fornire il modello giusto alla velocità giusta. Man mano che più modelli a pesi aperti diventano disponibili su hardware ad alte prestazioni, gli sviluppatori avranno una flessibilità senza precedenti per costruire applicazioni che prima erano impossibili a causa di latenza o costi.
Per chi già utilizza Cerebras, questa è un'aggiunta semplice. Per altri, vale la pena dare un'occhiata più da vicino a ciò che la piattaforma può offrire. Con 1500 token/s e contesto 128k, Qwen 3.8 27B potrebbe essere il punto di equilibrio ideale per carichi di lavoro di produzione che necessitano sia di velocità che di profondità di contesto.
Con la continua crescita del catalogo modelli, ci si aspetta di vedere più modelli di medie dimensioni unirsi alla lineup. L'era dell'inferenza veloce a pesi aperti è qui, e Cerebras sta guidando la carica.
Related News

OpenAI presenta GPT-6 Astra: un salto negli agenti AI e nell'allineamento

Ricerca AI Cita 215.000 Pagine Software Generate Automaticamente

I Cervelli che Invecchiano Fondono i Ricordi, Non Solo Li Dimenticano, Rivela uno Studio

Neural Networks Reveal Hidden Symbolic Structure, Study Finds

Addestramento di un trasformatore in 1,5 ore supera i LLM nel benchmark ARC-AGI

