Jeff: Modelli AI decisionali compatibili con Jev addestrati in casa raggiungono decisioni in 28ms
Jeff: Il modello decisionale da 0,8B addestrato in casa che eguaglia l'accuratezza di Jev
Nel panorama in rapida evoluzione dei modelli decisionali AI, un nuovo progetto open-source sta attirando l'attenzione. Jeff, creato dallo sviluppatore Firelex, è una famiglia di piccoli modelli decisionali compatibili con Jev che offrono una classificazione straordinariamente veloce e accurata senza richiedere GPU cloud o infrastrutture massive. Il progetto, che ha raggiunto la prima pagina di Hacker News il 28 settembre 2026, dimostra che il processo decisionale AI ad alte prestazioni può ora avvenire su una singola GPU da workstation.
Jeff non è solo un altro clone del sistema proprietario Jev di TypeSafe. È un'implementazione indipendente che parla lo stesso formato di richiesta, rendendolo un sostituto immediato per gli sviluppatori che desiderano un processo decisionale locale, privato e veloce. Con il modello da 0,8B che raggiunge il 79,1% di accuratezza su un pannello di cinque benchmark e la variante da 2B che raggiunge l'83,1%—sostanzialmente eguagliando l'83,0% pubblicato da Jev—Jeff dimostra che i modelli piccoli possono competere con sistemi molto più grandi nei compiti di classificazione.
Cosa rende Jeff diverso: Velocità e addestramento locale
Il numero di punta è la velocità. Il modello Jeff da 0,8B prende una singola decisione in circa 22 millisecondi su una NVIDIA RTX PRO 6000 e 28ms su un Apple M4 Max utilizzando MLX. Si tratta di una frazione dei 114–212ms per chiamata che l'API di Jev presumibilmente richiede, anche tenendo conto della latenza di rete. La scelta architetturale chiave è che Jeff restituisce probabilità calibrate in un unico passaggio in avanti—nessuna generazione di testo, nessuna analisi, solo pura classificazione.
Altrettanto impressionante è come Jeff sia stato addestrato. Tutto è stato eseguito su hardware locale: una RTX PRO 6000 per l'addestramento (circa 2 ore per il modello da 0,8B, 3,5 per il 2B), due DGX Spark che eseguono Qwen3.8-Flash-Next per generare dati di addestramento sintetici e un MacBook per i test. Non sono state utilizzate GPU cloud e nessun output di modelli chiusi appare nei dati di addestramento. Un modello chiuso è stato utilizzato solo per controllare a campione la qualità dei dati. Questo è un progetto AI completamente riproducibile e sviluppato in casa.
Prestazioni di benchmark: Dove Jeff brilla e dove fatica
Le prestazioni di Jeff sono sfumate. Sui benchmark incentrati sulla classificazione, non solo eguaglia Jev, ma lo supera. Sul Financial PhraseBank, Jeff-Qwen3.5-0.8B ottiene il 96,4% contro il 77,0% di Jev. Su RAGTruth, il modello da 2B raggiunge l'88,9%, alla pari con il molto più grande AutoJev-27B. Questi sono compiti in cui il modello deve scegliere tra opzioni, che è esattamente ciò per cui Jeff è progettato.
Tuttavia, sui benchmark che richiedono ragionamento, come BBH, JudgeBench e il livello difficile di JevBench, Jeff è molto indietro. Il modello da 0,8B ottiene il 64,0% su BBH contro il 94,3% di Jev. Questo è previsto—Jeff è un modello di Sistema 1, costruito per decisioni veloci e calibrate, non per ragionamenti a più fasi. Il README del progetto è onestamente chiaro su questa limitazione, affermando: "I modelli piccoli non ragionano. Aspettatevi scelte veloci e calibrate tra le opzioni che descrivete, non ragionamenti a più fasi."
Il test dei giochi: Processo decisionale zero-shot in azione
Per testare le capacità zero-shot di Jeff oltre i benchmark, il team lo ha fatto giocare a tre giochi classici: Doom, Frogger e Pac-Man. Ad ogni turno, il modello riceve una descrizione della situazione e le mosse legali in parole, e ne sceglie una. I risultati sono illuminanti. Jeff-0.8B eguaglia un bot con regole codificate a mano in Doom (6,55 uccisioni) e lo eguaglia quasi in Frogger (10,3 attraversamenti contro 10,25). In Pac-Man, raccoglie 57 degli 98 pellet, un miglioramento enorme rispetto ai 25,8 del modello non addestrato.
Questi giochi servono come test di stress per la generalizzazione zero-shot. I compiti sono diversi da qualsiasi cosa nei dati di addestramento, eppure Jeff prende comunque decisioni sensate. In particolare, il modello da 0,8B supera quello da 2B nei giochi, nonostante ottenga punteggi inferiori nei benchmark—un racconto ammonitore sull'affidarsi esclusivamente ai punteggi dei benchmark.
Esperienza sviluppatore: API, fine-tuning e integrazione
Jeff è progettato per essere inserito direttamente nel codice. L'API è compatibile con Jev, quindi gli sviluppatori possono passare con modifiche minime. Un semplice comando curl può inviare una situazione e un elenco di opzioni, ricevendo in cambio probabilità calibrate per ciascuna. Sono supportati tre tipi di domanda: choice (scegliere una tra un massimo di 255 opzioni), noul (probabilità sì/no) e score (un punto su una scala descritta). Più domande indipendenti possono essere raggruppate in una singola richiesta.
Per coloro che necessitano di maggiore accuratezza, Jeff supporta il fine-tuning. Il team riferisce che un fine-tuning per navigazione vocale su circa 11k esempi specifici dell'app ha richiesto circa 30 minuti su una GPU e ha migliorato l'accuratezza su dati esclusi dal 31,7% al 95,8%. La pipeline di addestramento è completamente open-source, a partire dalla ricetta AutoJev, e include un filtro per perdite per prevenire la contaminazione dei dati.
Licenze e disponibilità
Jeff è rilasciato con licenze permissive: il codice è MIT (incluso l'avviso di copyright originale di AutoJev) e i pesi del modello sono Apache 2.0. Tre modelli sono disponibili su Hugging Face: Jeff-Qwen3.5-0.8B, Jeff-Qwen3.5-2B e Jeff-Gemma4-E2B. I dati di addestramento stessi non vengono rilasciati, poiché alcune fonti sono share-alike (CC BY-SA), ma tutte le fonti sono documentate.
Questo approccio aperto contrasta con Jev, che è solo API con dimensione del modello non divulgata. Per gli sviluppatori che apprezzano la privacy, l'esecuzione locale e l'efficienza dei costi, Jeff rappresenta un'alternativa convincente.
Perché Jeff è importante per l'ecosistema AI
Jeff rappresenta una tendenza in crescita: la democratizzazione del processo decisionale AI. Mostra che non è necessario un modello da 27B o un'API cloud per ottenere una buona classificazione zero-shot. Un modello da 0,8B addestrato su una singola GPU può eguagliare o superare sistemi molto più grandi nei compiti giusti, a una frazione della latenza e del costo.
Il progetto convalida anche la ricetta di addestramento AutoJev, dimostrando che può essere applicata a modelli studenti più piccoli con risultati eccellenti. Come dice Firelex: "Jeff utilizza lo stesso formato di richiesta di Jev, ma non è affiliato o approvato da TypeSafe." Questa indipendenza è cruciale per l'ecosistema open-source, offrendo un percorso praticabile per gli sviluppatori che desiderano funzionalità simili a Jev senza vincoli al fornitore.
Sebbene Jeff non sostituirà i grandi modelli di ragionamento per compiti complessi, riempie una nicchia vitale: processo decisionale locale, veloce e affidabile per routing, moderazione, classificazione delle intenzioni e altro. Con una latenza inferiore a 30ms e pesi Apache 2.0, è pronto per l'uso in produzione oggi.
Related News

Parley: Chat IRC federato che parla un protocollo semplice

Caso di copyright sull'IA: i dirigenti sapevano che i dati di addestramento erano 'piratati', secondo le accuse

Ollaya: Esegui Modelli Decisionali in Stile Jev Localmente a Velocità Millisecondali

Come gli agenti OpenAI hanno hackerato Hugging Face: nuovi dettagli rivelati

Claude Opus 5.5 Trasforma il Codice in Video Esplicativi di Qualità da Studio

