AI

Inkling Small: 276 miliardi parametri, performance vicina

Carlo Coppola · 03 Agosto 2026 · 3 min di lettura
Inkling Small: 276 miliardi parametri, performance vicina

Thinking Machines ha debuttato Inkling-Small, un modello AI open source con 276 miliardi di parametri che raggiunge le prestazioni della sua versione predecessore più grande, pur essendo solo una quarta parte delle dimensioni.

Inkling Small: 276 miliardi parametri, performance vicina

Inkling Small è disponibile su Hugging Face e offre supporto per il fine-tuning attraverso l’app Tinker API. Il modello è un Mixture-of-Experts sparse con 42 layer di decodifica che distribuiscono ogni token a sei esperti specializzati tra i 256 totali, oltre ad altri due esperti comuni attivi per tutti i token.

Con una licenza Apache 2.0 e un indice Intelligence di Artificial Analysis di 40 (contro 41 per Inkling), Inkling-Small supera il modello più grande su alcuni benchmark come SWE-bench Verified, Terminal Bench 2.1, SciCode e CritPt.

Tabella delle prestazioni:

Benchmark Inkling-Small Inkling
SWE-bench Verified 80.2% 77.6%
Terminal Bench 2.1 64.7% 63.8%
SciCode Valore non specificato Valore non specificato
GPQA Diamond Valore non specificato Valore non specificato
CritPt Valore non specificato Valore non specificato

Inkling-Small è progettato per applicazioni aziendali come assistenti di codifica, sistemi agenti e chatbot multimodale. Il modello ha un costo di $0.58 per milione di prefill tokens e $1.44 per sampled tokens.

Il limite principale di Inkling-Small risiede nella necessità di una configurazione hardware elevata: almeno 600 GB di memoria GPU aggregata, richiedendo quattro NVIDIA B300 o otto H200 GPUs. Questo rende il modello impraticabile su laptop o workstation standard.

Secondo Mira Murati, CEO di Thinking Machines, Inkling-Small rappresenta un compromesso ideale per aziende con risorse limitate ma non ridotte in termini di GPU.

Inkling-Small offre una performance sorprendente nei test, superando spesso la versione più grande. Tuttavia, l’hardware richiesto per eseguirlo è elevato e implica un costo significativo.

Via: VentureBeat