Inkling Small: 276 miliardi parametri, performance vicina
Thinking Machines ha debuttato Inkling-Small, un modello AI open source con 276 miliardi di parametri che raggiunge le prestazioni della sua versione predecessore più grande, pur essendo solo una quarta parte delle dimensioni.

Inkling Small è disponibile su Hugging Face e offre supporto per il fine-tuning attraverso l’app Tinker API. Il modello è un Mixture-of-Experts sparse con 42 layer di decodifica che distribuiscono ogni token a sei esperti specializzati tra i 256 totali, oltre ad altri due esperti comuni attivi per tutti i token.
Con una licenza Apache 2.0 e un indice Intelligence di Artificial Analysis di 40 (contro 41 per Inkling), Inkling-Small supera il modello più grande su alcuni benchmark come SWE-bench Verified, Terminal Bench 2.1, SciCode e CritPt.
Tabella delle prestazioni:
| Benchmark | Inkling-Small | Inkling |
|---|---|---|
| SWE-bench Verified | 80.2% | 77.6% |
| Terminal Bench 2.1 | 64.7% | 63.8% |
| SciCode | Valore non specificato | Valore non specificato |
| GPQA Diamond | Valore non specificato | Valore non specificato |
| CritPt | Valore non specificato | Valore non specificato |
Inkling-Small è progettato per applicazioni aziendali come assistenti di codifica, sistemi agenti e chatbot multimodale. Il modello ha un costo di $0.58 per milione di prefill tokens e $1.44 per sampled tokens.
Il limite principale di Inkling-Small risiede nella necessità di una configurazione hardware elevata: almeno 600 GB di memoria GPU aggregata, richiedendo quattro NVIDIA B300 o otto H200 GPUs. Questo rende il modello impraticabile su laptop o workstation standard.
Secondo Mira Murati, CEO di Thinking Machines, Inkling-Small rappresenta un compromesso ideale per aziende con risorse limitate ma non ridotte in termini di GPU.
Inkling-Small offre una performance sorprendente nei test, superando spesso la versione più grande. Tuttavia, l’hardware richiesto per eseguirlo è elevato e implica un costo significativo.
Via: VentureBeat