Titoli da Trilioni di Parametri, Realtà da Singola GPU
Nell’arco di sei settimane questa estate, tre laboratori diversi hanno annunciato il più grande modello a pesi aperti mai rilasciato. Kimi K3 di Moonshot AI è atterrato il 27 luglio con 2,8 trilioni di parametri. Qwen 3.8-Max di Alibaba ha seguito il 3 agosto con 2,4 trilioni. Zhipu aveva già spedito GLM-5.2 a giugno. Ogni annuncio è arrivato con un grafico di benchmark che mostrava il nuovo modello che si avvicina, o superava, i migliori sistemi proprietari sul mercato.
Se gestisci un’azienda e stai cercando di capire cosa tutto questo significa per i tuoi piani AI, i titoli non sono costruiti per te. Un modello con 2,8 trilioni di parametri non è qualcosa che un’azienda di medie dimensioni installa su un server in uno studio. È un punto dati in un paesaggio molto più grande, uno in cui i modelli effettivamente distribuiti all’interno di aziende reali sono solitamente una frazione di quella dimensione. Il nostro team di sviluppo AI riceve quasi settimanalmente la domanda se un rilascio specifico a pesi aperti valga la pena di auto-hostare, e la risposta onesta quasi sempre inizia con “quale, e per cosa”.
Questa guida affronta il punto in cui quel paesaggio effettivamente si trova ad agosto 2026: quali famiglie di modelli sono reali e pronte per la produzione, cosa permettono davvero le loro licenze, quale infrastruttura ogni livello realisticamente richiede, e la questione di conformità che la maggior parte del materiale del vendor convenientemente salta.
Le Sei Famiglie che Vale la Pena Conoscere
Al momento della stesura, sei famiglie di modelli a pesi aperti hanno un track record credibile e verificato in modo indipendente per la produzione. Altre tre meritano di essere monitorate: Thinking Machines’ Inkling, Poolside’s Laguna e il GLM-5.5 tanto atteso ma non ancora rilasciato. Nessuno appartiene ancora alla stessa categoria, per i motivi coperti di seguito.
Kimi K3 (Moonshot AI). Rilasciato il 27 luglio 2026, con pesi completi pubblicati su Hugging Face. Con 2,8 trilioni di parametri totali e 104 miliardi attivi per token, è il rilascio a pesi aperti più grande fino ad oggi e il primo a superare le classifiche indipendenti di Frontend Code Arena, segnando 1.679 Elo contro i 1.631 di Claude Fable 5. Guida specificamente nella codifica: SWE-bench Verified al 81,2% è un risultato solido oltre al vantaggio di Frontend Code Arena. Si licenzia con una licenza Kimi K3 personalizzata piuttosto che una licenza open source standard. Questo conta più del grafico di benchmark una volta che il team legale si coinvolge (maggiori dettagli di seguito).
Qwen 3.8-Max (Alibaba). Presentato il 19 luglio, completamente lanciato il 3 agosto 2026. Funziona con 2,4 trilioni di parametri totali e 95 miliardi attivi per token, e guida nel ragionamento multimodale, con i test indipendenti iniziali che suggeriscono una migliore affidabilità di uso dello strumento aziendale rispetto a Kimi K3 in almeno un confronto. Il prezzo dell’API è di 2 dollari per milione di token di input e 6 dollari per milione di token di output. È circa 2,5 volte più economico del prezzo dell’API di Kimi K3. I rilasci Qwen precedenti, incluso un checkpoint Qwen3.8-27B più piccolo, sono confermati Apache 2.0. I pesi flagship Qwen3.8-Max stessi, pubblicati a metà agosto 2026, invece spediscono con una licenza personalizzata separata, una distinzione che vale la pena cogliere se hai assunto che l’intera famiglia Qwen eredita gli stessi termini permissivi.
GLM-5.2 (Zhipu). Rilasciato il 13 giugno 2026, con pesi aperti e accesso all’API attraverso fornitori terzi incluso OpenRouter. Con circa 753 miliardi di parametri totali e circa 40 miliardi attivi, è notevolmente più piccolo di K3 e Qwen 3.8-Max, e si vede: GLM-5.2 corrisponde o batte diversi modelli proprietari su compiti di codifica a lungo raggio a una frazione del costo di inferenza, segnando il 62,1% su SWE-Bench Pro. È concesso in licenza MIT, una delle licenze più amichevoli per gli affari in questa lista.
DeepSeek. DeepSeek V4 è stato spedito nell’aprile 2026 con una finestra di contesto di 1 milione di token e pesi aperti. I dettagli pubblici su questo rilascio sono più sottili rispetto alle altre cinque famiglie, quindi trattalo come una delle opzioni credibili che vale la pena investigare direttamente con il tuo team tecnico piuttosto che una scelta completamente specificata.
Llama 3.1 405B (Meta). Il modello più vecchio in questa lista di gran lunga. Meta lo ha rilasciato il 23 luglio 2024, secondo il suo comunicato ufficiale, ed è ancora ampiamente distribuito nel 2026, degno di essere incluso qui per quanto è stato completamente testato in battaglia in produzione. Con 405 miliardi di parametri densi (ogni parametro si attiva su ogni token, a differenza dei design mixture-of-experts di cui sopra), si colloca insieme ai modelli di classe Claude e GPT nei test di valutazione blind. Funziona con la Llama Community License, che è permissiva per la stragrande maggioranza delle aziende ma non è una vera licenza open source: Meta mantiene restrizioni di utilizzo che Apache 2.0 o MIT non hanno.
Mistral Large 3 (Mistral AI). Lanciato a dicembre 2025 e spostato in accesso anticipato più ampio a luglio 2026. Con 675 miliardi di parametri totali e 41 miliardi attivi, è concesso in licenza Apache 2.0 e ha un prezzo di 0,50 dollari per milione di token di input e 1,50 dollari per milione di output, tra le opzioni API più economiche in questa lista. Mistral non rivendica performance di ragionamento a livello frontier; è invece posizionato come un modello aziendale efficiente in termini di costi e fortemente multilingue, che è una posizione difendibile e onestamente dichiarata.
Perché la Licenza Conta Più del Benchmark
Ognuna delle sei famiglie di cui sopra pubblica pesi che puoi scaricare. Quel singolo fatto viene appiattito in “open source” in molta copertura. L’appiattimento conta. Le licenze allegate a questi rilasci non sono intercambiabili.
Apache 2.0 e MIT sono i default sicuri. Mistral Large 3 e i rilasci Qwen precedenti, incluso il checkpoint più piccolo Qwen3.8-27B, portano Apache 2.0. I rilasci di DeepSeek e GLM-5.2 sono entrambi concessi in licenza MIT. Tutti e tre consentono l’uso commerciale, la modifica e la ridistribuzione con attrito minimo, motivo per cui i team legali generalmente li approvano rapidamente.
La Llama Community License è permissiva ma condizionata. Llama 3.1 405B è libera di usare per la stragrande maggioranza delle aziende, ma rimane una licenza della comunità piuttosto che una standard open source. Meta allega termini di utilizzo, incluse restrizioni legate alla scala aziendale, che Apache 2.0 non ha.
Kimi K3 e il flagship Qwen 3.8-Max entrambi necessitano di una revisione legale prima dell’uso in produzione. Nessuno spedisce con Apache 2.0, MIT o una licenza standard comparabile. La Kimi K3 License personalizzata di Moonshot richiede un accordo commerciale separato una volta che un servizio costruito su di essa supera determinate soglie di ricavi. Alibaba ha pubblicato i pesi flagship Qwen3.8-Max a metà agosto 2026 anche con la sua stessa licenza personalizzata, distinta dai termini Apache 2.0 che coprono checkpoint Qwen più piccoli. L’analisi di Layer3Labs dei modelli open-weight pronti per il business contrassegna licenze personalizzate come queste come comportanti rischio di conformità reale al momento del deployment su scala, poiché i termini possono cambiare tra anteprima e release generale in modi che una licenza standard non permette.
Il takeaway pratico: esegui ogni modello che stai valutando attraverso la revisione delle licenze software standard del tuo team legale prima che tocchi i dati di produzione, lo stesso modo in cui faresti con qualsiasi dipendenza di terze parti. Un modello con un punteggio di benchmark più forte e una licenza più oscura non è automaticamente la decisione aziendale migliore.
Cosa Significa Davvero “Competitivo con Modelli Frontier”
Gli annunci dei vendor questa estate sono stati aggressivi nel posizionare i loro modelli come uguali o migliori dei sistemi proprietari leader. Parte di questo è difendibile. Parte di esso ha bisogno di una correzione prima di raggiungere un board deck.
Gli audit indipendenti di Artificial Analysis, un’azienda di benchmarking di terze parti, posizionano Kimi K3 con un punteggio Intelligence Index di 57,1, classificandolo al terzo posto a livello globale, contro i circa 60 di Claude Fable 5. È un divario reale, e si vede nettamente nei compiti di ragionamento più difficile: sul benchmark Omniscience, Fable 5 risponde correttamente al 61% delle domande di fatto difficili rispetto al 46% di K3. K3 mostra anche un tasso di allucinazione più elevato rispetto al suo predecessore, 51% rispetto al 39%, un dettaglio che vale la pena prendere sul serio se il tuo caso d’uso tocca qualcosa di critico per i fatti come il lavoro legale o di conformità. Questi punteggi di indice sono uno snapshot: Artificial Analysis li ricalcola mentre nuovi modelli e varianti di ragionamento esteso entrano nella classifica, quindi tratta i numeri esatti come direzionali piuttosto che controllarli una volta e archiviarli.
Dove K3 guadagna davvero i suoi titoli è la codifica. Il suo punteggio Frontend Code Arena e il risultato di SWE-bench Verified sono entrambi forti con qualsiasi misura indipendente, e più professionisti riferiscono di risultati solidi distribuendo K3 in pipeline di ingegneria reale. La lezione si generalizza oltre K3. I modelli a pesi aperti tendono a essere forti su lavoro specifico per compito come la generazione di codice e più deboli su ragionamento ampio e difficile. Un grafico di benchmark che mescola i due in un titolo “competitivo con modelli frontier” ti fa un cattivo servizio.
C’è una seconda piega che vale la pena segnalare. Setup di valutazione diversi possono far oscillare il punteggio dello stesso modello di 10 a 26 punti. Solo questo rende le tabelle di benchmark cross-vendor inaffidabili, anche quando nessuno coinvolto è deliberatamente fuorviante. Una revisione incentrata sulla sicurezza di Semgrep illustra il problema dall’interno: l’esecuzione di Kimi K3 attraverso due configurazioni di scoring diverse della sua stessa ha prodotto due numeri di precisione diversi per lo stesso modello, e K3 è rimasto dietro i modelli concorrenti sul confronto cross-modello di Semgrep stesso. Tratta le tabelle di benchmark cross-vendor come direzionali nel migliore dei casi. Affidati ai numeri sottoposti a audit indipendente, come l’Artificial Analysis Intelligence Index, quando la decisione effettivamente conta.
E una cautela su GLM: il prossimo modello di Zhipu, ampiamente indicato online come GLM-5.5, è previsto intorno ad agosto 2026 sulla base di note degli analisti e perdite della comunità che descrivono un’architettura con più di 1 trilione di parametri. Al momento della stesura, Zhipu non ha pubblicato alcuna model card ufficiale, benchmark o endpoint API per questo. Fino a quando le cose non cambieranno, tratta GLM-5.5 come una voce che non dovrebbe fattorizzare in una decisione di deployment.
Cosa Costa Davvero Gestire Questi Modelli
Questo è dove il divario tra il titolo e la realtà del deployment è più ampio. Kimi K3 e Qwen 3.8-Max sono i due modelli a pesi aperti più grandi e capaci disponibili in questo momento, e nessuno dei due è un obiettivo realistico di auto-hosting per un’azienda tipica. L’esecuzione di un modello con 2,8 trilioni di parametri in scala di produzione richiede infrastruttura GPU nell’intervallo di 10 milioni fino a 100 milioni di dollari o più, oppure una partnership negoziata con un fornitore di inferenza gestito. È una decisione infrastrutturale sulla scala della costruzione di un data center piuttosto che dell’installazione di software. Poche aziende ne hanno bisogno.
A volte vedrai K3 descritto come in grado di “girare su hardware consumer”. Questo è fuorviante anche dopo aver tenuto conto della quantizzazione: i pesi di K3 totali circa 1,4 terabyte una volta compressi, più di quella che qualsiasi singola GPU sul mercato può contenere, incluso una scheda di workstation da 50.000 a 100.000 dollari. La guida di deployment di Moonshot stessa richiede un cluster di 64 o più acceleratori, e un deployment di produzione reale significa affittare o costruire quel cluster, entrando in decine di migliaia di dollari al mese come minimo. La matematica è spietata. Il titolo oscura sia il costo effettivo che l’infrastruttura effettiva.
I modelli che la maggior parte delle aziende può realisticamente auto-hostare si trovano in un livello molto diverso: modelli da 40 a 100 miliardi di parametri, spesso design mixture-of-experts dove solo una piccola frazione dei parametri si attiva per inferenza, girando bene-quantizzati su una singola GPU ad alte prestazioni. I 40 miliardi di parametri attivi di GLM-5.2 e i 41 miliardi attivi di Mistral Large 3 cadono entrambi in questo intervallo, anche se i loro conteggi di parametri totali sembrano grandi sulla carta. Questo è anche dove i varianti più piccoli di Llama e la maggior parte dei deployment auto-hostati pratici già vivono. Gli flagship da trilioni di parametri generano la copertura stampa; questi modelli più piccoli generano il traffico di produzione effettivo.
Sulla domanda più ampia dei costi, sii scettico riguardo all’affermazione che i modelli a pesi aperti sono ora semplicemente più economici di auto-hostare rispetto a un’API proprietaria. È vero solo al di sopra di una certa soglia, e quella soglia è fissata dal volume e dalla prevedibilità piuttosto che da quale modello hai scelto. L’auto-hosting si pareggia principalmente con carichi di lavoro ad alto volume e stabili, milioni di token al giorno, sostenuti. Per domanda imprevedibile o saltuaria, un’API gestita di solito rimane ancora più economica una volta che conti l’affitto GPU, il tempo dello staff per la valutazione del modello e l’overhead operativo di gestire il tuo stack di inferenza.
La maggior parte delle aziende che eseguono AI in produzione nel 2026 utilizza invece un approccio ibrido piuttosto che scegliere un lato. Un’API gestita per ragionamento complesso o ad alte puntate, modelli auto-hostati più piccoli per lavoro ad alto volume e bassa complessità come classificazione o redazione di primo passaggio. Se desideri un walkthrough più approfondito di quel calcolo per il tuo carico di lavoro, il nostro articolo su esecuzione di un cluster di inferenza locale per una PMI affronta l’hardware e la matematica del break-even in dettaglio.
La Domanda di Conformità che Nessun Deck del Vendor Risponde
Quattro delle sei famiglie di modelli credibili coperte qui, Qwen, Kimi K3, DeepSeek e GLM, provengono da laboratori cinesi. Questi sono quattro su sei. Nessuno della documentazione ufficiale per questi modelli affronta le norme di controllo dell’esportazione degli USA o gli obblighi dell’EU AI Act che possono applicarsi a seconda della tua giurisdizione, del tuo settore e di come distribuisci il modello.
Le normative sull’amministrazione dell’esportazione e la legislazione specifica sull’IA dell’UE sono entrambe aree attive e in evoluzione della legge, e nessuno di Moonshot, Alibaba né Zhipu pubblica indicazioni su come i loro termini di licenza o di deployment interagiscono con entrambi i framework. Se la tua azienda opera con giurisdizione di controllo dell’esportazione degli USA, in un settore regolamentato dell’UE, o gestisce lavoro governativo o adiacente alla difesa, coinvolgi il team legale prima che l’ingegneria inizia a costruire contro il modello, mentre la decisione è ancora economica da invertire.
Non faremo finta di risolvere quella domanda qui, perché dipende davvero dalla tua giurisdizione, dal tuo settore e dalle specifiche del tuo deployment. Quello che diremo è questo: se la documentazione di un vendor è silenziosa sul controllo dell’esportazione e l’esposizione normativa, quel silenzio non è la stessa cosa di un certificato di buona salute. Costruisci la revisione legale nella tua timeline di valutazione dall’inizio, prima che un modello sia già in produzione e la revisione diventi un passaggio che qualcuno scopre è stato saltato.
Chi Dovrebbe Davvero Valutare Modelli a Pesi Aperti Adesso
Un buon adattamento se:
- Hai un carico di lavoro ad alto volume e prevedibile dove i costi dei token si compongono in modo significativo nel corso di un anno.
- I requisiti di residenza dei dati o di ubicazione dei dati contrattuali rendono un’API di terze parti un “no” duro indipendentemente dal costo.
- Il tuo caso d’uso primario è la generazione di codice o un altro compito ristretto e ben sottoposto a benchmark dove i modelli a pesi aperti più piccoli già funzionano vicino al livello frontier.
- Hai, o sei disposto a costruire, la capacità interna di valutare, fine-tuning e monitorare un modello nel tempo. L’auto-hosting è un impegno di ingegneria continuo che supera il deployment iniziale, più vicino all’assunzione che all’approvvigionamento.
Probabilmente non la mossa giusta ancora se:
- Il tuo utilizzo è a basso volume o imprevedibile. Un’API gestita molto probabilmente rimarrà più economica.
- Il tuo caso d’uso è ragionamento ampio e difficile dove il gap attuale tra modelli a pesi aperti e modelli proprietari frontier (circa 6 punti su Artificial Analysis Intelligence Index) è probabile che importi.
- Non hai ancora nessuno in-house che possa possedere valutazione del modello e infrastruttura come responsabilità continua.
- Stai considerando un modello di origine cinese per un carico di lavoro regolamentato o adiacente al governo senza l’approvazione legale ancora in mano.
Dove Questo Paesaggio Sta Davvero Andando
Il divario tra i migliori modelli a pesi aperti e i migliori sistemi proprietari frontier si è ridotto in modo significativo nel corso dell’ultimo anno, da circa 13 punti a circa 6 punti su indici di benchmark indipendenti. Questo è un trend reale. È ragionevole aspettarsi che continui. Ma “ridotto” non è la stessa cosa di “chiuso”, e i modelli che generano la maggior parte dell’attenzione in questo momento, i rilasci da trilioni di parametri di Moonshot e Alibaba, sono i meno accessibili per un’azienda tipica da eseguire davvero.
Se stai valutando se l’AI a pesi aperti ha un posto nel tuo stack, la domanda più utile di solito non è “quale modello guida la classifica questo mese”. È se il tuo carico di lavoro è abbastanza stabile e il tuo team abbastanza equipaggiato per far pagare l’auto-hosting, se la sensibilità dei dati giustifica lo sforzo, e se il modello specifico che stai occhiando ha una licenza che il tuo team legale effettivamente approviamo. Quelle domande non si muovono quasi velocemente quanto il ciclo di rilascio, che è esattamente perché meritano di essere risposte con attenzione. Per uno sguardo più vicino a se l’auto-hosting si adatta alla tua situazione, leggi la nostra guida su AI on-premise per piccole e medie aziende, e se i framework agentici fanno parte del piano, il nostro confronto di piattaforme agentiche open source rispetto proprietarie copre lo strato che tipicamente si siede in cima a qualsiasi modello tu scelga.
Domande frequenti
Cosa significa davvero "a pesi aperti" e non è la stessa cosa di open source?
A pesi aperti significa che i parametri addestrati di un modello sono pubblicati perché chiunque possa scaricarli ed eseguirli, a differenza dei modelli chiusi come GPT o Claude che sono accessibili solo tramite API. Non è la stessa cosa di open source: diversi rilasci a pesi aperti, tra cui Llama di Meta e Kimi K3 di Moonshot, utilizzano licenze personalizzate o della comunità con restrizioni d'uso piuttosto che una vera licenza open source come Apache 2.0 o MIT.
Quali famiglie di modelli a pesi aperti vale la pena valutare per un''azienda nel 2026?
Sei famiglie hanno attualmente track record credibili e verificabili per la produzione: Qwen e Kimi K3 (scala frontier, requisiti infrastrutturali massimi), GLM e DeepSeek (forte performance di codifica a costi inferiori), Llama e Mistral (ecosistemi maturi con licenze permissive). Quale si adatta dipende dal tuo carico di lavoro, dalla tua tolleranza di licenza e dal fatto che tu abbia bisogno di ragionamento a livello frontier o di un modello più piccolo e conveniente per un compito ristretto.
I modelli a pesi aperti effettivamente risparmiano denaro rispetto a un''API proprietaria come Claude o GPT?
Solo oltre un certo volume e solo per carichi di lavoro stabili e prevedibili. L'auto-hosting comporta costi infrastrutturali e di staff fissi che un'API a pagamento per token non ha, quindi vince principalmente su costi con utilizzo sostenuto e ad alto volume. Per domanda saltuaria o imprevedibile, un'API gestita di solito rimane ancora più economica una volta conteggiati onestamente l'affitto GPU, la manutenzione e il tempo di valutazione.
È legale per un''azienda occidentale distribuire un modello a pesi aperti sviluppato in Cina come Qwen o Kimi K3?
Dipende dalla tua giurisdizione, dal tuo settore e da come il modello è distribuito, e la documentazione del vendor per questi modelli non affronta obblighi di controllo dell'esportazione o dell'AI Act dell'UE. Le aziende in settori regolamentati o soggette alle norme di amministrazione dell'esportazione degli USA dovrebbero ottenere consulenza legale specifica per la giurisdizione prima di impegnarsi a un modello di origine cinese in un sistema di produzione.
Quanto grande deve essere un modello a pesi aperti per girare su una singola GPU?
I modelli nell'intervallo da 40 a 100 miliardi di parametri, in particolare i design mixture-of-experts dove solo una frazione dei parametri si attiva per token, possono girare bene-quantizzati su una singola GPU ad alte prestazioni. I modelli flagship da trilioni di parametri come Kimi K3 e Qwen 3.8-Max sono un livello completamente diverso, richiedendo cluster multi-GPU o un'API gestita piuttosto che una singola workstation.