Claude Fable 5.1
Il più potente tra quelli verificati. Pensato per lavoro intellettuale complesso, non per il giorno per giorno di un’attività piccola: più potenza — e prezzo — di quanto quasi nessuno qui ne abbia bisogno.
Tenerife.click/Confronto IA
Né il leaderboard più tecnico né quello che ti vende un abbonamento. Prezzo reale, un dato ufficiale di ragionamento e, soprattutto, a cosa serve ogni modello in un’attività piccola.
Dati verificati il 2026-09-15. Ogni cifra porta la sua fonte. Quelle che non sono ufficiali lo dicono, non si nascondono.
Dietro ogni modello c’è un’azienda che vuole che tu scelga proprio quello. Qui non ne vendiamo nessuno: mettiamo solo il prezzo e un dato di ragionamento uno accanto all’altro, con la fonte in vista, e ti diciamo a cosa serve davvero in un’attività piccola.
Vedrai due etichette: Ufficiale quando il dato viene direttamente dal produttore, e Comunità quando viene da un aggregatore indipendente perché il produttore non lo pubblica in quella forma. Nessuna cifra compare senza le due cose: da dove viene e quando l’abbiamo verificata.
In breve
Ingresso (quello che gli mandi) e uscita (quello che ti restituisce), in dollari. L’uscita è di solito la parte cara.
| Modello | Ingresso / 1M | Uscita / 1M | Fonte |
|---|---|---|---|
| GPT-5.6 Luna | $0,20 | $1,20 | eesel.ai (fuente independiente) |
| Mistral Large 3 | $0,50 | $1,50 | mistral.ai/pricing |
| DeepSeek V4-Pro | $0,66 | $1,98 | api-docs.deepseek.com |
| Gemini 3.8 Flash | $0,75 | $3,75 | ai.google.dev/pricing |
| Claude Haiku 4.5 | $1 | $5 | claude.com/pricing |
| Gemini 3.1 Pro | $2 | $12 | ai.google.dev/pricing |
| Claude Opus 5 | $5 | $25 | claude.com/pricing |
| GPT-6 Astra | $10 | $50 | openai.com (anuncio oficial) |
| Claude Fable 5.1 | $10 | $50 | claude.com/pricing |
Percentuale di risposte corrette su domande di livello dottorato (fisica, biologia, chimica). Il benchmark ufficiale che più produttori pubblicano in modo comparabile.
| Modello | GPQA Diamond | Dato | Fonte |
|---|---|---|---|
| GPT-6 Astra | 96,0% | Ufficiale | openai.com (tabla de lanzamiento) |
| Gemini 3.1 Pro | 94,3% | Ufficiale | deepmind.google (ficha del modelo) |
| Claude Fable 5.1 | 93,7% | Ufficiale | System Card (Anthropic, PDF) |
| Claude Opus 5 | 93,2% | Ufficiale | System Card (Anthropic, PDF) |
| DeepSeek V4-Pro | 90,1% | Ufficiale | Hugging Face (ficha del modelo) |
| Mistral Large 3 | 43,9% | Comunità | Vals AI (agregador independiente) |
E la programmazione? Non c’è ancora un modo pulito di confrontarli: ogni produttore misura il codice con un benchmark diverso (SWE-bench Verified, LiveCodeBench, DeepSWE...) e, nei modelli più recenti, le fonti non sono nemmeno concordi tra loro — una cifra di DeepSeek, per esempio, è segnalata da un revisore indipendente come "solo rivendicazione interna, non riprodotta da terzi". Lo stesso vale per le classifiche "comunità" tipo Arena: cambiano di settimana in settimana. Prima di trasformare tutto questo in un grafico che sembri più solido di quanto sia, preferiamo dirlo così. Non includiamo nemmeno Grok (xAI) né Llama (Meta): non abbiamo trovato una cifra ufficiale di ragionamento per Grok, e a metà settembre 2026 non è chiaro quale sia oggi il modello "attuale" di Llama. Lo aggiungeremo appena ci sarà qualcosa di verificabile.
Modello per modello
Il più potente tra quelli verificati. Pensato per lavoro intellettuale complesso, non per il giorno per giorno di un’attività piccola: più potenza — e prezzo — di quanto quasi nessuno qui ne abbia bisogno.
Il punto di equilibrio di Anthropic: qualità alta a prezzo medio. Buona opzione per scrittura o assistenza clienti un po’ più impegnativa di un chatbot base.
L’opzione economica di Anthropic. Per compiti semplici e ripetitivi: classificare email, riassumere testi brevi.
Il modello di riferimento di OpenAI in questo momento. Il miglior dato ufficiale di ragionamento che siamo riusciti a verificare. Prezzo di fascia alta.
L’opzione economica di OpenAI. Va bene per chat e assistenza di base; non per compiti che richiedono molto ragionamento.
Il generalista di Google. Prezzo medio, dati di ragionamento ufficiali solidi. Se non sai quale scegliere, è una scommessa sicura.
La più economica di questa lista con prezzo ufficiale verificato. Per compiti ripetitivi: descrizioni prodotto, risposte alle recensioni.
Prezzo molto aggressivo. Ma con due riserve: i suoi server sono in Cina (occhio al RGPD prima di mandargli dati di clienti) e diverse delle sue cifre di prestazione non sono verificate da nessuno al di fuori dell’azienda stessa.
L’unica europea di questa lista — azienda francese, dato rilevante se ti preoccupa dove vivono i dati dei tuoi clienti. In cambio, resta chiaramente indietro nel ragionamento.
Ogni prezzo e ogni percentuale di questa pagina si può verificare qui. Se qualcosa cambia e non l’abbiamo aggiornato, vale la fonte.
Quattro passi prima di scegliere qualsiasi strumento.
Le date reali, non quelle che ti vendono con fretta.
Tre livelli di contributi che quasi nessuno combina.