Claude Fable 5.1
El más potente de los que hemos comprobado. Pensado para trabajo intelectual complejo, no para el día a día de un negocio pequeño: más precio y potencia de la que casi nadie necesita aquí.
Tenerife.click/Comparativa IA
Ni el leaderboard más técnico ni el que te vende una suscripción. Precio real, un dato oficial de razonamiento y, sobre todo, para qué sirve cada modelo en un negocio pequeño.
Datos verificados el 2026-09-15. Cada cifra lleva su fuente. Las que no son oficiales lo dicen, no se disimulan.
Cada modelo tiene detrás una empresa que quiere que lo elijas a él. Aquí no vendemos ninguno: solo ponemos el precio y un dato de razonamiento uno al lado del otro, con la fuente a la vista, y te decimos para qué sirve de verdad en un negocio pequeño.
Verás dos etiquetas: Oficial cuando el dato viene directo del fabricante, y Comunidad cuando viene de un agregador independiente porque el fabricante no lo publica de esa forma. Ninguna cifra aparece sin las dos cosas: de dónde sale y cuándo la comprobamos.
En resumen
Entrada (lo que le mandas) y salida (lo que te devuelve), en dólares. La salida suele ser la parte cara.
| Modelo | Entrada / 1M | Salida / 1M | Fuente |
|---|---|---|---|
| GPT-5.6 Luna | $0,20 | $1,20 | eesel.ai (fuente independiente) |
| Mistral Large 3 | $0,50 | $1,50 | mistral.ai/pricing |
| DeepSeek V4-Pro | $0,66 | $1,98 | api-docs.deepseek.com |
| Gemini 3.8 Flash | $0,75 | $3,75 | ai.google.dev/pricing |
| Claude Haiku 4.5 | $1 | $5 | claude.com/pricing |
| Gemini 3.1 Pro | $2 | $12 | ai.google.dev/pricing |
| Claude Opus 5 | $5 | $25 | claude.com/pricing |
| GPT-6 Astra | $10 | $50 | openai.com (anuncio oficial) |
| Claude Fable 5.1 | $10 | $50 | claude.com/pricing |
Porcentaje de aciertos en preguntas de nivel doctorado (física, biología, química). El benchmark oficial que más fabricantes publican de forma comparable.
| Modelo | GPQA Diamond | Dato | Fuente |
|---|---|---|---|
| GPT-6 Astra | 96,0% | Oficial | openai.com (tabla de lanzamiento) |
| Gemini 3.1 Pro | 94,3% | Oficial | deepmind.google (ficha del modelo) |
| Claude Fable 5.1 | 93,7% | Oficial | System Card (Anthropic, PDF) |
| Claude Opus 5 | 93,2% | Oficial | System Card (Anthropic, PDF) |
| DeepSeek V4-Pro | 90,1% | Oficial | Hugging Face (ficha del modelo) |
| Mistral Large 3 | 43,9% | Comunidad | Vals AI (agregador independiente) |
¿Y en programación? Todavía no hay una manera limpia de compararlos: cada fabricante mide el código con un benchmark distinto (SWE-bench Verified, LiveCodeBench, DeepSWE...) y, en los modelos más recientes, ni siquiera coinciden entre fuentes — alguna cifra de DeepSeek, por ejemplo, está marcada por un revisor independiente como "solo reivindicación interna, sin reproducir por terceros". Lo mismo pasa con los rankings de "comunidad" tipo Arena: cambian de semana en semana. Antes de convertir eso en un gráfico que parezca más sólido de lo que es, preferimos decirlo así. Tampoco incluimos Grok (xAI) ni Llama (Meta): no encontramos una cifra oficial de razonamiento para Grok, y a mediados de septiembre de 2026 no está claro cuál es hoy el modelo "actual" de Llama. Lo añadiremos en cuanto haya algo verificable.
Modelo a modelo
El más potente de los que hemos comprobado. Pensado para trabajo intelectual complejo, no para el día a día de un negocio pequeño: más precio y potencia de la que casi nadie necesita aquí.
El punto de equilibrio de Anthropic: calidad alta a precio medio. Buena opción para redacción o atención al cliente algo más exigente que un chatbot básico.
La opción económica de Anthropic. Para tareas simples y repetitivas: clasificar correos, resumir textos cortos.
El modelo de referencia de OpenAI ahora mismo. El mejor dato oficial de razonamiento que hemos podido verificar. Precio de gama alta.
La opción barata de OpenAI. Bien para chat y soporte básico; no para tareas que exijan razonar mucho.
El generalista de Google. Precio medio, datos de razonamiento oficiales sólidos. Si no sabes cuál elegir, es una apuesta segura.
La más barata de esta lista con precio oficial verificado. Para tareas repetitivas: descripciones de producto, respuestas a reseñas.
Precio muy agresivo. Pero con dos reservas: sus servidores están en China (mira el RGPD antes de mandarle datos de clientes) y varias de sus cifras de rendimiento no están verificadas por nadie fuera de la propia empresa.
La única europea de esta lista — empresa francesa, dato relevante si te preocupa dónde viven los datos de tus clientes. A cambio, va claramente por detrás en razonamiento.
Cada precio y cada porcentaje de esta página se puede comprobar aquí. Si algo cambia y no lo hemos actualizado, la fuente manda.
Cuatro pasos antes de elegir ninguna herramienta.
Las fechas reales, no las que te venden con prisa.
Tres niveles de ayudas que casi nadie combina.