Usuarios dicen que GPT-6 Astra empeoró tras su lanzamiento

By bonuz NewsroomPublished September 12, 2026
GPT-6 Astra Users Say Model Got Dumber After Launch

El nuevo modelo de OpenAI, GPT-6 Astra, se lanzó hace una semana entre elogios generalizados, incluida una recreación de Manhattan calle por calle dentro de un motor de videojuego. Ahora los usuarios dicen que el modelo se siente más torpe. La polémica importa porque pone en duda si los laboratorios de IA recortan en silencio el poder de cómputo una vez que se apaga el ruido del lanzamiento.

Qué pasó realmente

El desarrollador synthwavedd escribió en X que "Astra se siente notablemente más tonto hoy", y bautizó el fenómeno como "la lobotomía post-lanzamiento". El desarrollador Pranjal Paliwal revisó código generado por Astra y concluyó: "No tenemos AGI. Tenemos una regresión", según Decrypt. El desarrollador Pankaj Kumar enumeró los síntomas: respuestas más rápidas, peor calidad, y la sospecha de que OpenAI "redujo el valor del jugo", un término no oficial para referirse al esfuerzo de cómputo invertido en cada respuesta. Los investigadores Salio y Md Ismail Sojal corrieron los mismos prompts contra la versión del día del lanzamiento y la versión actual, y ambos reportaron peores resultados ahora. Astra cuesta 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, 2.5 veces el precio de lanzamiento de su predecesor, GPT-5.6 Sol. No todos coinciden en que hubo un recorte deliberado: el usuario Antikythera sostuvo que el modelo "es tan tonto como lo era en el lanzamiento", y que simplemente se disipó el entusiasmo inicial.

Cómo llegamos hasta acá

Esto no es nuevo. El anterior modelo insignia de OpenAI, GPT-5.6 Sol, enfrentó la misma polémica en julio de 2026, cuando los usuarios reportaron que su modo de razonamiento más potente se había vuelto superficial de un día para otro. El ejecutivo de OpenAI, Tibo Sottiaux, negó haber debilitado deliberadamente a Sol, aunque confirmó que la compañía había estado experimentando con el "esfuerzo de razonamiento", el ajuste que controla cuántos pasos piensa un modelo antes de responder, según Decrypt. Dax Raad, fundador de la herramienta de programación Opencode, dijo que su equipo ya volvió a usar Sol en lugar de Astra, porque los costos se duplicaron para resultados que no lo justificaban. El propio presidente de OpenAI usó el término AGI para describir a Astra en su lanzamiento, una afirmación que ahora sus propios usuarios le devuelven como crítica.

Por qué esto te importa

Para los desarrolladores que dependen de la API de OpenAI, la inconsistencia en la calidad de las respuestas tiene un impacto directo en los costos, ya que Astra cobra más por token de lo que cobraba Sol en su lanzamiento. Los equipos que calcularon sus proyectos en base al rendimiento de la semana de estreno podrían necesitar reajustar presupuestos o cambiar de modelo a mitad de camino. Para el usuario común, el episodio es un recordatorio de que los benchmarks y las demostraciones de IA capturan un momento puntual, no una garantía permanente. Y para el impulso más amplio de dispositivos de realidad aumentada y wearables, que dependen de un razonamiento de IA estable y asequible, la calidad impredecible de los modelos eleva la vara de lo que las empresas deben probar antes de lanzar productos atados a un solo proveedor.

La gran pregunta

Si los laboratorios de IA pueden ajustar en silencio cuánto esfuerzo de cómputo dedica un modelo a cada respuesta después del lanzamiento, ¿cómo deberían usuarios, desarrolladores y reguladores verificar que una capacidad anunciada sigue coincidiendo con lo que el modelo realmente entrega días o meses después, y quién es responsable de demostrar esa consistencia?

Qué vigilar

OpenAI todavía no ha emitido un comunicado al estilo del de Sol para responder a las quejas sobre Astra. Habrá que estar atentos a una respuesta oficial, similar a los comentarios de Tibo Sottiaux en julio sobre Sol. Astra sigue siendo el primer modelo de OpenAI en cruzar el umbral de riesgo de ciberseguridad de la compañía, restringido a defensores autorizados bajo su programa Daybreak. Es probable que en las próximas semanas surjan más pruebas comparativas de desarrolladores con los mismos prompts.

Keep reading