OpenAI ha presentado Ultrafast, un nuevo modo de ejecución para GPT-5.6 Sol capaz de generar respuestas hasta 14 veces más rápido que el procesamiento estándar. La compañía habla de velocidades máximas de 750 tokens de salida por segundo, una cifra que cambia la relación entre potencia y tiempo de espera.
Hasta ahora, obtener una respuesta casi instantánea solía implicar escoger un modelo pequeño. Ultrafast intenta mantener las capacidades de GPT-5.6 Sol y reducir el tiempo necesario para utilizarlas en procesos donde cada segundo importa.
El modo se encuentra en una fase de acceso limitado y está orientado inicialmente a la API y a cargas profesionales. No significa que todas las conversaciones de ChatGPT vayan a responder automáticamente a esa velocidad. OpenAI detalla el avance en su presentación oficial.
La velocidad no sirve solo para leer antes una respuesta
Cuando utilizamos un chatbot, esperar diez segundos puede resultar molesto, pero rara vez bloquea el trabajo. En una aplicación de atención al cliente, un sistema de respuesta a incidentes o una herramienta que ejecuta decenas de pasos, la latencia se acumula.
Un agente puede consultar una base de datos, interpretar el resultado, llamar a otra herramienta y corregir una acción. Si cada paso requiere varios segundos, una tarea aparentemente sencilla tarda minutos. Multiplicar la velocidad del modelo permite que el conjunto se sienta mucho más cercano a una aplicación convencional.
OpenAI menciona usos en análisis financiero, comercio electrónico, soporte e incidentes informáticos. Son entornos donde la información cambia rápidamente y una respuesta correcta que llega tarde puede perder gran parte de su valor.
Para entender dónde encaja esta modalidad conviene consultar nuestra guía sobre GPT-5.6, ChatGPT Work y Codex. Ultrafast no sustituye esas herramientas: es una forma distinta de ejecutar el modelo que puede integrarse en ellas o en aplicaciones externas.
Qué significa realmente alcanzar 750 tokens por segundo
Los modelos no producen palabras completas, sino tokens: fragmentos de texto que pueden representar una palabra, una parte de ella o un signo. La relación cambia según el idioma, por lo que no debemos traducir 750 tokens en 750 palabras exactas.
Aun con esa precaución, la velocidad es muy elevada. Una respuesta de varios párrafos puede aparecer prácticamente de inmediato. El límite deja de estar en la escritura del modelo y pasa a depender de la conexión, la interfaz y las herramientas externas que utilice.
La cifra de “hasta 14 veces” tampoco será constante. La mejora variará según la longitud de la entrada, la complejidad de la tarea y la infraestructura disponible. Los máximos de laboratorio sirven para entender la escala, no para prometer el mismo rendimiento en cada petición.
Más rapidez suele significar más coste
OpenAI posiciona Ultrafast como una capacidad especial, no como el nuevo funcionamiento gratuito de GPT-5.6 Sol. Mantener hardware preparado para entregar una gran cantidad de tokens en muy poco tiempo exige reservar más recursos y reducir la cantidad de usuarios que pueden compartirlos.
Las empresas tendrán que decidir si la latencia justifica el precio. Para redactar un informe que se revisará una hora después, probablemente no. Para responder mientras un cliente espera al teléfono o detectar un fallo en producción, sí puede hacerlo.
También habrá que medir si la aceleración altera la estabilidad del modelo. OpenAI sostiene que mantiene sus capacidades, pero el rendimiento real deberá comprobarse con tareas largas, uso de herramientas y contextos amplios.
El siguiente salto de la IA puede sentirse menos espectacular
Las nuevas generaciones suelen presentarse mediante mejores resultados en exámenes y pruebas de razonamiento. Sin embargo, la utilidad diaria también depende de la velocidad, el precio y la disponibilidad.
Un modelo ligeramente más inteligente no siempre transforma una aplicación. Un modelo suficientemente bueno que responde catorce veces más rápido puede convertir un proceso lento en algo utilizable.
La misma lógica aparece en la IA local: no basta con que el ordenador sea capaz de cargar un modelo; debe ejecutarlo a una velocidad razonable. Como explicamos al hablar de qué significa realmente que un PC tenga IA, el rendimiento útil no cabe en una sola cifra.
Ultrafast no es la actualización más vistosa de GPT-5.6, pero puede ser una de las más importantes para los agentes. Cuando la IA empieza a actuar sobre sistemas reales, esperar menos deja de ser una comodidad y se convierte en una capacidad.