OpenAI ha ampliado su catálogo de herramientas para desarrolladores con el lanzamiento de GPT-Live-Transcribe y GPT-Transcribe, dos nuevos modelos de inteligencia artificial centrados en el reconocimiento de voz y la transcripción. La principal novedad es que están diseñados para comprender el contexto de una conversación y ofrecer resultados más precisos, incluso en tiempo real o en grabaciones con ruido de fondo.
Con este lanzamiento, la compañía busca facilitar el desarrollo de asistentes virtuales, aplicaciones de reuniones, herramientas de atención al cliente y cualquier servicio que necesite convertir voz en texto con la menor latencia posible.
Dos modelos pensados para necesidades diferentes
Aunque ambos modelos comparten la misma base tecnológica, cada uno está orientado a un escenario distinto.
GPT-Live-Transcribe está pensado para transcribir conversaciones en directo con una latísima baja. Además de convertir la voz en texto prácticamente al instante, puede utilizar el contexto de frases anteriores para mejorar la precisión durante una conversación prolongada.
Por su parte, GPT-Transcribe está optimizado para procesar archivos de audio ya grabados. Es una opción enfocada a entrevistas, podcasts, reuniones o cualquier contenido que pueda analizarse de forma asíncrona.
Más precisión gracias al contexto
Una de las funciones más destacadas de estos modelos es la posibilidad de añadir información contextual antes de iniciar la transcripción.
Los desarrolladores pueden proporcionar nombres propios, términos técnicos, palabras clave o incluso indicar el idioma esperado de la conversación. Gracias a ello, la IA reduce errores cuando aparecen conceptos poco habituales o vocabulario especializado.
En el caso de GPT-Live-Transcribe, el sistema también puede aprovechar partes ya transcritas de la conversación para interpretar mejor las siguientes intervenciones, algo especialmente útil en reuniones largas o llamadas con varios participantes.

OpenAI asegura que supera a Whisper
Según los datos compartidos por OpenAI, los nuevos modelos reducen de forma significativa la tasa de errores frente a Whisper-1, el sistema de reconocimiento de voz que la compañía utilizaba hasta ahora.
La empresa afirma que GPT-Transcribe y GPT-Live-Transcribe ofrecen una mayor precisión en situaciones reales, especialmente cuando existen acentos marcados, ruido ambiental o conversaciones complejas. También destacan por comprender mejor el significado de las frases gracias al uso del contexto adicional.
Pensados para aplicaciones y servicios de IA
Estos nuevos modelos estarán disponibles a través de la API de OpenAI, por lo que están dirigidos principalmente a empresas y desarrolladores.
Entre sus posibles aplicaciones se encuentran asistentes virtuales, herramientas para transcribir reuniones, servicios de atención al cliente, plataformas educativas o sistemas capaces de generar subtítulos automáticos casi en tiempo real.
Con este movimiento, OpenAI continúa reforzando su apuesta por la inteligencia artificial basada en voz, un área en la que durante los últimos meses también ha presentado modelos conversacionales capaces de hablar, escuchar y responder de una forma cada vez más natural.
Si quieres estar al día de todas las novedades sobre inteligencia artificial, también puedes consultar nuestra sección dedicada a las mejores herramientas de IA, donde recopilamos las noticias más importantes del sector.
Fuente: OpenAI




