Speech to Text: API de Reconocimiento de Voz

Integrado en sus herramientas conversacionales: el mejor reconocimiento de voz del mercado, diseñado para desarrolladores.

Tasa de error por palabra< 5 %El motor más preciso de Francia, tras LMF
Latencia< 600 msEn streams conversacionales en directo, en condiciones reales
PrecioEl más bajoDel mercado, compromiso por minuto

Con la confianza de empresas líderes, integradores e investigadores

Language Model Factory

Adaptación exprés de los modelos de lenguaje

Con nuestra Language Model Factory (LMF), ningún vocabulario de dominio queda sin reconocer. Entrene modelos personalizados en tan solo 15 minutos y seleccione el que mejor se adapte a su caso de uso.

  • Un modelo listo para producción en 15 minutos
  • Jerga, nombres propios, acrónimos del sector
  • Modelos verticales preentrenados listos para usar
01

Modelos verticales

Preentrenados en verticales específicos del sector.

02

Jerga y nombres propios

Vocabulario propio de su negocio.

03

Acrónimos

Reconocimiento y expansión automáticos.

04

Expresiones de negocio

Específicas de sus procesos y casos de uso.

Anonimización

Proteger y anonimizar los datos sensibles

Anonimización automática en tiempo real de la información sensible según sus casos de uso: datos personales, bancarios y de salud.

Agente Acme Corp: Hola, ha llamado a Acme Corp[empresa]. ¿En qué puedo ayudarle hoy?

Cliente: Hola, le llamo para actualizar mis datos personales.

Agente Acme Corp: Sin problema, le ayudo con eso. ¿Me puede dar su nombre completo, por favor?

Cliente: Sí, es Jean Persona[nombre] [apellido].

Agente Acme Corp: Gracias, Jean[nombre]. ¿Y cuál es su nueva dirección?

Cliente: Es 123 Rue de l’Élysée, 75000 Paris[dirección].

Agente Acme Corp: Muy bien, queda anotado. ¿Tiene también un nuevo número de teléfono?

Cliente: Sí, el nuevo es el 06 12 34 56 78[teléfono].

Agente Acme Corp: Perfecto. Una última pregunta: ¿han cambiado sus datos de pago?

Cliente: Sí, tengo una nueva tarjeta bancaria: 1234 5678 9101 1121, caducidad 12/26, CVV 321[tarjeta bancaria].

Agente Acme Corp: Gracias, Jean[nombre]. ¡Sus datos están actualizados!

Batch

API Speech-to-Text de las grabaciones de audio

Deposite sus conversaciones telefónicas en un FTP seguro para transcribirlas en minutos, o utilice nuestros conectores:

NICEGenesysAxialysOdigo
Idiomas disponibles

Francés, inglés, español, alemán, italiano, +5 más (Europa)

PYTHON SDK
# Subida FTP segura
import uhlive
client = uhlive.connect("api.uh.live")
# Transcripción batch
job = client.transcribe_file(
    file="call_2026-04-28.wav",
    model="es-telephony-v3",
    redaction=True
)
# Resultado
transcript = job.result()
print(transcript.text)
Ilustración: transcripción multilingüe para humanos
Streaming · En directo

API Streaming para humanos

Conecte sus streams de audio directamente vía WebSocket y reciba transcripción multilocutor en tiempo real, o vía Trunk SIP / SIP REC.

Idiomas disponibles

Francés, inglés, español y alemán

Streaming · Bot

API Streaming para bots

API Streaming para IVR y voicebots. Transcriba sus interacciones en directo con nuestras soluciones avanzadas.

Ilustración: voicebot multilingüe
Nuestros protocolos
  • › MRCP v2
  • › WebSocket
Integrado en cada interacción

Detección de actividad vocal, selección de modelo lingüístico, gramáticas, reconocimiento de direcciones, fechas, números y respuestas booleanas.

Idiomas disponibles

Francés, inglés, español y alemán

WER < 5 %Motor más preciso de Francia
100 MLlamadas analizadas al año
40 %De análisis en tiempo real

¿Listo para transcribir sus primeras llamadas?

Acceda a la API Speech-to-Text de uh!ive. Configuración en minutos.

Pruébelo gratis