Descripción general
TTS 1.5 Mini convierte texto escrito en voz con sonido natural en aproximadamente 120 milisegundos, lo que lo convierte en una de las opciones de síntesis más rápidas disponibles. Ya sea que necesites un borrador de locución, una narración para una demostración de producto o una notificación hablada para una app, pegas el texto, eliges una voz y obtienes un archivo de audio limpio en segundos. Disponible en Picasso IA, cubre 15 idiomas, por lo que los proyectos multilingües ya no requieren sesiones de grabación separadas ni herramientas diferentes para cada localidad. El resultado es un flujo de trabajo en el que puedes iterar entre varias tomas en el tiempo que antes tomaba preparar una sola grabación.
Cómo funciona
- Pega hasta 2.000 caracteres de texto en el campo de entrada. Puedes incluir etiquetas de pausa para pausas temporizadas, marcadores de emoción como [happy] o [sad], y sonidos no verbales como [laugh] o [sigh] para dar forma a la interpretación.
- Selecciona una voz de la lista predefinida (Ashley, Dennis, Alex y otras) o introduce un ID de voz personalizado si tienes una voz clonada guardada.
- Elige tu formato de audio: MP3, WAV, OGG Opus o FLAC. Elige una frecuencia de muestreo de 8.000 Hz hasta 48.000 Hz para ajustarte a las especificaciones técnicas de tu proyecto.
- Ajusta la velocidad de habla si necesitas una interpretación más rápida o más lenta, y configura la temperatura para controlar cuán expresiva o neutral suena la voz.
- Activa, desactiva o deja en automático la normalización de texto para que los números, fechas y abreviaturas se lean de forma natural.
- Haz clic en generar. TTS 1.5 Mini procesa la entrada y devuelve tu archivo de audio en unos 120 milisegundos.
Preguntas frecuentes
¿Necesito habilidades de programación o conocimientos técnicos para usar esto?
No, solo abre TTS 1.5 Mini en Picasso IA, ajusta la configuración que quieras y pulsa generar.
¿Es gratis para probar?
Sí, puedes usar TTS 1.5 Mini sin necesidad de configurar una cuenta ni realizar ningún pago para empezar. Envía tu texto, elige una voz y descarga el archivo.
¿Cuánto tarda en obtenerse el resultado?
El modelo apunta a una latencia de unos 120 milisegundos desde la solicitud hasta la salida de audio. Para la mayoría de las entradas, el archivo está listo casi en cuanto haces clic en generar.
¿Qué formatos de salida son compatibles?
TTS 1.5 Mini exporta audio en MP3, WAV, OGG Opus y FLAC. También puedes seleccionar entre siete opciones de frecuencia de muestreo, de 8.000 Hz a 48.000 Hz, para ajustarte a los requisitos técnicos de tu plataforma.
¿Puedo personalizar la voz o el estilo de habla?
Sí. Elige entre nombres de voces predefinidas o proporciona un ID de voz clonado personalizado. El parámetro de temperatura controla la expresividad: los valores más bajos dan un tono consistente y neutral; los más altos añaden más variación. El control deslizante de velocidad de habla te permite ralentizar o acelerar la narración.
¿Qué idiomas admite TTS 1.5 Mini?
Admite 15 idiomas, por lo que puedes producir contenido de audio multilingüe desde una sola herramienta sin cambiar entre servicios.
¿Dónde puedo usar los archivos de audio que descargo?
Los archivos de salida son limpios y no tienen marcas de agua añadidas, así que puedes incorporarlos directamente en ediciones de video, pódcast, apps móviles, módulos de aprendizaje electrónico o cualquier proyecto que necesite audio hablado.