Una cuña de radio de treinta segundos es un guion y una banda sonora peleando por los mismos segundos de atención, y hacer bien las dos cosas antes significaba reservar un estudio, un locutor y un compositor para algo que quizás sonaba dos semanas. Picasso IA genera una locución limpia y una base musical a juego desde la misma cuenta, y luego entrega ambos archivos a cualquier editor de audio para la mezcla final.
Una cuña de radio o de podcast casi siempre funciona en dos capas, y tratarlas por separado es lo que hace que suene profesional en vez de casera. La primera capa es la locución, que hace la venta real: dice quién eres, qué ofreces y qué debe hacer el oyente después. La segunda capa es la base musical debajo, que marca el ambiente y evita que la cuña suene a silencio muerto, pero no debe notarse por sí misma.
Esa disciplina de la segunda capa es donde fallan muchas cuñas caseras. Una base con un gancho vocal fuerte, un relleno de batería intenso o un estribillo alto justo cuando la voz dice el precio compite con la locución en vez de apoyarla. El trabajo de la base es ocupar el espacio alrededor de la voz, no el espacio que la voz necesita.
En Picasso IA las dos capas vienen de dos capacidades distintas en el mismo Toolkit: un modelo de texto a voz convierte tu guion en locución, y un modelo de generación de música convierte una descripción breve de estilo en una base instrumental. Ambas se generan por separado y se combinan después, lo que también te da control sobre el equilibrio entre ellas.
Las cuñas de radio y podcast se venden en duraciones fijas, normalmente 15, 30 o 60 segundos, y un guion que se pasa de largo se corta a mitad de frase o se lee a una velocidad forzada. La velocidad de lectura conversacional media ronda las 150 palabras por minuto, cerca de dos palabras y media por segundo, así que un bloque de 30 segundos admite cómodamente entre 65 y 75 palabras dejando algo de margen al principio y al final.
Escribe pensando en ese número de palabras en lugar de escribir todo lo que quieres decir y esperar que quepa. Un guion que apenas cabe se lee con prisa, y una locución apresurada suena ansiosa en vez de segura, lo cual juega en tu contra cuando todo el sentido del anuncio es sonar confiable. Deja un momento de silencio después de la oferta y antes de la llamada a la acción, porque muchas veces esa pausa es lo que hace que la última frase quede grabada.
Genera la locución antes de dar el guion por definitivo, no después. Escuchar la lectura con su tiempo real dice de inmediato si el ritmo funciona, algo que leer el guion en silencio nunca revela del todo.
El tono del guion debe decidir el tono de la música, no al revés. Una promoción de venta con precio fuerte y un mensaje de servicio profesional y calmado son dos tonos de anuncio válidos, pero una base pensada para uno restará fuerza al otro si se intercambian.
| Tono del anuncio | Cómo suena el guion | Base musical a juego |
|---|
| Venta o rebaja con ritmo | ritmo rápido, exclamaciones, plazo claro | tempo brillante, tonalidad mayor, percusión ligera |
| Servicio profesional y calmado | ritmo medido, tono tranquilizador, pocos adjetivos | pads suaves, tempo lento, percusión mínima |
| Oferta urgente por tiempo limitado | frases cortas, plazo repetido, directo | ritmo insistente, tensión creciente, sin voces |
| Negocio local o de barrio, cercano | conversacional, concreto, algo informal | instrumentos acústicos, tempo suave, tono familiar |
Prueba varias bases candidatas contra la misma locución antes de elegir una. Una base que suena genial sola puede seguir compitiendo con la lectura una vez que las dos se superponen, y la única forma fiable de detectarlo es escucharlas juntas.
Consejo: pide específicamente una base instrumental sin voces y describe el arreglo como poco denso en la misma franja de frecuencias que una voz humana, aproximadamente entre 300 Hz y 3 kHz. Una base construida con bajo, pads amplios y percusión ligera deja esa banda media libre para la locución, así se mantiene inteligible sin que tengas que pelear con la mezcla después.
La inteligibilidad es lo único en lo que una cuña de radio no puede ceder, porque un oyente que no entiende la oferta tampoco recordará la marca. Eso significa que la locución tiene que sonar claramente por encima de la base musical durante toda la duración del anuncio, no solo en los momentos más fuertes.
La generación te da ventaja en esto, pero el equilibrio final es una decisión de mezcla que se toma en un editor de audio, no algo que hagan los modelos por ti. Un enfoque habitual baja la base musical varios decibelios por debajo de la pista de voz, a menudo llamado ducking, y la baja aún más durante las frases más densas de la lectura. Picasso IA produce los dos archivos fuente con calidad completa; el ducking, la ecualización y la nivelación de volumen que hacen que encajen juntos ocurren después, en la herramienta de audio que ya uses.
Elegir una base poco densa desde el principio hace mucho más fácil esa fase de mezcla, por eso el consejo de instrumental y arreglo poco denso de arriba importa tanto durante la generación como durante la mezcla misma.
Generar las piezas toma minutos una vez que el guion está listo; el guion en sí suele ser donde se va el tiempo real; y cada paso de abajo se puede rehacer por separado si alguna parte no funciona.
- Escribe un guion que encaje en el bloque y presente una sola oferta clara. Ajusta el número de palabras a la duración del bloque, y resiste la tentación de mencionar más de una oferta o promoción en la misma cuña.
- Genera la locución. Elige una voz que coincida con el tono del guion, genera la lectura y comprueba su duración real contra la del bloque antes de seguir.
- Genera una base musical a juego. Describe el tono de la tabla anterior y pide un arreglo instrumental para que nada compita con la lectura.
- Mezcla las dos en un editor de audio priorizando la voz. Baja la música bajo la locución y súbela de nuevo en los huecos, manteniendo la lectura claramente por encima en todo momento.
- Recorta a la duración exacta que se requiere. Corta cualquier silencio al principio o al final para que el archivo final coincida con precisión con la duración que pide tu emisora o tu podcast.
Una página de herramienta honesta te dice dónde termina el trabajo de la herramienta, y cinco límites aparecen sistemáticamente con los anuncios de audio generados.
- Las afirmaciones deben ser exactas: cada precio, disponibilidad y garantía del guion tiene que ser cierto y cumplir la normativa publicitaria del mercado donde se emite, sin importar cómo se produjo el audio.
- El tiempo exacto necesita un recorte posterior: el ritmo del texto a voz varía ligeramente con la puntuación y la frase, así que una cuña que debe durar exactamente 30,0 segundos casi siempre necesita un pequeño recorte después de generarla, no una reescritura antes.
- Los términos de licencia para difusión siguen aplicando: la música generada viene con los términos de uso de la plataforma, y el uso comercial en difusión debe comprobarse contra esos términos antes de emitir, no darse por hecho.
- Sin masterización automática: Picasso IA genera la locución y la base musical como archivos separados; el ducking, la ecualización y la nivelación de volumen para difusión ocurren después, en un editor de audio dedicado.
- Las voces varían con nombres de marca y frases locales: algunas voces de texto a voz manejan mejor que otras nombres de marca poco comunes o expresiones regionales, así que probar dos o tres voces con tu guion real detecta errores de pronunciación antes de comprometerte.
Ninguno de estos límites cambia para qué sirve la herramienta, generar rápido y barato las dos capas de audio de un anuncio para que las decisiones creativas ocurran en la pantalla y no en un estudio reservado; marcan dónde termina su trabajo y empieza la mezcla. Más allá de las cuñas de radio, los mismos modelos de texto a voz y música cubren la narración de audiolibros y la música de fondo para videos más largos, y el catálogo de modelos enumera todas las voces y modelos de música disponibles.
¿La IA puede generar de verdad una cuña de radio completa, voz y música juntas?
Genera las dos capas por separado en vez de como un solo archivo combinado, y esa es en realidad la mejor forma de trabajar. Un modelo de texto a voz produce la locución a partir de tu guion, y un modelo de generación de música produce una base instrumental a partir de una descripción de estilo. Después las combinas en un editor de audio, lo que te da control sobre el equilibrio en vez de aceptar la proporción que un único archivo combinado hubiera generado por su cuenta.
¿Cuánto debe durar mi guion para una cuña de 30 segundos?
Apunta a unas 65 a 75 palabras, según una velocidad conversacional media de unas 150 palabras por minuto. Eso deja un pequeño margen al principio y al final para que la lectura no suene apresurada. Genera la locución pronto y comprueba su duración real, porque la puntuación y la frase cambian un poco el ritmo entre un guion y otro incluso con el mismo número de palabras.
¿La voz de la IA sonará natural o claramente sintética?
Las voces modernas de texto a voz suenan cercanas a una lectura humana en guiones sencillos y bien puntuados, y la diferencia es menor precisamente en textos publicitarios cortos y claros como una cuña de radio. Aun así vale la pena escuchar con atención palabras poco comunes, nombres de marca y números, que son donde una voz sintética suele fallar. Probar dos o tres voces con tu guion exacto, en vez de elegir a ciegas de una lista, es la forma más rápida de detectarlo.
¿Puedo usar un acento concreto o una voz que suene local a mi mercado?
El catálogo de voces de Picasso IA incluye varios acentos e idiomas, así que a menudo puedes encajar con un mercado sin trabajo extra. Escucha una muestra de las voces preseleccionadas leyendo una frase parecida a tu guion real, porque la calidad del acento varía según la voz y las palabras concretas, no solo según la etiqueta de acento que lleve.
¿La base musical trae voces o es instrumental?
Eso lo controlas tú en la instrucción. Para una cuña de radio la opción casi siempre correcta es instrumental, porque una base con su propia línea vocal compite directamente con la locución por la atención del oyente. Pide explícitamente un arreglo instrumental al generar la base, y describe el ambiente y el tempo en vez de pedir una canción.
¿Cómo evito que la música ahogue la locución?
Empieza con una base poco densa, generada con percusión ligera y espacio en la franja de frecuencias media donde vive la voz, y luego baja la música bajo la voz en tu editor de audio. Ducking significa bajar automáticamente el volumen de la música durante la locución y dejar que suba de nuevo en los huecos. Picasso IA genera los dos archivos fuente; el ducking en sí ocurre en el editor de audio que uses para combinarlos.
¿Puedo generar el mismo anuncio en varios idiomas?
Sí. Traduce el guion ajustando el número de palabras al ritmo típico del idioma de destino en lugar de traducir palabra por palabra, y genera una nueva locución en ese idioma con una voz a juego del catálogo. La misma base musical suele funcionar sin modificarla entre idiomas, porque una pista instrumental no tiene idioma propio.
¿Hay un límite de cuántas versiones puedo generar para probar?
No hay un tope fijo; cada generación consume créditos, y las cuentas nuevas empiezan con créditos gratis suficientes para varias rondas de prueba de un guion y comparación de voces o bases. Los costes exactos por modelo están en la página de precios, y probar dos o tres locuciones frente a dos o tres bases antes de fijar el par final es una cantidad razonable de experimentación para una cuña que piensas repetir.
¿Puedo usar un anuncio generado para una lectura de patrocinio de podcast en vez de radio tradicional?
Sí, y las cuñas de patrocinio de podcast son uno de los usos más comunes de este mismo flujo, porque siguen la misma estructura de guion corto más base musical que la radio tradicional. La diferencia principal es el formato de entrega, no la producción: un anuncio de podcast suele exportarse como archivo de audio independiente que el presentador inserta, mientras que una cuña de difusión puede necesitar cumplir requisitos de volumen y formato específicos de la emisora.
¿Qué pasa si el tiempo queda mal por uno o dos segundos después de mezclar?
Recórtalo. El ajuste preciso de duración es una decisión de la fase de mezcla, no de la fase de generación: corta un momento de silencio al principio o al final del archivo, o acorta una pausa entre la oferta y la llamada a la acción, hasta que la exportación final coincida con la duración que pide tu emisora o presentador. Rara vez hace falta regenerar toda la locución por una diferencia de uno o dos segundos.
Una cuña de radio vive o muere según lo clara que sea la oferta y si la mezcla no la entierra, y ambas cosas se pueden probar barato antes de comprometerse con un corte final. Empieza la lectura y la base en el Toolkit, o mira cómo los mismos modelos de voz y música se comportan en un formato más largo en locución con IA para videos.