Un spot radio de trente secondes, c'est un script et une bande sonore qui se disputent les mêmes quelques secondes d'attention, et bien faire les deux demandait autrefois de réserver un studio, un comédien voix et un compositeur pour quelque chose qui ne tournerait peut-être que deux semaines. Picasso IA génère une voix off nette et un fond musical assorti depuis le même compte, puis confie les deux fichiers à n'importe quel éditeur audio pour le mixage final.
Une publicité radio ou podcast fonctionne presque toujours en deux couches, et les traiter séparément est ce qui rend le spot professionnel plutôt qu'artisanal. La première couche est la voix off, qui fait la vente proprement dite : elle dit qui vous êtes, ce que vous proposez et ce que l'auditeur doit faire ensuite. La seconde couche est le fond musical en dessous, qui installe l'ambiance et évite que le spot ne sonne comme une annonce en silence, mais elle ne doit pas se faire remarquer pour elle-même.
Cette discipline de la seconde couche est là où beaucoup de spots amateurs échouent. Un fond avec un gimmick vocal fort, un roulement de batterie chargé ou un refrain fort pile au moment où la voix annonce le prix entre en concurrence avec la lecture au lieu de la soutenir. Le rôle du fond est d'occuper l'espace autour de la voix, pas l'espace dont la voix a besoin.
Sur Picasso IA, les deux couches viennent de deux capacités distinctes dans le même Toolkit : un modèle de synthèse vocale transforme votre script en voix off, et un modèle de génération musicale transforme une courte description de style en fond instrumental. Les deux sont générées séparément puis combinées ensuite, ce qui vous donne aussi le contrôle sur leur équilibre.
Les publicités radio et podcast se vendent en durées fixes, généralement 15, 30 ou 60 secondes, et un script trop long finit coupé en pleine phrase ou lu à un rythme forcé. Le débit de lecture conversationnel moyen avoisine 150 mots par minute, soit environ deux mots et demi par seconde, si bien qu'un créneau de 30 secondes accueille confortablement 65 à 75 mots en laissant un peu de marge au début et à la fin.
Écrivez en visant ce nombre de mots plutôt que d'écrire tout ce que vous voulez dire en espérant que ça rentre. Un script qui rentre tout juste finit lu en accéléré, et une voix off précipitée sonne anxieuse plutôt que confiante, ce qui joue contre vous alors que le but du spot est justement d'inspirer confiance. Laissez un temps de silence après l'offre et avant l'appel à l'action, car c'est souvent cette pause qui fait retenir la dernière phrase.
Générez la voix off avant de figer le script, pas après. Écouter la lecture avec son minutage réel révèle immédiatement si le rythme fonctionne, ce qu'une lecture silencieuse du script ne révèle jamais tout à fait.
Le ton du script doit dicter le ton de la musique, pas l'inverse. Une promotion commerciale portée sur le prix et un message de service professionnel et posé sont deux tons de publicité valables, mais un fond pensé pour l'un affaiblira l'autre si on les échange.
| Ton de la publicité | À quoi ressemble le script | Fond musical assorti |
|---|
| Vente ou promotion dynamique | rythme rapide, exclamations, échéance claire | tempo enlevé, tonalité majeure, percussion légère |
| Service professionnel et posé | rythme mesuré, rassurant, peu d'adjectifs | nappes douces, tempo lent, percussion minimale |
| Offre urgente à durée limitée | phrases courtes, échéance répétée, direct | rythme insistant, tension montante, sans voix |
| Commerce local ou de proximité | conversationnel, précis, un peu informel | instruments acoustiques, tempo doux, ton familier |
Testez plusieurs fonds candidats avec la même voix off avant d'en choisir un. Un fond qui sonne très bien seul peut quand même concurrencer la lecture une fois les deux superposés, et la seule façon fiable de le remarquer est de les écouter ensemble.
Astuce : demandez spécifiquement un fond instrumental sans voix et décrivez l'arrangement comme épuré dans la même plage de fréquences qu'une voix humaine, environ entre 300 Hz et 3 kHz. Un fond construit sur une basse, des nappes larges et une percussion légère laisse cette bande médiane libre pour la lecture, la voix off reste ainsi intelligible sans que vous ayez à batailler avec le mixage ensuite.
L'intelligibilité est la seule chose sur laquelle un spot radio ne peut pas transiger, car un auditeur qui ne comprend pas l'offre ne retiendra pas non plus la marque. Cela veut dire que la voix off doit rester nettement au-dessus du fond musical pendant toute la durée du spot, pas seulement aux moments les plus forts.
La génération vous donne une longueur d'avance sur ce point, mais l'équilibre final reste une décision de mixage prise dans un éditeur audio, pas quelque chose que les modèles font pour vous. Une approche courante baisse le fond musical de plusieurs décibels sous la piste de voix, souvent appelée ducking, et le réduit encore davantage sur les passages les plus denses de la lecture. Picasso IA produit les deux fichiers source en pleine qualité ; le ducking, l'égalisation et la normalisation de volume qui les font tenir ensemble se font ensuite, dans l'outil audio que vous utilisez déjà.
Choisir un fond épuré dès le départ rend cette étape de mixage bien plus simple, c'est pourquoi le conseil instrumental et arrangement épuré ci-dessus compte autant à la génération qu'au mixage lui-même.
Générer les éléments prend quelques minutes une fois le script arrêté ; le script lui-même est généralement là où passe le vrai temps ; et chaque étape ci-dessous peut être reprise individuellement si une partie ne fonctionne pas.
- Rédigez un script calé sur le créneau et présentant une seule offre claire. Visez le nombre de mots correspondant à la durée du créneau, et résistez à l'envie de mentionner plus d'une offre ou promotion dans le même spot.
- Générez la voix off. Choisissez une voix qui correspond au ton du script, générez la lecture et comparez sa durée réelle à celle du créneau avant de continuer.
- Générez un fond musical assorti. Décrivez le ton du tableau ci-dessus et demandez un arrangement instrumental pour que rien ne concurrence la lecture.
- Mixez les deux dans un éditeur audio en priorisant la voix. Baissez la musique sous la voix off et remontez-la dans les silences, en gardant la lecture nettement au premier plan tout du long.
- Coupez à la durée exacte requise. Retirez tout silence en début ou fin de fichier pour que le fichier final corresponde précisément à la durée exigée par votre station ou votre podcast.
Une page produit honnête indique où s'arrête le travail de l'outil, et cinq limites reviennent systématiquement avec les publicités audio générées.
- Les affirmations doivent être exactes: chaque prix, disponibilité et garantie du script doit être vrai et conforme à la réglementation publicitaire du marché de diffusion, quelle que soit la façon dont l'audio a été produit.
- Le minutage exact demande une coupe après coup: le rythme de la synthèse vocale varie légèrement selon la ponctuation et la formulation, donc un spot qui doit tenir exactement en 30,0 secondes a presque toujours besoin d'une petite coupe après la génération, pas d'une réécriture avant.
- Les conditions de licence pour la diffusion s'appliquent toujours: la musique générée est soumise aux conditions d'utilisation de la plateforme, et l'usage commercial en diffusion doit être vérifié au regard de ces conditions avant la diffusion, pas supposé.
- Pas de mastering automatique: Picasso IA génère la voix off et le fond musical comme deux fichiers séparés ; le ducking, l'égalisation et la normalisation de volume pour la diffusion se font ensuite, dans un éditeur audio dédié.
- Les voix varient selon les noms de marque et les tournures locales: certaines voix de synthèse gèrent mieux que d'autres les noms de marque inhabituels ou les expressions régionales, tester deux ou trois voix sur votre script réel permet de repérer les erreurs de prononciation avant de vous engager.
Aucune de ces limites ne change à quoi sert l'outil, générer vite et à moindre coût les deux couches audio d'une publicité pour que les décisions créatives se prennent à l'écran plutôt que dans un studio réservé ; elles marquent où s'arrête son travail et où commence le mixage. Au-delà des spots radio, les mêmes modèles de synthèse vocale et de musique couvrent la narration de livres audio et la musique de fond pour les vidéos plus longues, et le catalogue de modèles recense toutes les voix et tous les modèles musicaux disponibles.
L'IA peut-elle vraiment générer un spot radio complet, voix et musique ensemble ?
Elle génère les deux couches séparément plutôt que comme un seul fichier combiné, et c'est en fait le meilleur mode de travail. Un modèle de synthèse vocale produit la voix off à partir de votre script, et un modèle de génération musicale produit un fond instrumental à partir d'une description de style. Vous les combinez ensuite dans un éditeur audio, ce qui vous donne le contrôle sur l'équilibre au lieu d'accepter le ratio qu'un fichier combiné unique aurait produit de lui-même.
Combien de mots doit contenir mon script pour un spot de 30 secondes ?
Visez environ 65 à 75 mots, sur la base d'un débit conversationnel moyen d'environ 150 mots par minute. Cela laisse une petite marge au début et à la fin pour que la lecture ne paraisse pas précipitée. Générez la voix off tôt et vérifiez sa durée réelle, car la ponctuation et la formulation modifient légèrement le rythme d'un script à l'autre même à nombre de mots égal.
La voix générée par IA sonnera-t-elle naturelle ou clairement synthétique ?
Les voix de synthèse actuelles se rapprochent d'une lecture humaine sur des scripts simples et bien ponctués, et l'écart est le plus faible justement sur des textes publicitaires courts et clairs comme un spot radio. Il reste utile d'écouter attentivement les mots inhabituels, les noms de marque et les chiffres, là où une voix synthétique a le plus de chances de trébucher. Tester deux ou trois voix sur votre script exact, plutôt que d'en choisir une à l'aveugle sur une liste, est le moyen le plus rapide de le repérer.
Puis-je utiliser un accent précis ou une voix qui sonne locale pour mon marché ?
Le catalogue de voix de Picasso IA comprend plusieurs accents et langues, vous pouvez donc souvent coller à un marché sans travail supplémentaire. Écoutez un échantillon des voix présélectionnées lisant une phrase proche de votre script réel, car la qualité de l'accent varie selon la voix et les mots précis en jeu, pas seulement selon l'étiquette d'accent qui lui est associée.
Le fond musical contient-il des voix, ou est-il instrumental ?
Vous contrôlez cela dans l'instruction. Pour un spot radio, le choix presque toujours juste est l'instrumental, car un fond avec sa propre ligne vocale entre directement en concurrence avec la voix off pour l'attention de l'auditeur. Demandez explicitement un arrangement instrumental lors de la génération du fond, et décrivez l'ambiance et le tempo plutôt que de demander une chanson.
Comment éviter que la musique ne noie la voix off ?
Commencez par un fond épuré, généré avec une percussion légère et de l'espace dans la plage de fréquences médiane où se situe la voix, puis baissez la musique sous la voix dans votre éditeur audio. Le ducking consiste à abaisser automatiquement le volume de la musique pendant la voix off puis à le laisser remonter dans les silences. Picasso IA génère les deux fichiers source ; le ducking en lui-même se fait dans l'éditeur audio que vous utilisez pour les combiner.
Puis-je générer la même publicité en plusieurs langues ?
Oui. Traduisez le script en ajustant le nombre de mots au débit typique de la langue cible plutôt qu'en traduisant mot pour mot, et générez une nouvelle voix off dans cette langue avec une voix assortie du catalogue. Le même fond musical fonctionne généralement sans modification d'une langue à l'autre, car une piste instrumentale n'a pas de langue propre.
Y a-t-il une limite au nombre de versions que je peux générer pour tester ?
Il n'y a pas de plafond fixe ; chaque génération consomme des crédits, et les nouveaux comptes démarrent avec des crédits gratuits qui couvrent plusieurs cycles de test d'un script et de comparaison de voix ou de fonds. Les coûts exacts par modèle figurent sur la page tarifs, et tester deux ou trois lectures contre deux ou trois fonds avant de fixer la paire finale reste une quantité d'expérimentation raisonnable pour un spot destiné à tourner régulièrement.
Puis-je utiliser une publicité générée pour une lecture de parrainage podcast plutôt que pour la radio classique ?
Oui, et les spots de parrainage podcast sont l'un des usages les plus courants de ce même flux, car ils suivent la même structure script court plus fond musical que la radio classique. La principale différence est le format de livraison, pas la production : une publicité podcast s'exporte généralement en fichier audio autonome que l'animateur insère, tandis qu'un spot diffusé peut devoir respecter des exigences de volume et de format propres à la station.
Que faire si le minutage est décalé d'une ou deux secondes après le mixage ?
Coupez-le. Le calage précis de la durée est un ajustement de l'étape de mixage, pas de l'étape de génération : retirez un instant de silence en début ou fin de fichier, ou raccourcissez une pause entre l'offre et l'appel à l'action, jusqu'à ce que l'export final corresponde à la durée exigée par votre station ou animateur. Régénérer toute la voix off pour une différence d'une ou deux secondes est rarement nécessaire.
Un spot radio vit ou meurt selon la clarté de l'offre et si le mixage l'étouffe ou non, et les deux se testent à moindre coût avant de valider une coupe finale. Lancez la lecture et le fond dans le Toolkit, ou voyez comment les mêmes modèles de voix et de musique se comportent sur un format plus long avec la voix off IA pour vidéos.