Vue d'ensemble
Llama Guard 4 12B est un classificateur de sécurité de contenu qui lit du texte ou des entrées texte-plus-image et renvoie un verdict clair de contenu sûr ou dangereux, accompagné de la catégorie de politique spécifique qui a déclenché le signalement. Si vous gérez une plateforme, développez des outils alimentés par l’IA ou modérez des soumissions d’utilisateurs, obtenir un second avis fiable sur le fait qu’un contenu franchit une limite est lent et coûteux lorsqu’on le fait manuellement. Sur Picasso IA, Llama Guard 4 12B effectue automatiquement cet examen et renvoie des jugements structurés en quelques secondes. Il vérifie des éléments tels que les discours haineux, les contenus d’automutilation et la violence graphique, afin que votre équipe puisse agir sur des signaux clairs plutôt que de tout examiner depuis zéro.
- Rédigez un prompt système qui définit la politique de sécurité que vous souhaitez voir appliquée par le modèle, y compris les catégories de violation à surveiller et le niveau de sévérité souhaité.
- Ajoutez le texte que vous souhaitez évaluer dans le champ du prompt, et incluez éventuellement des images si vous devez vérifier du contenu visuel en plus du texte.
- Ajustez la température et les paramètres d’échantillonnage pour contrôler la cohérence des réponses, ou laissez-les sur les valeurs par défaut pour un comportement de classification standard.
- Envoyez la requête et recevez une sortie structurée : un verdict (sûr ou dangereux) et, lorsqu’il est dangereux, le libellé de la catégorie spécifique applicable.
- Acheminez le résultat vers votre file de modération, votre système de journalisation ou votre flux de travail automatisé pour agir immédiatement.
Questions fréquentes
Ai-je besoin de compétences en programmation ou de connaissances techniques pour utiliser cela ?
Non, ouvrez simplement Llama Guard 4 12B sur Picasso IA, ajustez les paramètres souhaités, puis lancez la génération.
Que produit réellement Llama Guard 4 12B ?
Il renvoie un verdict de classification : soit "safe", soit "unsafe". Lorsque le contenu est signalé, il renvoie également la catégorie de violation spécifique, afin que vous sachiez exactement quelle règle a été déclenchée et puissiez répondre en conséquence. Cela rend la sortie exploitable plutôt que simplement binaire.
Puis-je vérifier des images en plus du texte ?
Oui. Le modèle accepte une liste d’images en parallèle de votre prompt texte, ce qui vous permet d’évaluer du contenu multimodal dans une seule requête. C’est utile pour les plateformes où les utilisateurs publient à la fois du contenu écrit et des pièces jointes visuelles en même temps.
Comment personnaliser les règles appliquées par le modèle ?
Vous fournissez un prompt système qui décrit la politique que le modèle doit appliquer. Vous pouvez nommer des catégories spécifiques à surveiller, définir le niveau de sévérité ou ajouter toute consigne personnalisée pertinente pour votre communauté ou votre plateforme.
Combien de temps prend une classification ?
La plupart des requêtes renvoient un verdict en quelques secondes. Le temps de traitement dépend de la longueur du texte d’entrée et du nombre d’images incluses, mais les entrées courtes en texte seul sont généralement les plus rapides.
Que se passe-t-il si je ne suis pas d’accord avec un résultat de classification ?
Vous pouvez affiner les critères dans votre prompt système et relancer la requête. Reformuler la description de la politique ou ajuster les seuils de violation fait souvent basculer les cas limites dans le sens attendu. Picasso IA vous permet d’itérer autant de fois que nécessaire sans atteindre de limites d’utilisation.
Où puis-je utiliser les résultats ?
Le verdict et le libellé de catégorie sont en texte brut, donc vous pouvez les coller dans un tableur, les envoyer dans une file d’examen ou les utiliser comme entrée pour une autre étape d’un pipeline de contenu automatisé.