Visão geral
Llama Guard 4 12B é um classificador de segurança de conteúdo que lê texto ou entradas de texto com imagem e retorna um veredito claro de seguro ou inseguro, juntamente com a categoria de política específica que acionou a sinalização. Se você administra uma plataforma, cria ferramentas com IA ou modera envios de usuários, obter uma segunda opinião confiável sobre se o conteúdo ultrapassa o limite é algo lento e caro quando feito manualmente. No Picasso IA, Llama Guard 4 12B faz essa revisão automaticamente, retornando julgamentos estruturados em segundos. Ele verifica coisas como discurso de ódio, conteúdo de automutilação e violência gráfica, para que sua equipe possa agir com base em sinais claros em vez de revisar tudo do zero.
Como funciona
- Escreva um prompt de sistema que defina a política de segurança que você deseja que o modelo aplique, incluindo quais categorias de violação observar e quão rigoroso deve ser o limite.
- Adicione o texto que você deseja avaliar no campo de prompt e, opcionalmente, inclua imagens se precisar que o conteúdo visual seja verificado junto com a entrada escrita.
- Ajuste as configurações de temperatura e amostragem para controlar a consistência da resposta, ou deixe-as nos padrões para o comportamento de classificação padrão.
- Envie a solicitação e receba uma saída estruturada: um veredito (seguro ou inseguro) e, quando inseguro, o rótulo específico da categoria aplicável.
- Encaminhe o resultado para sua fila de moderação, sistema de registro ou fluxo de trabalho automatizado para agir imediatamente.
Perguntas frequentes
Preciso de habilidades de programação ou conhecimentos técnicos para usar isto?
Não, basta abrir Llama Guard 4 12B no Picasso IA, ajustar as configurações que quiser e clicar em gerar.
O que Llama Guard 4 12B realmente gera como saída?
Ele retorna um veredito de classificação: "safe" ou "unsafe". Quando o conteúdo é sinalizado, ele também retorna a categoria específica da violação, para que você saiba exatamente qual regra foi acionada e possa responder adequadamente. Isso torna a saída acionável, em vez de apenas binária.
Posso verificar imagens além de texto?
Sim. O modelo aceita uma lista de imagens junto com seu prompt de texto, permitindo avaliar conteúdo multimodal em uma única solicitação. Isso é útil para plataformas em que os usuários publicam conteúdo escrito e anexos visuais ao mesmo tempo.
Como personalizo quais regras o modelo aplica?
Você fornece um prompt de sistema que descreve a política que o modelo deve aplicar. Pode nomear categorias específicas para observar, definir o nível de rigor ou adicionar quaisquer diretrizes personalizadas relevantes para sua comunidade ou plataforma.
Quanto tempo leva uma classificação?
A maioria das solicitações retorna um veredito em poucos segundos. O tempo de processamento depende do tamanho do texto de entrada e do número de imagens incluídas, mas entradas curtas apenas de texto geralmente são as mais rápidas.
O que acontece se eu discordar de um resultado de classificação?
Você pode refinar os critérios no seu prompt de sistema e executar a solicitação novamente. Reformular a descrição da política ou ajustar os limites de violação costuma deslocar casos limítrofes na direção que você espera. O Picasso IA permite iterar quantas vezes forem necessárias sem atingir limites de uso.
Onde posso usar os resultados?
O veredito e o rótulo da categoria estão em texto simples, então você pode colá-los em uma planilha, enviá-los para uma fila de revisão ou usá-los como entrada para outra etapa em um pipeline automatizado de conteúdo.