Descripción general
Llama Guard 4 12B es un clasificador de seguridad de contenido que lee texto o entradas de texto e imagen y devuelve un veredicto claro de seguro o inseguro, junto con la categoría de política específica que activó la marca. Si administras una plataforma, construyes herramientas impulsadas por IA o moderas envíos de usuarios, obtener una segunda opinión fiable sobre si el contenido cruza una línea es lento y costoso cuando se hace manualmente. En Picasso IA, Llama Guard 4 12B realiza esa revisión automáticamente y devuelve juicios estructurados en segundos. Comprueba cosas como discurso de odio, contenido de autolesión y violencia gráfica, para que tu equipo pueda actuar con señales claras en lugar de revisar cada elemento desde cero.
Cómo funciona
- Escribe un prompt del sistema que defina la política de seguridad que quieres que aplique el modelo, incluidas las categorías de infracción que se deben vigilar y cuán estricto debe ser el umbral.
- Añade el texto que quieres evaluar en el campo del prompt y, opcionalmente, incluye imágenes si necesitas que se revise contenido visual junto con la entrada escrita.
- Ajusta la temperatura y los parámetros de muestreo para controlar la coherencia de la respuesta, o déjalos en sus valores predeterminados para un comportamiento de clasificación estándar.
- Envía la solicitud y recibe una salida estructurada: un veredicto (seguro o inseguro) y, cuando sea inseguro, la etiqueta de categoría específica que corresponda.
- Envía el resultado a tu cola de moderación, sistema de registro o flujo de trabajo automatizado para actuar de inmediato.
Preguntas frecuentes
¿Necesito habilidades de programación o conocimientos técnicos para usar esto?
No, solo abre Llama Guard 4 12B en Picasso IA, ajusta la configuración que quieras y pulsa generar.
¿Qué produce realmente Llama Guard 4 12B?
Devuelve un veredicto de clasificación: "safe" o "unsafe". Cuando el contenido se marca, también devuelve la categoría específica de infracción, para que sepas exactamente qué regla se activó y puedas responder en consecuencia. Esto hace que la salida sea accionable en lugar de simplemente binaria.
¿Puedo revisar imágenes además de texto?
Sí. El modelo acepta una lista de imágenes junto con tu prompt de texto, lo que te permite evaluar contenido multimodal en una sola solicitud. Esto es útil para plataformas donde los usuarios publican contenido escrito y archivos visuales al mismo tiempo.
¿Cómo personalizo qué reglas aplica el modelo?
Proporcionas un prompt del sistema que describe la política que el modelo debe aplicar. Puedes nombrar categorías específicas que vigilar, establecer el nivel de estricticidad o añadir cualquier pauta personalizada relevante para tu comunidad o plataforma.
¿Cuánto tarda una clasificación?
La mayoría de las solicitudes devuelven un veredicto en unos pocos segundos. El tiempo de procesamiento depende de la longitud del texto de entrada y del número de imágenes incluidas, pero las entradas cortas de solo texto suelen ser las más rápidas.
¿Qué pasa si no estoy de acuerdo con un resultado de clasificación?
Puedes refinar los criterios en tu prompt del sistema y volver a ejecutar la solicitud. Reescribir la descripción de la política o ajustar los umbrales de infracción a menudo cambia los casos límite en la dirección que esperas. Picasso IA te permite iterar tantas veces como necesites sin alcanzar límites de uso.
¿Dónde puedo usar los resultados?
El veredicto y la etiqueta de categoría son texto plano, por lo que puedes pegarlos en una hoja de cálculo, enviarlos a una cola de revisión o usarlos como entrada para otro paso en un flujo automatizado de contenido.