Descripción general
Granite Vision 4.1 4B es un modelo de visión y lenguaje diseñado para extraer datos estructurados de documentos complejos sin copiar ni reformatear manualmente. Si has pasado tiempo volviendo a escribir tablas de PDF, entrecerrando los ojos para leer los ejes de un gráfico o uniendo pares clave-valor de facturas escaneadas, este modelo hace ese trabajo en segundos. En Picasso IA, el proceso consta de tres pasos: subir la imagen del documento, describir lo que necesitas y leer el resultado. Con 4 mil millones de parámetros, es lo suficientemente compacto como para devolver respuestas rápidamente sin perder precisión en los tipos de documentos para los que fue creado específicamente, incluidos gráficos, tablas y formularios estructurados.
Cómo funciona
- Sube una o más imágenes de documentos, como una captura de pantalla de una página PDF, una foto de una tabla impresa o un gráfico exportado de una presentación
- Escribe un prompt que describa los datos que quieres, por ejemplo "Extrae todas las filas de la tabla de ingresos" o "Devuelve la clave y el valor de cada campo en esta factura"
- Opcionalmente, escribe un prompt de sistema para definir el formato de salida, como JSON, valores separados por comas o texto plano etiquetado
- El modelo lee la imagen y devuelve una respuesta de texto estructurada en torno a lo que pediste
- Copia el resultado y pégalo directamente en tu hoja de cálculo, base de datos o informe
Preguntas frecuentes
¿Necesito habilidades de programación o conocimientos técnicos para usar esto?
No, solo abre Granite Vision 4.1 4B en Picasso IA, ajusta la configuración que quieras y pulsa generar.
¿Es gratis para probar?
Sí, puedes ejecutar el modelo en Picasso IA sin una suscripción de pago para probarlo primero con tus propios documentos.
¿Cuánto tarda en obtener resultados?
La mayoría de las extracciones se completan en unos pocos segundos. El tamaño de 4 mil millones de parámetros se eligió en parte por velocidad, así que no tendrás que esperar mucho incluso con documentos detallados.
¿Qué tipos de documentos maneja bien?
Funciona de forma fiable con tablas de datos impresas, gráficos financieros, facturas, formularios estructurados y cualquier imagen en la que la información esté organizada en un diseño coherente. Los escaneos muy degradados o las páginas con mucha escritura a mano pueden reducir la precisión.
¿Puedo controlar el formato en el que llega la salida?
Sí. Especifica el formato en tu prompt de sistema o en el propio prompt. Pide JSON, filas numeradas, texto plano etiquetado o cualquier otra estructura y el modelo seguirá esas instrucciones de forma consistente.
¿Cuántas veces puedo ejecutar el modelo?
Puedes ejecutar tantas extracciones como necesites. Cada solicitud se procesa de forma independiente, así que puedes probar distintos prompts en el mismo documento hasta que la salida coincida con lo que buscas.
¿Dónde puedo usar lo que devuelve el modelo?
La salida de texto es simple y está lista para pegar en cualquier herramienta, desde una hoja de cálculo hasta una aplicación de gestión de proyectos. No hay marcas de agua ni restricciones de formato en lo que genera el modelo.