Descripción general
Granite Vision 3.3 2B es un modelo compacto de visión y lenguaje diseñado para leer y extraer información estructurada de documentos visuales, resolviendo un problema que las herramientas de texto estándar no pueden: comprender tablas, gráficos, infografías, diagramas y plots como datos utilizables. Piensa en un analista financiero extrayendo cifras trimestrales de un informe escaneado, o en un investigador transcribiendo un diagrama de metodología sin volver a escribir una sola celda a mano. En Picasso IA, subes una imagen y escribes una pregunta en lenguaje sencillo, y el modelo devuelve una respuesta centrada y legible en segundos. Con 2 mil millones de parámetros, mantiene la velocidad sin sacrificar la precisión que exige el trabajo de extracción de documentos.
Cómo funciona
- Sube una o más imágenes de documentos: páginas escaneadas, capturas de gráficos, diapositivas de presentación o exportaciones de diagramas
- Escribe un prompt que describa exactamente lo que necesitas, como "resume los datos de este gráfico de barras" o "extrae todos los valores de fila de la tabla de esta página"
- Opcionalmente, añade un prompt del sistema para controlar la estructura de la respuesta, por ejemplo solicitando salida JSON, una lista numerada o una tabla markdown
- Ajusta la temperatura y los max tokens si necesitas respuestas factuales más precisas o respuestas formateadas más largas
- Envía y recibe el contenido extraído o la respuesta estructurada en el panel de salida en cuestión de segundos
Preguntas frecuentes
¿Necesito habilidades de programación o conocimientos técnicos para usar esto?
No, solo abre Granite Vision 3.3 2B en Picasso IA, ajusta la configuración que quieras y pulsa generar.
¿Es gratis probarlo?
Sí, puedes ejecutar Granite Vision 3.3 2B sin coste inicial. Consulta la sección de precios en Picasso IA para obtener detalles sobre cómo funcionan los créditos de generación.
¿Cuánto tarda en obtener resultados?
La mayoría de las solicitudes devuelven resultados en pocos segundos. El tiempo de procesamiento depende de la complejidad de la imagen y de la longitud de la salida que hayas solicitado, pero el tamaño de 2B parámetros mantiene la velocidad en comparación con modelos de visión más grandes.
¿Qué tipo de imágenes maneja mejor?
Rinde bien con tablas, gráficos de barras, gráficos circulares, infografías, diagramas técnicos, gráficos de dispersión y diapositivas con mucho texto. Funciona tanto con imágenes digitales limpias como con escaneos moderadamente comprimidos.
¿Qué formatos de salida puedo obtener?
El modelo devuelve texto plano de forma predeterminada. Puedes adaptar el formato mediante tu prompt: pide una tabla markdown, un objeto JSON, una lista numerada o un párrafo breve y seguirá la estructura que describas.
¿Puedo enviar varias imágenes en una sola solicitud?
Sí. El modelo acepta un array de entradas de imagen, por lo que puedes cargar varias páginas de documentos a la vez y hacer preguntas que abarquen todas ellas en una sola generación.
¿Qué pasa si la salida omite un detalle o se equivoca en algo?
Intenta reformular tu prompt para ser más específico sobre lo que quieres extraer. Bajar la configuración de temperatura hacia 0 suele producir respuestas más precisas y centradas en hechos cuando se trabaja con datos estructurados.