Visão geral
Granite Vision 3.3 2B é um modelo compacto de visão e linguagem criado para ler e extrair informações estruturadas de documentos visuais, resolvendo um problema que as ferramentas de texto padrão não conseguem: interpretar tabelas, gráficos, infográficos, plots e diagramas como dados utilizáveis. Pense em um analista financeiro extraindo números trimestrais de um relatório digitalizado, ou em um pesquisador transcrevendo um diagrama de metodologia sem redigitar manualmente uma única célula. No Picasso IA, você envia uma imagem e escreve uma pergunta em linguagem simples, e o modelo retorna uma resposta focada e legível em segundos. Com 2 bilhões de parâmetros, ele continua rápido sem abrir mão da precisão exigida pelo trabalho de extração de documentos.
Como Funciona
- Envie uma ou mais imagens de documentos: páginas digitalizadas, capturas de gráficos, slides de apresentação ou exportações de diagramas
- Escreva um prompt descrevendo exatamente o que você precisa, como "resuma os dados neste gráfico de barras" ou "extraia todos os valores das linhas da tabela nesta página"
- Opcionalmente, adicione um prompt de sistema para controlar a estrutura da resposta, por exemplo solicitando saída em JSON, uma lista numerada ou uma tabela markdown
- Ajuste a temperatura e o número máximo de tokens se precisar de respostas factuais mais precisas ou respostas formatadas mais longas
- Envie e receba o conteúdo extraído ou a resposta estruturada no painel de saída em questão de segundos
Perguntas Frequentes
Preciso de habilidades de programação ou conhecimento técnico para usar isto?
Não, basta abrir Granite Vision 3.3 2B no Picasso IA, ajustar as configurações desejadas e clicar em gerar.
É grátis para testar?
Sim, você pode executar Granite Vision 3.3 2B sem custo inicial. Consulte a seção de preços no Picasso IA para detalhes sobre como funcionam os créditos de geração.
Quanto tempo leva para obter resultados?
A maioria das solicitações retorna em poucos segundos. O tempo de processamento depende da complexidade da imagem e do tamanho da saída que você solicitou, mas o tamanho de 2B parâmetros mantém tudo rápido em comparação com modelos de visão maiores.
Que tipos de imagens ele lida melhor?
Ele tem bom desempenho com tabelas, gráficos de barras, gráficos de pizza, infográficos, diagramas técnicos, gráficos de dispersão e slides com muito texto. Funciona tanto com imagens digitais limpas quanto com digitalizações moderadamente comprimidas.
Quais formatos de saída posso obter?
O modelo retorna texto simples por padrão. Você pode moldar o formato por meio do seu prompt: peça uma tabela markdown, um objeto JSON, uma lista numerada ou um parágrafo curto, e ele corresponderá à estrutura que você descrever.
Posso enviar várias imagens em uma única solicitação?
Sim. O modelo aceita um array de entradas de imagem, então você pode inserir várias páginas de documentos de uma vez e fazer perguntas que abrangem todas elas em uma única geração.
E se a saída deixar passar um detalhe ou errar algo?
Tente reformular seu prompt para ser mais específico sobre o que você deseja extrair. Diminuir a configuração de temperatura para perto de 0 normalmente produz respostas mais precisas e focadas em fatos ao trabalhar com dados estruturados.