Visão geral
Granite Vision 4.1 4B é um modelo de visão e linguagem criado para extrair dados estruturados de documentos complexos sem nenhuma cópia ou reformatação manual. Se você já passou tempo redigitando tabelas de PDFs, forçando a visão para ler valores nos eixos de gráficos ou juntando pares de chave e valor de faturas digitalizadas, este modelo faz esse trabalho em segundos. No Picasso IA, o processo leva três etapas: enviar a imagem do documento, descrever o que você precisa e ler o resultado. Com 4 bilhões de parâmetros, ele é compacto o suficiente para retornar respostas rapidamente, mantendo a precisão nos tipos de documentos para os quais foi construído especificamente, incluindo gráficos, tabelas e formulários estruturados.
Como funciona
- Envie uma ou mais imagens de documentos, como uma captura de tela de uma página de PDF, uma foto de uma tabela impressa ou um gráfico exportado de uma apresentação
- Escreva um prompt descrevendo os dados que você quer, por exemplo "Extraia todas as linhas da tabela de receita" ou "Retorne a chave e o valor de cada campo nesta fatura"
- Opcionalmente, escreva um prompt de sistema para definir o formato de saída, como JSON, valores separados por vírgula ou texto simples rotulado
- O modelo lê a imagem e retorna uma resposta em texto estruturada de acordo com o que você pediu
- Copie o resultado e cole-o diretamente na sua planilha, banco de dados ou relatório
Perguntas frequentes
Preciso de habilidades de programação ou conhecimento técnico para usar isto?
Não, basta abrir o Granite Vision 4.1 4B no Picasso IA, ajustar as configurações que desejar e clicar em gerar.
É grátis para experimentar?
Sim, você pode executar o modelo no Picasso IA sem uma assinatura paga para testá-lo primeiro em seus próprios documentos.
Quanto tempo leva para obter resultados?
A maioria das extrações é concluída em poucos segundos. O tamanho de 4 bilhões de parâmetros foi escolhido em parte pela velocidade, então você não fica esperando muito, mesmo em documentos detalhados.
Que tipos de documentos ele lida bem?
Ele tem bom desempenho em tabelas de dados impressas, gráficos financeiros, faturas, formulários estruturados e qualquer imagem em que as informações estejam organizadas em um layout consistente. Digitalizações muito degradadas ou páginas com muita escrita à mão podem reduzir a precisão.
Posso controlar em que formato a saída vem?
Sim. Especifique o formato no seu prompt de sistema ou no próprio prompt. Peça JSON, linhas numeradas, texto simples rotulado ou qualquer outra estrutura, e o modelo seguirá essas instruções de forma consistente.
Quantas vezes posso executar o modelo?
Você pode executar quantas extrações precisar. Cada solicitação é processada de forma independente, então você pode tentar prompts diferentes no mesmo documento até que a saída corresponda ao que você procura.
Onde posso usar o que o modelo retorna?
A saída em texto é simples e está pronta para colar em qualquer ferramenta, de uma planilha a um aplicativo de gerenciamento de projetos. Não há marcas d'água nem restrições de formato no que o modelo gera.