Aperçu
Granite Vision 4.1 4B est un modèle vision-langage conçu pour extraire des données structurées à partir de documents complexes sans aucune copie ou mise en forme manuelle. Si vous avez déjà passé du temps à ressaisir des tableaux depuis des PDF, à plisser les yeux sur les axes d'un graphique pour lire les nombres ou à reconstituer des paires clé-valeur à partir de factures numérisées, ce modèle effectue ce travail en quelques secondes. Sur Picasso IA, le processus se déroule en trois étapes : téléchargez l'image du document, décrivez ce dont vous avez besoin et lisez le résultat. Avec 4 milliards de paramètres, il est suffisamment compact pour fournir des réponses rapidement tout en conservant sa précision sur les types de documents pour lesquels il a été spécialement conçu, notamment les graphiques, les tableaux et les formulaires structurés.
- Téléchargez une ou plusieurs images de documents, comme une capture d'écran d'une page PDF, une photo d'un tableau imprimé ou un graphique exporté depuis une présentation
- Rédigez un prompt décrivant les données que vous souhaitez, par exemple "Extract all rows from the revenue table" ou "Return the key and value from each field in this invoice"
- Rédigez éventuellement un system prompt pour définir le format de sortie, comme JSON, des valeurs séparées par des virgules ou du texte brut étiqueté
- Le modèle lit l'image et renvoie une réponse textuelle structurée autour de ce que vous avez demandé
- Copiez le résultat et collez-le directement dans votre feuille de calcul, base de données ou rapport
Questions fréquentes
Ai-je besoin de compétences en programmation ou de connaissances techniques pour utiliser cela ?
Non, ouvrez simplement Granite Vision 4.1 4B sur Picasso IA, ajustez les paramètres souhaités et cliquez sur générer.
Est-ce gratuit à essayer ?
Oui, vous pouvez exécuter le modèle sur Picasso IA sans abonnement payant pour le tester d'abord sur vos propres documents.
Combien de temps faut-il pour obtenir des résultats ?
La plupart des extractions se terminent en quelques secondes. La taille de 4 milliards de paramètres a été choisie en partie pour la vitesse, donc vous n'attendez pas longtemps même avec des documents détaillés.
Quels types de documents gère-t-il bien ?
Il fonctionne de manière fiable sur les tableaux de données imprimés, les graphiques financiers, les factures, les formulaires structurés et toute image où les informations sont organisées dans une mise en page cohérente. Les scans fortement dégradés ou les pages très manuscrites peuvent réduire la précision.
Puis-je contrôler le format de sortie ?
Oui. Indiquez le format dans votre system prompt ou dans le prompt lui-même. Demandez du JSON, des lignes numérotées, du texte brut étiqueté ou toute autre structure, et le modèle suivra ces instructions de manière cohérente.
Combien de fois puis-je exécuter le modèle ?
Vous pouvez effectuer autant d'extractions que nécessaire. Chaque requête est traitée indépendamment, vous pouvez donc essayer différents prompts sur le même document jusqu'à ce que la sortie corresponde à ce que vous recherchez.
Où puis-je utiliser ce que le modèle renvoie ?
Le texte de sortie est brut et prêt à être collé dans n'importe quel outil, d'une feuille de calcul à une application de gestion de projet. Il n'y a ni filigrane ni restriction de format sur ce que le modèle génère.