Vue d’ensemble
Granite Vision 3.3 2B est un modèle compact de vision-langage conçu pour lire et extraire des informations structurées à partir de documents visuels, résolvant un problème que les outils textuels standards ne peuvent pas traiter : donner du sens à des tableaux, graphiques, infographies, tracés et diagrammes sous forme de données exploitables. Imaginez un analyste financier extrayant des chiffres trimestriels d’un rapport numérisé, ou un chercheur transcrivant un schéma de méthodologie sans retaper une seule cellule à la main. Sur Picasso IA, vous téléversez une image et rédigez une question en langage simple, et le modèle renvoie en quelques secondes une réponse ciblée et lisible. Avec 2 milliards de paramètres, il reste rapide sans sacrifier la précision qu’exige le travail d’extraction documentaire.
- Téléversez une ou plusieurs images de documents : pages numérisées, captures de graphiques, diapositives de présentation ou exports de diagrammes
- Rédigez un prompt décrivant exactement ce dont vous avez besoin, par exemple "résumez les données de ce graphique en barres" ou "extrayez toutes les valeurs de lignes du tableau sur cette page"
- Ajoutez éventuellement un prompt système pour contrôler la structure de la réponse, par exemple en demandant une sortie JSON, une liste numérotée ou un tableau markdown
- Ajustez la température et le nombre maximal de jetons si vous avez besoin de réponses factuelles plus précises ou de réponses formatées plus longues
- Soumettez la demande et recevez le contenu extrait ou la réponse structurée dans le panneau de sortie en quelques secondes
Foire aux questions
Ai-je besoin de compétences en programmation ou de connaissances techniques pour utiliser cela ?
Non, ouvrez simplement Granite Vision 3.3 2B sur Picasso IA, ajustez les paramètres souhaités et cliquez sur générer.
Est-ce gratuit à essayer ?
Oui, vous pouvez exécuter Granite Vision 3.3 2B sans coût initial. Consultez la section tarifs sur Picasso IA pour en savoir plus sur le fonctionnement des crédits de génération.
Combien de temps faut-il pour obtenir des résultats ?
La plupart des demandes renvoient une réponse en quelques secondes. Le temps de traitement dépend de la complexité de l’image et de la longueur de la sortie demandée, mais la taille de 2B paramètres permet de rester rapide par rapport aux modèles de vision plus grands.
Quels types d’images gère-t-il le mieux ?
Il fonctionne bien avec les tableaux, graphiques à barres, diagrammes circulaires, infographies, diagrammes techniques, nuages de points et diapositives riches en texte. Il fonctionne aussi bien avec des images numériques propres qu’avec des scans modérément compressés.
Quels formats de sortie puis-je obtenir ?
Le modèle renvoie du texte brut par défaut. Vous pouvez façonner le format via votre prompt : demandez un tableau markdown, un objet JSON, une liste numérotée ou un court paragraphe, et il respectera la structure que vous décrivez.
Puis-je envoyer plusieurs images dans une seule requête ?
Oui. Le modèle accepte un tableau d’entrées d’images, vous pouvez donc lui fournir plusieurs pages de document à la fois et poser des questions qui s’étendent sur plusieurs d’entre elles en une seule génération.
Que faire si la sortie oublie un détail ou contient une erreur ?
Essayez de reformuler votre prompt pour préciser davantage ce que vous souhaitez extraire. Réduire la température vers 0 produit généralement des réponses plus précises et axées sur les faits lorsqu’on travaille avec des données structurées.