# Benchmark vectorisation : quelle IA transforme une illustration en SVG éditable ?

> Benchmark vectorisation : Claude, GPT, Gemini, Recraft et Quiver AI notés sur une illustration à convertir en SVG éditable à calques, avec coût et durée.

Human version: https://samsa.ai/fr/benchmarks/vectorisation/
Language: Français
Machine index: https://samsa.ai/llms.txt

---
Le benchmark vectorisation de Samsa mesure la capacité des modèles IA et des outils de vectorisation à transformer une illustration matricielle en SVG qu'un designer peut retoucher. Chaque participant reçoit le même prompt et les deux mêmes images. Chaque résultat est noté sur la fidélité à l'original, la structure (des calques nommés et complets) et le détail des zones clés. Le coût et la durée par image restent à côté du score, jamais dedans, et les valeurs brutes sont publiées.

---

## Classement

Édition 2026.10 · Mis à jour le 2026-10-08 · 87 exécutions · 2 images · 23 participants

| # | Modèle ou outil | Éditeur | Agent | Piste | Effort | Score | Fidélité | Structure | Détail | Seuil de parité | Coût par image (USD) | Durée par image | Exécutions |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | Claude Opus 5.5 · max | Anthropic | Claude Code 2.1.291 | Agentique | max | 82.1 | 78.5 | 92.1 | 70.6 | passé | $51.9 | 118 min | 2 |
| 2 | Claude Sonnet 5.5 · xhigh | Anthropic | Claude Code 2.1.291 | Agentique | xhigh | 79.5 | 76.0 | 89.2 | 68.8 | passé | $32.8 | 92 min | 4 |
| 3 | Claude Opus 5.5 · high | Anthropic | Claude Code 2.1.291 | Agentique | high | 78.5 | 71.7 | 92.2 | 69.1 | passé | $22.2 | 72 min | 4 |
| 4 | Claude Opus 5.5 · xhigh | Anthropic | Claude Code 2.1.291 | Agentique | xhigh | 78.4 | 72.6 | 90.7 | 68.8 | passé | $30.9 | 84 min | 6 |
| 5 | GPT 6.1 Sol · xhigh | OpenAI | Codex CLI 0.160.0 | Agentique | xhigh | 73.9 | 64.0 | 89.0 | 73.1 | passé | $8.0 | 75 min | 6 |
| 6 | GPT 6.1 Sol · high | OpenAI | Codex CLI 0.160.0 | Agentique | high | 73.3 | 60.8 | 91.1 | 73.1 | mixte | $5.9 | 56 min | 2 |
| 7 | Claude Sonnet 5.5 · high | Anthropic | Claude Code 2.1.291 | Agentique | high | 72.7 | 65.2 | 88.2 | 61.3 | passé | $14.3 | 53 min | 2 |
| 8 | Claude Opus 5.5 · medium | Anthropic | Claude Code 2.1.291 | Agentique | medium | 72.5 | 64.2 | 88.3 | 63.1 | passé | $13.1 | 62 min | 2 |
| 9 | GPT 6.1 Sol · medium | OpenAI | Codex CLI 0.160.0 | Agentique | medium | 68.4 | 53.7 | 88.5 | 70.6 | mixte | $5.2 | 52 min | 2 |
| 10 | GPT 6.1 Sol · xhigh | OpenAI | API call, no tools (Codex CLI 0.160.0) | Single-shot | xhigh | 48.8 | 15.1 | 87.2 | 67.5 | échoué | $0.34 | 13 min | 6 |
| 11 | GPT 6.1 Sol · medium | OpenAI | API call, no tools (Codex CLI 0.160.0) | Single-shot | medium | 47.3 | 15.4 | 86.9 | 68.1 | échoué | $0.17 | 5.4 min | 10 |
| 12 | vtracer 0.6.15, default settings | visioncortex (open source) | — | Outil | — | 43.4 | 68.9 | 2.5 | 53.8 | mixte | $0.00 | 0.1 min | 2 |
| 13 | Claude Opus 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Boucle fixe | medium | 38.2 | 4.0 | 84.4 | 44.4 | échoué | $1.8 | 11 min | 4 |
| 14 | Claude Fable 5.1 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-shot | medium | 37.4 | 3.1 | 80.8 | 48.8 | échoué | $0.94 | 3.4 min | 6 |
| 15 | Claude Opus 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-shot | medium | 34.5 | 0.0 | 80.0 | 42.5 | échoué | $0.33 | 2.8 min | 6 |
| 16 | Claude Sonnet 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Boucle fixe | medium | 32.8 | 4.5 | 74.8 | 29.4 | échoué | $0.38 | 3.7 min | 4 |
| 17 | Claude Haiku 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.294) | Single-shot | medium | 31.6 | 0.2 | 77.0 | 30.6 | échoué | $0.01 | 1 min | 6 |
| 18 | Claude Sonnet 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-shot | medium | 30.1 | 0.0 | 74.9 | 30.0 | échoué | $0.07 | 1.2 min | 6 |
| — | Claude Fable 5.1 · xhigh (Partiel : 1 image sur 2) | Anthropic | Claude Code 2.1.291 | Agentique | xhigh | 63.1 | 52.6 | 81.6 | 55.0 | échoué | $42.9 | 88 min | 1 |
| — | Gemini 3.1 Pro · max (Partiel : 1 image sur 2) | Google | Gemini CLI 0.62.0 | Agentique | max | 46.7 | 58.0 | 35.0 | 36.3 | passé | $1.6 | 11 min | 1 |

---

## Que montre l'édition 2026.10 du benchmark vectorisation ?

Dans le benchmark vectorisation de Samsa, édition 2026.10 (8 octobre 2026), Claude Opus 5.5 en effort max obtient le meilleur Samsa Vectorization Score, 82.1 sur 100, pour un coût médian de $43.5 sur l'image plate du laptop et de $60.2 sur l'image texturée du vélo électrique. Le classement repose sur 87 exécutions notées de 23 configurations, sur deux illustrations. Claude Opus 5.5 en effort max est une référence à une exécution par image.

- Parmi les modèles d'IA, seules les exécutions agentiques atteignent la parité visuelle. Une exécution est agentique quand le modèle travaille dans l'agent de code de son éditeur, rend son SVG, le compare à l'original et le corrige sur de nombreux tours. 29 exécutions agentiques sur 32 passent le seuil de parité et ses huit critères. Aucune des 48 exécutions en un seul appel ou en boucle fixe n'y arrive, quel que soit le modèle.
- Les outils de tracé copient les pixels et perdent les objets. vtracer et Vectorize de Recraft rendent bien les couleurs, et vtracer passe même le seuil de parité sur l'image plate du laptop. Les deux restent à 4 sur 100 ou moins en structure : sur le vélo, vtracer livre 9328 formes sans nom et Recraft 1462, chaque objet découpé selon ce qui en est visible.
- Le meilleur rapport score-prix ne vient pas de Claude. GPT 6.1 Sol en effort xhigh obtient 73.9, pour un coût médian de $6.8 et $9.1 par image. C'est 8.2 points de moins que la meilleure configuration pour environ 15 % de son coût, ce qui le place sur la ligne de frontière du graphique ci-dessus.
- Quiver AI dessine des objets, pas encore l'image. Arrow 2 Telos livre quelques grands objets groupés : son score de structure se situe entre les outils de tracé et les exécutions agentiques (58.1 sur le vélo). Sa fidélité reste loin du seuil de parité sur les deux images.
- Plus d'effort achète de la fidélité, cher. Claude Opus 5.5 en effort max atteint la meilleure fidélité de toutes les exécutions sur le vélo (71.8), pour $60.2. Le graphique de l'effort plus bas montre à partir d'où un dollar de plus ne fait presque plus bouger le score.

Claude Fable 5.1 en effort xhigh, une référence, a tourné une fois sur l'image du laptop et y échoue au seuil de parité, pour $42.9 ; il figure comme participant partiel, et son exécution sur le vélo arrive avec la mise à jour. Claude Haiku 5.5 figure dans cette édition en un seul appel, en effort medium : six exécutions, $0.04 pour l'ensemble, aucune à parité, un score global de 31.6. Ses variantes agentiques (xhigh et high) et l'hybride, un brouillon de GPT 6.1 Sol fini par Claude Opus 5.5 en effort high, tournent encore et seront ajoutés lors d'une mise à jour. Gemini 3.1 Pro a tourné une fois, sur l'image du laptop seulement, et obtient 46.7 : il figure comme participant partiel, sans rang global.

> **L'écart d'une exécution à l'autre** Une même configuration agentique sur la même image a varié jusqu'à 4.0 points d'une exécution à l'autre sur le vélo, et son coût jusqu'à 1.7 fois. Cela suffit pour intervertir deux voisins au classement. Les configurations qui comptent pour une décision produit ont donc tourné jusqu'à trois fois, et le classement indique n et l'écart pour chaque ligne qui a plus d'une exécution.

---

## Pourquoi un SVG tracé échoue-t-il au test de structure ?

Un SVG tracé échoue parce qu'il décrit l'image comme des zones de couleur, pas comme des choses. Samsa a construit ce benchmark parce que ses clients demandent des fichiers éditables : déplacer le cycliste, changer la couleur de la veste, sortir le vélo de la scène. Dans un tracé, la jambe du fond n'existe que sous forme des bandes visibles entre le cadre et le pédalier, et le ciel se réduit à une douzaine de fragments autour des nuages. Rien n'a de nom, donc un designer ne retrouve rien.

Un SVG reconstruit, c'est ce qu'un illustrateur livrerait : des objets nommés dans un ordre de calques logique, chacun dessiné en entier, y compris les parties que d'autres objets cachent. C'est ce que le score de structure récompense, et c'est pourquoi la structure pèse 35 % à côté des 50 % de la fidélité. Un fichier qui a l'air juste mais qu'on ne peut pas retoucher ne remplit pas le rôle pour lequel on commande un fichier vectoriel.

---

## Que signifient ces résultats si tu as besoin d'un SVG éditable ?

- Pour une icône ou un logo qui doit seulement s'agrandir, un outil de tracé suffit. C'est gratuit ou presque, et ça prend quelques secondes.
- Pour une illustration que tu veux retoucher, prévois une exécution agentique : $5.3–$60.2 de calcul et 31–128 minutes par image à ce niveau, pas quelques centimes et quelques secondes.
- Ne juge pas sur la miniature. Un fichier tracé et un fichier reconstruit peuvent se ressembler en taille réelle : ouvre les calques avant d'accepter l'un ou l'autre.
- Une exécution n'est qu'un échantillon. Si le résultat compte, lance-en deux et garde le meilleur fichier, ou prévois une reprise à la main des détails délicats : visages, mains, mécanique.

La méthode pas à pas, avec les contrôles qu'un fichier terminé doit passer, se trouve dans le guide [vectoriser une image avec l'IA sans perdre l'éditabilité](https://samsa.ai/fr/guides/vectoriser-une-image/).

> **Citer ce benchmark** Samsa, « Benchmark vectorisation », édition 2026.10, 8 octobre 2026, samsa.ai/fr/benchmarks/vectorisation/. Les prompts, les prompts des juges et les métriques brutes de chaque exécution sont publiés avec le jeu de données.

---

## Comment se déroule une exécution du benchmark ?

Chaque participant reçoit le même prompt figé et les mêmes images, selon le protocole 1.0.1. Une exécution est une nouvelle session dans l'agent de l'éditeur, avec le prompt pour seule entrée et aucun message en cours de route. Elle itère jusqu'à ce que le seuil de parité soit passé et la revue des détails propre, ou jusqu'à une limite de trois heures ou 25 tours notés, puis laisse son meilleur état.

- Un agent par éditeur, déclaré. Les modèles Claude tournent dans Claude Code 2.1.291 (Haiku 5.5 dans la 2.1.294, première version qui connaît ce modèle), GPT 6.1 Sol dans Codex CLI 0.160.0 en fast tier, Gemini dans Gemini CLI 0.62.0 avec une clé API. On mesure le modèle et son agent, et le classement nomme les deux.
- Les exécutions interrompues sont écartées et refaites. Une exécution arrêtée de l'extérieur (limite d'usage, processus tué, erreur réseau) n'est pas notée, et son coût n'apparaît nulle part. La reprise reçoit le numéro suivant.
- Les sous-agents sont autorisés quand l'agent en propose. Leurs tokens comptent, et le jeu de données indique que l'exécution a délégué.
- Une machine, une boîte à outils. Toutes les exécutions agentiques tournent sur le même Mac, et les outils de notation sont figés par empreinte et ne changent jamais en cours d'édition.

---

## Quelles sont les quatre catégories ?

La catégorie dit comment un participant a produit son SVG. Le graphique dessine chacune avec son propre marqueur, et le classement l'affiche en colonne.

**Les quatre catégories du benchmark vectorisation**

| Catégorie | Comment le SVG est produit | Qui en fait partie |
| --- | --- | --- |
| Agentique | Le modèle travaille dans l'agent de son éditeur, écrit et lance du code, rend et compare son SVG, et itère dans les limites. | Claude Fable, Opus et Sonnet, GPT 6.1 Sol et Gemini 3.1 Pro ; Claude Haiku et l'hybride Sol + Opus arrivent avec une mise à jour |
| Un seul appel | Un appel avec l'image et le prompt, sans outils. La réponse est le SVG. | Claude Opus, Sonnet, Fable et Haiku, GPT 6.1 Sol |
| Boucle fixe | Quatre tours où le modèle voit son rendu et le retour de parité et réécrit le SVG, sans outils. Le meilleur tour compte. | Claude Opus 5.5 et Sonnet 5.5 |
| Outil | Le résultat d'un outil de vectorisation, noté comme n'importe quel SVG. | Recraft Vectorize, Quiver AI Arrow 2 et Arrow 2 Telos, vtracer |

---

## Quelles images composent la suite ?

Deux illustrations créées avec Samsa, une par niveau de difficulté. Chacune a son inventaire : la liste des objets qu'une vectorisation complète doit contenir, rédigée par Samsa et figée pour l'édition.

- Laptop, niveau 1 (aplat) : aplats de couleur, aucune texture, formes organiques qui se chevauchent, un visage et des mains. 1376 × 768 pixels, 32 objets à l'inventaire.
- Vélo électrique, niveau 2 (texturé) : grain argentique, pointillé, dégradés, 56 rayons, un visage, des zones masquées derrière la jambe du fond et le pédalier. 2400 × 1792 pixels, 53 objets à l'inventaire.
- Une scène de niveau 3 est prévue pour une édition ultérieure.

---

## Comment une exécution est-elle notée ?

Chaque exécution reçoit trois sous-scores de 0 à 100, combinés en Samsa Vectorization Score. La note d'un participant par image est la médiane de ses exécutions, son rang global la moyenne de ces médianes. Un participant mesuré sur une seule image est listé comme partiel, sans rang global. Le coût et la durée sont des axes à côté du score, jamais dedans.

**Les trois parties du Samsa Vectorization Score et leur poids**

| Partie | Poids | Ce qu'elle mesure |
| --- | --- | --- |
| Fidélité | 50 % | Écart de couleur moyen, similarité structurelle, la pire fenêtre locale et, sur le vélo, la correspondance du grain, par rapport à l'original, les deux images posées sur fond blanc. Le seuil de parité à huit critères s'affiche comme un badge et n'entre pas dans le score. |
| Structure | 35 % | 60 % automatique : calques nommés, couverture de l'inventaire, complétude des formes masquées et économie des tracés, avec des pénalités pour les images matricielles intégrées, les masques d'écrêtage qui simulent l'occlusion et les transformations figées. 40 % jugé : sens des objets, complétude sous occlusion, éditabilité, ordre des calques et qualité des tracés. |
| Détail | 15 % | Deux zooms standard par image (visage et mains sur le laptop, visage et transmission sur le vélo), jugés face au même zoom de l'original pour la ressemblance et la qualité d'exécution. |

Les parties jugées viennent de deux modèles de vision d'éditeurs différents, Claude Opus 5.5 et GPT 6.1 Sol, qui voient des résultats anonymisés et mélangés. Leurs prompts sont publiés avec les résultats.

---

## Comment le coût et la durée sont-ils comptés ?

- Le coût est un équivalent API : les tokens d'une exécution par classe (entrée, sortie raisonnement compris, écriture et lecture du cache), multipliés par le prix catalogue de l'éditeur le jour de l'exécution. Le relevé de prix est conservé avec chaque exécution (6 octobre 2026). C'est ce que l'exécution coûterait via l'API, pas une facture.
- Les exécutions Codex en fast tier enregistrent le coût fast tier et l'équivalent standard. Haiku 5.5 est facturé par requête selon ses deux grilles de prix liées à la longueur du prompt.
- Un outil compte à son prix publié par conversion, et sa durée vient d'un essai chronométré.
- La durée est le temps réel entre le lancement de l'agent et son rapport final.
- Les lignes à plusieurs exécutions affichent la médiane et l'écart. Une ligne à une seule exécution n'affiche que la valeur, car une exécution n'a pas d'écart.

---

## Qu'a changé le protocole 1.0.1 ?

Les résultats dont le canevas diffère de l'original sont désormais alignés sur leur contenu, plus sur leur cadre. Le noteur rend le SVG, prend le cadre englobant de ce qu'il a dessiné, le pose sur le cadre du contenu de l'original avec une seule échelle et complète en transparence. Si les proportions des deux cadres diffèrent de plus de 10 %, c'est tout le canevas qui est ajusté. La règle vaut pour tous les participants. Elle a été ajoutée parce que les exports de Quiver AI ont une marge d'environ 2,4 % qui leur faisait perdre presque toute leur fidélité avec l'ancienne règle : un défaut de cadrage, pas de vectorisation.

---

## Quelles sont les limites ?

- Deux images. Le classement dit comment les participants gèrent une illustration en aplats et une illustration texturée, pas des photos, des logos ou des dessins techniques.
- Modèle et agent. Chaque modèle tourne dans l'agent de son éditeur, donc l'agent fait partie de la mesure. Une catégorie indépendante de l'agent pourra suivre.
- Exécutions uniques là où c'est indiqué. Claude Fable 5.1 en xhigh et Claude Opus 5.5 en max sont des références à une exécution par image, à cause de leur coût, et les niveaux d'effort inférieurs n'ont tourné qu'une fois. Gemini 3.1 Pro a tourné une fois, sur le laptop, avec un plafond API de 20 $. Claude Opus 5.5 en effort high compte pour l'instant deux exécutions par image, et Claude Sonnet 5.5 en xhigh deux sur le vélo ; leurs troisièmes exécutions sont en cours et seront ajoutées lors d'une mise à jour. Claude Fable 5.1 en effort xhigh n'a pas encore d'exécution sur le vélo : elle a été interrompue par une limite d'usage, écartée selon le protocole, et sera refaite pour la mise à jour.
- Le contrôle de complétude seul favorise les grands objets peu nombreux, et c'est ainsi que dessine Arrow 2 Telos. Le score de structure dans son ensemble classe quand même les fichiers reconstruits devant Telos et Telos devant les tracés, mais lis ce sous-score en le sachant.
- Les juges sont des modèles. Ils voient des résultats anonymisés et leurs prompts sont publiés, mais ce ne sont pas des designers. Samsa vérifie les zooms à la main avant publication.
- Samsa s'appuie sur des modèles d'Anthropic, et l'un des deux juges est un modèle d'OpenAI. Le score de fidélité et la moitié automatique du score de structure se passent de juge, et chaque métrique brute est publiée pour que le résultat puisse être vérifié.

---

## Comment proposer un modèle ou un outil ?

Lance le prompt figé sur les deux images selon le protocole, ou, pour un outil, envoie les SVG des deux images avec le prix et un essai chronométré. Samsa les note avec les mêmes outils et les ajoute à la prochaine mise à jour. [Écris-nous](https://samsa.ai/fr/contact/) pour en proposer un.

---

## Questions fréquentes : benchmark vectorisation

### Que mesure le benchmark vectorisation ?

Une seule tâche : transformer une illustration matricielle en SVG qu'un designer peut retoucher. Chaque exécution est notée sur la fidélité à l'original (50 %), la structure, c'est-à-dire des calques nommés, complets et économes (35 %), et le détail des zones clés comme les visages et les mains (15 %). La somme pondérée donne le Samsa Vectorization Score. Le coût et la durée par image restent à côté et ne le modifient jamais.

### Quelle IA vectorise le mieux une illustration ?

Dans l'édition 2026.10, Claude Opus 5.5 en effort max arrive en tête avec 82.1, devant Claude Sonnet 5.5 en effort xhigh (79.5). GPT 6.1 Sol en effort xhigh obtient 73.9 pour une fraction du coût. Toutes les configurations de tête ont tourné comme agent qui rend et corrige son propre SVG ; aucun prompt unique, à aucun modèle, n'en approche.

### Un seul prompt à un modèle IA peut-il transformer une image en SVG éditable ?

Pas à parité, dans ce benchmark. Les appels uniques à des modèles Claude et GPT livrent en quelques minutes des SVG propres et bien nommés, pour quelques centimes à environ un dollar. Mais aucune des 48 exécutions en un seul appel ou en boucle fixe ne passe le seuil de parité : ce sont des versions stylisées de l'image, pas des copies. Montrer son rendu au modèle pendant quatre tours ne comble pas l'écart. La parité demande un agent qui mesure et corrige.

### Pourquoi les outils de tracé ont-ils une note basse alors que leur SVG a l'air juste ?

Parce qu'avoir l'air juste ne fait que la moitié du travail. Un outil de tracé découpe l'image en aplats par couleur : sur le vélo, vtracer a produit 9328 formes sans nom. La fidélité est élevée, mais aucune forme n'est un objet et toutes les parties cachées manquent. Le score de structure, 35 % du total, mesure exactement ce dont un designer a besoin pour retoucher le fichier, et les outils de tracé en perdent presque tout.

### Comment le benchmark compte-t-il le coût et la durée ?

Le coût correspond aux tokens d'une exécution multipliés par le prix catalogue de l'éditeur le jour même, par classe de tokens, avec le relevé de prix conservé. C'est un équivalent API, pas une facture. Un outil compte à son prix publié par conversion. La durée court du lancement au rapport final. Les deux sont des médianes sur les exécutions d'un participant, avec l'écart quand il y en a plusieurs.

### Le benchmark vectorisation est-il indépendant ?

Aucun benchmark mené par une entreprise n'est totalement indépendant, et Samsa s'appuie sur des modèles d'Anthropic. Ce qui le rend vérifiable : un prompt figé pour tous, une notation automatique de la fidélité, deux juges d'éditeurs différents sur des résultats anonymisés, des prompts de juges publiés et chaque métrique brute publiée avec son exécution. Chacun peut refaire le protocole et comparer.

### Puis-je proposer un modèle ou un outil ?

Oui. Lance le prompt figé sur les deux images selon le protocole, ou envoie les SVG d'un outil pour les deux images avec son prix et un essai chronométré. Samsa note la proposition avec les mêmes outils et l'ajoute à la prochaine mise à jour. Passe par la [page de contact](https://samsa.ai/fr/contact/) pour nous écrire.

### À quelle fréquence le benchmark est-il mis à jour ?

Dès qu'un modèle ou un outil pertinent sort. Les lignes s'ajoutent et ne sont jamais modifiées : un participant mesuré à nouveau reçoit une nouvelle édition, les relevés de prix restent avec leurs exécutions, et le journal des modifications de cette page date chaque changement. Claude Haiku 5.5, sorti pendant les exécutions de l'édition 2026.10, l'a rejointe ainsi.

---

**Crée des images fidèles à ta marque, exportées en SVG** Le générateur d'images de Samsa apprend ta marque. Télécharge tes images en SVG à calques et transmets-les à tes designers. [Voir le générateur](https://samsa.ai/fr/image/)
