Samsa Samsa

Samsa Benchmarks

Benchmark vettorializzazione: quale AI trasforma un'illustrazione in un SVG modificabile?

Il benchmark vettorializzazione di Samsa misura quanto bene i modelli AI e gli strumenti di vettorializzazione trasformano un'illustrazione raster in un SVG che un designer può modificare. Ogni partecipante riceve lo stesso prompt e le stesse due immagini. Ogni risultato viene valutato su fedeltà all'originale, struttura (livelli con un nome e completi) e dettaglio nei punti chiave. Costo e tempo per immagine stanno accanto al punteggio, mai dentro, e i valori grezzi sono pubblicati.

Edizione 2026.10 Aggiornato il 87 esecuzioni 2 immagini 23 partecipanti

Punteggio contro costo

Ogni partecipante, posizionato per Samsa Vectorization Score e costo di un’immagine. In alto a sinistra è meglio; la linea unisce i partecipanti che nessuno batte su entrambi gli assi.

Punteggio contro costo 23 partecipanti disposti per punteggio contro costo per immagine su 2 immagini. Ogni valore è nella classifica qui sotto. 0.01 0.02 0.05 0.1 0.2 0.5 1 2 5 10 20 50 Costo per immagine, USD (scala log) 0 25 50 75 100 Samsa Vectorization Score GPT 6.1 Sol · high GPT 6.1 Sol · medium GPT 6.1 Sol · xhigh Claude Opus 5.5 · high Claude Opus 5.5 · max Claude Opus 5.5 · medium Claude Sonnet 5.5 · xhigh vtracer 0.6.15, default settings Punteggio contro costo 23 partecipanti disposti per punteggio contro costo per immagine su 2 immagini. Ogni valore è nella classifica qui sotto. 0.01 0.1 1 10 Costo per immagine, USD (scala log) 0 25 50 75 100 Punteggio
  • Anthropic
  • OpenAI
  • Google
  • Agentico
  • Single-shot
  • Ciclo fisso
  • Strumenti
  • Frontiera di Pareto
Classifica ↓

Classifica

Claude Opus 5.5 · max 1 Anthropic Claude Code 2.1.291 Agentico max 82.1 78.5 92.1 70.6 superata $51.9 (—) 118 min (—) 2
Claude Sonnet 5.5 · xhigh 2 Anthropic Claude Code 2.1.291 Agentico xhigh 79.5 76.0 89.2 68.8 superata $32.8 ($20.5–$45.5) 92 min (84 min–102 min) 4
Claude Opus 5.5 · high 3 Anthropic Claude Code 2.1.291 Agentico high 78.5 71.7 92.2 69.1 superata $22.2 ($13.3–$28.0) 72 min (40 min–95 min) 4
Claude Opus 5.5 · xhigh 4 Anthropic Claude Code 2.1.291 Agentico xhigh 78.4 72.6 90.7 68.8 superata $30.9 ($20.8–$50.5) 84 min (63 min–124 min) 6
GPT 6.1 Sol · xhigh 5 OpenAI Codex CLI 0.160.0 Agentico xhigh 73.9 64.0 89.0 73.1 superata $8.0 ($6.0–$15.4) 75 min (46 min–157 min) 6
GPT 6.1 Sol · high 6 OpenAI Codex CLI 0.160.0 Agentico high 73.3 60.8 91.1 73.1 mista $5.9 (—) 56 min (—) 2
Claude Sonnet 5.5 · high 7 Anthropic Claude Code 2.1.291 Agentico high 72.7 65.2 88.2 61.3 superata $14.3 (—) 53 min (—) 2
Claude Opus 5.5 · medium 8 Anthropic Claude Code 2.1.291 Agentico medium 72.5 64.2 88.3 63.1 superata $13.1 (—) 62 min (—) 2
GPT 6.1 Sol · medium 9 OpenAI Codex CLI 0.160.0 Agentico medium 68.4 53.7 88.5 70.6 mista $5.2 (—) 52 min (—) 2
GPT 6.1 Sol · xhigh 10 OpenAI API call, no tools (Codex CLI 0.160.0) Single-shot xhigh 48.8 15.1 87.2 67.5 non superata $0.34 ($0.29–$0.45) 13 min (10 min–21 min) 6
GPT 6.1 Sol · medium 11 OpenAI API call, no tools (Codex CLI 0.160.0) Single-shot medium 47.3 15.4 86.9 68.1 non superata $0.17 ($0.12–$0.24) 5.4 min (3.7 min–7.5 min) 10
vtracer 0.6.15, default settings 12 visioncortex (open source) — Strumento — 43.4 68.9 2.5 53.8 mista $0.00 (—) 0.1 min (—) 2
Claude Opus 5.5 · medium 13 Anthropic API call, no tools (Claude Code 2.1.292) Ciclo fisso medium 38.2 4.0 84.4 44.4 non superata $1.8 ($1.5–$2.4) 11 min (7.2 min–15 min) 4
Claude Fable 5.1 · medium 14 Anthropic API call, no tools (Claude Code 2.1.292) Single-shot medium 37.4 3.1 80.8 48.8 non superata $0.94 ($0.67–$1.3) 3.4 min (2.5 min–4.5 min) 6
Claude Opus 5.5 · medium 15 Anthropic API call, no tools (Claude Code 2.1.292) Single-shot medium 34.5 0.0 80.0 42.5 non superata $0.33 ($0.16–$0.42) 2.8 min (1.7 min–3.5 min) 6
Claude Sonnet 5.5 · medium 16 Anthropic API call, no tools (Claude Code 2.1.292) Ciclo fisso medium 32.8 4.5 74.8 29.4 non superata $0.38 ($0.23–$0.59) 3.7 min (1.8 min–6.2 min) 4
Claude Haiku 5.5 · medium 17 Anthropic API call, no tools (Claude Code 2.1.294) Single-shot medium 31.6 0.2 77.0 30.6 non superata $0.01 ($0.00–$0.01) 1 min (0.5 min–1.4 min) 6
Claude Sonnet 5.5 · medium 18 Anthropic API call, no tools (Claude Code 2.1.292) Single-shot medium 30.1 0.0 74.9 30.0 non superata $0.07 ($0.04–$0.15) 1.2 min (0.5 min–2.1 min) 6
Claude Fable 5.1 · xhigh Parziale: 1 di 2 immagini — Anthropic Claude Code 2.1.291 Agentico xhigh 63.1 52.6 81.6 55.0 non superata $42.9 (—) 88 min (—) 1
Gemini 3.1 Pro · max Parziale: 1 di 2 immagini — Google Gemini CLI 0.62.0 Agentico max 46.7 58.0 35.0 36.3 superata $1.6 (—) 11 min (—) 1

Che cosa mostra l'edizione 2026.10 del benchmark vettorializzazione?

Nel benchmark vettorializzazione di Samsa, edizione 2026.10 (8 ottobre 2026), Claude Opus 5.5 con effort max ha ottenuto il Samsa Vectorization Score più alto, 82.1 su 100, con un costo mediano di $43.5 per l'immagine piatta del laptop e di $60.2 per quella con texture della e-bike. La classifica si basa su 87 esecuzioni valutate di 23 configurazioni, su due illustrazioni. Claude Opus 5.5 con effort max è un riferimento con un'esecuzione per immagine.

  • Tra i modelli AI, solo le esecuzioni agentiche raggiungono la parità visiva. Un'esecuzione è agentica quando il modello lavora nell'agente di programmazione del suo fornitore, renderizza il suo SVG, lo confronta con l'originale e lo corregge per molti cicli. 29 esecuzioni agentiche su 32 hanno superato la soglia di parità con i suoi otto criteri. Nessuna delle 48 esecuzioni a chiamata singola o a ciclo fisso ci è riuscita, con qualunque modello.
  • I tracciatori copiano i pixel e perdono gli oggetti. vtracer e Vectorize di Recraft rendono bene i colori, e vtracer supera perfino la soglia di parità sull'immagine piatta del laptop. Nella struttura restano entrambi a 4 su 100 o meno: sulla e-bike vtracer ha restituito 9328 forme senza nome e Recraft 1462, con ogni oggetto tagliato nei pezzi che si vedono.
  • Il miglior rapporto tra punteggio e prezzo non è di Claude. GPT 6.1 Sol con effort xhigh ha ottenuto 73.9, con un costo mediano di $6.8 e $9.1 per immagine. Sono 8.2 punti in meno della configurazione migliore per circa 15 % del suo costo, e questo lo mette sulla linea di frontiera del grafico qui sopra.
  • Quiver AI disegna oggetti, non ancora l'immagine. Arrow 2 Telos restituisce pochi oggetti grandi e raggruppati, quindi il suo punteggio di struttura sta tra i tracciatori e le esecuzioni agentiche (58.1 sulla e-bike). La fedeltà resta molto sotto la soglia di parità su entrambe le immagini.
  • Più effort compra fedeltà, a caro prezzo. Claude Opus 5.5 con effort max ha raggiunto la fedeltà più alta di tutte le esecuzioni sulla e-bike (71.8), per $60.2. Il grafico dell'effort più in basso mostra da dove un dollaro in più smette di muovere il punteggio.

Claude Fable 5.1 con effort xhigh, un riferimento, è stato eseguito una volta sull'immagine del laptop e lì non ha superato la soglia di parità, per $42.9; compare come partecipante parziale, e la sua esecuzione sulla e-bike arriva con l'aggiornamento. Claude Haiku 5.5 è in questa edizione a chiamata singola, con effort medium: sei esecuzioni, $0.04 in tutto, nessuna alla parità, un punteggio complessivo di 31.6. Le sue varianti agentiche (xhigh e high) e l'ibrido, una bozza di GPT 6.1 Sol rifinita da Claude Opus 5.5 con effort high, sono ancora in corso e saranno aggiunti con un aggiornamento. Gemini 3.1 Pro è stato eseguito una volta, solo sull'immagine del laptop, e ha ottenuto 46.7: compare come partecipante parziale, senza posizione complessiva.

La variazione da un'esecuzione all'altra

La stessa configurazione agentica sulla stessa immagine è variata fino a 4.0 punti tra un'esecuzione e l'altra sulla e-bike, e il suo costo fino a 1.7 volte. Basta per scambiare due vicini in classifica. Per questo le configurazioni che contano per una decisione di prodotto sono state eseguite fino a tre volte, e la classifica mostra n e l'intervallo per ogni riga con più di un'esecuzione.

Perché un SVG tracciato non supera il test di struttura?

Un SVG tracciato non lo supera perché descrive l'immagine come aree di colore, non come cose. Samsa ha costruito questo benchmark perché i clienti chiedono file modificabili: spostare il ciclista, cambiare il colore della giacca, togliere la bici dalla scena. In un tracciato la gamba dietro esiste solo come le strisce visibili tra telaio e pedivella, e il cielo è una dozzina di frammenti attorno alle nuvole. Niente ha un nome, quindi un designer non trova niente.

Un SVG ricostruito è quello che consegnerebbe un illustratore: oggetti con un nome in un ordine di livelli sensato, ognuno disegnato per intero, anche dove altri oggetti lo coprono. È ciò che premia il punteggio di struttura, ed è per questo che la struttura pesa il 35 % accanto al 50 % della fedeltà. Un file che sembra giusto ma non si può modificare non fa il lavoro per cui si ordina un file vettoriale.

Che cosa significano i risultati se ti serve un SVG modificabile?

  • Per un'icona o un logo che deve solo scalare, basta un tracciatore. Costa poco o niente e impiega pochi secondi.
  • Per un'illustrazione che vuoi modificare, metti in conto un'esecuzione agentica: $5.3–$60.2 di calcolo e 31–128 minuti per immagine a questo livello, non centesimi e secondi.
  • Non giudicare dalla miniatura. Un file tracciato e uno ricostruito possono sembrare uguali a grandezza piena: apri i livelli prima di accettare l'uno o l'altro.
  • Un'esecuzione è un campione. Se il risultato conta, fanne due e tieni il file migliore, oppure prevedi una ripresa a mano dei dettagli delicati: volti, mani, meccanica.

La procedura passo per passo, con i controlli che un file finito deve superare, è nella guida su come vettorializzare un'immagine con l'AI senza perdere la modificabilità.

Come citarlo

Samsa, «Benchmark vettorializzazione», edizione 2026.10, 8 ottobre 2026, samsa.ai/it/benchmarks/vettorializzazione/. I prompt, i prompt dei giudici e le metriche grezze di ogni esecuzione sono pubblicati con il dataset.

Cosa compra più effort

Lo stesso modello a ogni livello di reasoning: come si muove il punteggio quando il costo per immagine sale.

Cosa compra più effort 3 modelli, ciascuno come linea attraverso i suoi livelli di effort dal basso all’alto. I valori sono nella classifica. 5 10 20 50 Costo per immagine, USD (scala log) 0 25 50 75 100 Samsa Vectorization Score GPT 6.1 Sol · medium: Punteggio 68.4, Costo per immagine (USD) $5.2 medium GPT 6.1 Sol · high: Punteggio 73.3, Costo per immagine (USD) $5.9 high GPT 6.1 Sol · xhigh: Punteggio 73.9, Costo per immagine (USD) $8.0 xhigh GPT 6.1 Sol Claude Sonnet 5.5 · high: Punteggio 72.7, Costo per immagine (USD) $14.3 high Claude Sonnet 5.5 · xhigh: Punteggio 79.5, Costo per immagine (USD) $32.8 xhigh Claude Sonnet 5.5 Claude Opus 5.5 · medium: Punteggio 72.5, Costo per immagine (USD) $13.1 medium Claude Opus 5.5 · high: Punteggio 78.5, Costo per immagine (USD) $22.2 high Claude Opus 5.5 · xhigh: Punteggio 78.4, Costo per immagine (USD) $30.9 xhigh Claude Opus 5.5 · max: Punteggio 82.1, Costo per immagine (USD) $51.9 max Claude Opus 5.5
  • GPT 6.1 Sol · medium → high → xhigh
  • Claude Sonnet 5.5 · high → xhigh
  • Claude Opus 5.5 · medium → high → xhigh → max

Struttura nel dettaglio

I controlli automatici di struttura per partecipante, modelli e strumenti insieme. Un trattino è un controllo che questa edizione non ha eseguito.

Struttura nel dettaglio
Modello o strumento Livelli con nomeInventarioCompletezzaEconomia dei tracciati Penalità
1 Claude Opus 5.5 · max 98.3 93.4 85.1 97.0 0
2 Claude Sonnet 5.5 · xhigh 100.0 100.0 72.4 100.0 0
3 Claude Opus 5.5 · high 98.8 100.0 81.7 100.0 0
4 Claude Opus 5.5 · xhigh 98.5 99.1 81.6 100.0 0
5 GPT 6.1 Sol · xhigh 100.0 100.0 72.9 100.0 0
6 GPT 6.1 Sol · high 100.0 100.0 74.0 100.0 0
7 Claude Sonnet 5.5 · high 99.0 100.0 75.9 100.0 0
8 Claude Opus 5.5 · medium 100.0 100.0 78.8 93.1 0
9 GPT 6.1 Sol · medium 100.0 93.8 72.7 100.0 0
10 GPT 6.1 Sol · xhigh 100.0 97.2 75.7 100.0 0
11 GPT 6.1 Sol · medium 100.0 88.7 77.6 100.0 -5
12 vtracer 0.6.15, default settings 0.0 0.0 3.7 0.0 -10
13 Claude Opus 5.5 · medium 100.0 66.1 87.1 100.0 0
14 Claude Fable 5.1 · medium 100.0 68.9 80.2 100.0 -10
15 Claude Opus 5.5 · medium — — — — —
16 Claude Sonnet 5.5 · medium 100.0 34.4 85.2 100.0 0
17 Claude Haiku 5.5 · medium 100.0 48.4 81.5 100.0 -5
18 Claude Sonnet 5.5 · medium 100.0 37.0 87.3 100.0 0
— Claude Fable 5.1 · xhigh Parziale: 1 di 2 immagini 100.0 96.9 76.6 70.6 0
— Gemini 3.1 Pro · max Parziale: 1 di 2 immagini 95.7 68.8 25.8 3.3 0

Come funziona un'esecuzione del benchmark?

Ogni partecipante riceve lo stesso prompt congelato e le stesse immagini, secondo il protocollo 1.0.1. Un'esecuzione è una sessione nuova nell'agente del fornitore, con il prompt come unico input e nessun messaggio intermedio. L'esecuzione itera finché la soglia di parità è superata e la revisione dei dettagli è pulita, oppure finché raggiunge il limite di tre ore o 25 cicli valutati, e poi lascia il suo stato migliore.

  • Un agente per fornitore, dichiarato. I modelli Claude girano in Claude Code 2.1.291 (Haiku 5.5 nella 2.1.294, la prima versione che conosce il modello), GPT 6.1 Sol in Codex CLI 0.160.0 sul fast tier, Gemini in Gemini CLI 0.62.0 con una chiave API. Si misura il modello insieme al suo agente, e la classifica nomina entrambi.
  • Le esecuzioni interrotte vengono scartate e ripetute. Un'esecuzione fermata dall'esterno (limite d'uso, processo terminato, errore di rete) non viene valutata, e il suo costo non compare da nessuna parte. La ripetizione prende il numero successivo.
  • I sub-agenti sono ammessi dove l'agente li offre. I loro token contano, e il dataset registra che l'esecuzione ha delegato.
  • Una macchina, un toolkit. Tutte le esecuzioni agentiche girano sullo stesso Mac, e il toolkit di valutazione è fissato tramite hash e non cambia mai durante un'edizione.

Quali sono le quattro categorie?

La categoria dice come un partecipante ha prodotto il suo SVG. Il grafico disegna ogni categoria con un proprio simbolo, e la classifica la mostra in una colonna.

Le quattro categorie del benchmark vettorializzazione
CategoriaCome nasce l'SVGChi ne fa parte
AgenticaIl modello lavora nell'agente del suo fornitore, scrive ed esegue codice, renderizza e confronta il suo SVG e itera entro i limiti.Claude Fable, Opus e Sonnet, GPT 6.1 Sol e Gemini 3.1 Pro; Claude Haiku e l'ibrido Sol + Opus arrivano con un aggiornamento
Chiamata singolaUna chiamata con immagine e prompt, senza strumenti. La risposta è l'SVG.Claude Opus, Sonnet, Fable e Haiku, GPT 6.1 Sol
Ciclo fissoQuattro cicli in cui il modello vede il suo render e il riscontro di parità e riscrive l'SVG, senza strumenti. Conta il ciclo migliore.Claude Opus 5.5 e Sonnet 5.5
StrumentoL'output di uno strumento di vettorializzazione, valutato come ogni altro SVG.Recraft Vectorize, Quiver AI Arrow 2 e Arrow 2 Telos, vtracer

Quali immagini compongono la suite?

Due illustrazioni create con Samsa, una per livello di difficoltà. Ognuna ha un inventario: l'elenco degli oggetti che una vettorializzazione completa deve contenere, scritto da Samsa e congelato per l'edizione.

  • Laptop, livello 1 (piatto): campiture piatte, nessuna texture, forme organiche sovrapposte, un volto e delle mani. 1376 × 768 pixel, 32 oggetti in inventario.
  • E-bike, livello 2 (con texture): grana pellicola, puntinato, sfumature, 56 raggi, un volto, parti nascoste dietro la gamba lontana e la pedivella. 2400 × 1792 pixel, 53 oggetti in inventario.
  • Una scena di livello 3 è prevista per un'edizione successiva.

Come viene valutata un'esecuzione?

Ogni esecuzione riceve tre punteggi parziali da 0 a 100, combinati nel Samsa Vectorization Score. Il valore di un partecipante per immagine è la mediana delle sue esecuzioni, la posizione complessiva la media di queste mediane. Un partecipante misurato su una sola immagine compare come parziale, senza posizione complessiva. Costo e tempo sono assi accanto al punteggio, mai dentro.

Le tre parti del Samsa Vectorization Score e il loro peso
PartePesoChe cosa misura
Fedeltà50 %Differenza di colore media, somiglianza strutturale, la peggiore finestra locale e, sulla e-bike, la corrispondenza della grana, rispetto all'originale, entrambe le immagini su fondo bianco. La soglia di parità a otto criteri compare come badge e non entra nel punteggio.
Struttura35 %60 % automatica: livelli con un nome, copertura dell'inventario, completezza delle forme nascoste ed economia dei tracciati, con penalità per immagini raster incorporate, tracciati di ritaglio che simulano l'occlusione e trasformazioni fissate. 40 % giudicata: significato degli oggetti, completezza sotto occlusione, modificabilità, ordine dei livelli e qualità dei tracciati.
Dettaglio15 %Due ingrandimenti standard per immagine (volto e mani sul laptop, volto e trasmissione sulla e-bike), giudicati rispetto allo stesso ingrandimento dell'originale per somiglianza e cura.

Le parti giudicate vengono da due modelli di visione di fornitori diversi, Claude Opus 5.5 e GPT 6.1 Sol, che vedono output anonimizzati e mescolati. I loro prompt sono pubblicati con i risultati.

Come si contano costo e tempo?

  • Il costo è un equivalente API: i token di un'esecuzione per classe (input, output compreso il ragionamento, scrittura e lettura della cache), moltiplicati per il prezzo di listino del fornitore nel giorno dell'esecuzione. Il listino usato è salvato con ogni esecuzione (6 ottobre 2026). È quanto costerebbe l'esecuzione tramite API, non una fattura.
  • Le esecuzioni Codex sul fast tier registrano il costo fast tier e l'equivalente standard. Haiku 5.5 è calcolato per richiesta sulle sue due tariffe legate alla lunghezza del prompt.
  • Uno strumento conta al suo prezzo pubblicato per conversione, e il suo tempo viene da una prova cronometrata.
  • Il tempo è il tempo reale dall'avvio dell'agente al suo rapporto finale.
  • Le righe con più esecuzioni mostrano la mediana e l'intervallo. Una riga con una sola esecuzione mostra solo il valore, perché un'esecuzione non ha variazione.

Che cosa è cambiato con il protocollo 1.0.1?

Gli output con una tela diversa dall'originale ora si allineano in base al contenuto, non alla cornice. Il sistema di valutazione renderizza l'SVG, prende il riquadro di ciò che ha disegnato, lo porta sul riquadro del contenuto dell'originale con un'unica scala e completa con trasparenza. Se le proporzioni dei due riquadri differiscono di oltre il 10 %, si adatta l'intera tela. La regola vale per tutti i partecipanti. È stata introdotta perché gli export di Quiver AI hanno un margine di circa il 2,4 % che con la vecchia regola costava loro quasi tutta la fedeltà: un difetto di inquadratura, non di vettorializzazione.

Quali sono i limiti?

  • Due immagini. La classifica dice come i partecipanti gestiscono un'illustrazione piatta e una con texture, non foto, loghi o disegni tecnici.
  • Modello più agente. Ogni modello gira nell'agente del suo fornitore, quindi l'agente fa parte della misura. Potrà seguire una categoria indipendente dall'agente.
  • Esecuzioni singole dove indicato. Claude Fable 5.1 con xhigh e Claude Opus 5.5 con max sono riferimenti con un'esecuzione per immagine, per il loro costo, e anche i livelli di effort più bassi sono stati eseguiti una volta. Gemini 3.1 Pro è stato eseguito una volta, sul laptop, con un tetto API di 20 $. Claude Opus 5.5 con effort high ha per ora due esecuzioni per immagine, e Claude Sonnet 5.5 con xhigh due sulla e-bike; le terze esecuzioni sono in corso e saranno aggiunte con un aggiornamento. Claude Fable 5.1 con effort xhigh non ha ancora un'esecuzione sulla e-bike: è stata interrotta da un limite d'uso, scartata secondo il protocollo e sarà ripetuta per l'aggiornamento.
  • Il controllo di completezza da solo premia pochi oggetti grandi, ed è così che disegna Arrow 2 Telos. Il punteggio di struttura nel suo insieme mette comunque i file ricostruiti davanti a Telos e Telos davanti ai tracciati, ma leggi quel punteggio parziale tenendone conto.
  • I giudici sono modelli. Vedono output anonimizzati e i loro prompt sono pubblicati, ma non sono designer. Samsa controlla a mano gli ingrandimenti prima della pubblicazione.
  • Samsa usa modelli di Anthropic, e uno dei due giudici è un modello di OpenAI. Il punteggio di fedeltà e la metà automatica del punteggio di struttura non hanno bisogno di un giudice, e ogni metrica grezza è pubblicata perché il risultato si possa verificare.

Come posso proporre un modello o uno strumento?

Esegui il prompt congelato su entrambe le immagini secondo il protocollo, oppure, per uno strumento, manda gli SVG delle due immagini con il prezzo e una prova cronometrata. Samsa li valuta con lo stesso toolkit e li aggiunge nel prossimo aggiornamento. Scrivici per proporne uno.

Registro delle modifiche

  1. Edizione pubblicata.

Domande frequenti: benchmark vettorializzazione

Che cosa misura il benchmark vettorializzazione?

Un solo compito: trasformare un'illustrazione raster in un SVG che un designer può modificare. Ogni esecuzione viene valutata sulla fedeltà all'originale (50 %), sulla struttura, cioè livelli con un nome, completi ed economici (35 %), e sul dettaglio dei punti chiave come volti e mani (15 %). La somma ponderata è il Samsa Vectorization Score. Costo e tempo per immagine stanno accanto e non lo cambiano mai.

Quale AI vettorializza meglio un'illustrazione?

Nell'edizione 2026.10 è in testa Claude Opus 5.5 con effort max con 82.1, davanti a Claude Sonnet 5.5 con effort xhigh (79.5). GPT 6.1 Sol con effort xhigh ha ottenuto 73.9 a una frazione del costo. Tutte le configurazioni di testa hanno lavorato come agente che renderizza e corregge il proprio SVG; nessun prompt singolo, a nessun modello, ci si è avvicinato.

Un solo prompt a un modello AI può trasformare un'immagine in un SVG modificabile?

Non alla parità, in questo benchmark. Le chiamate singole a modelli Claude e GPT hanno restituito in pochi minuti SVG puliti e con nomi chiari, per pochi centesimi o circa un dollaro. Ma nessuna delle 48 esecuzioni a chiamata singola o a ciclo fisso ha superato la soglia di parità: sono versioni stilizzate dell'immagine, non copie. Mostrare al modello il suo render per quattro cicli non ha chiuso il divario. La parità ha richiesto un agente che misura e corregge.

Perché gli strumenti di tracciatura hanno un punteggio basso se il loro SVG sembra giusto?

Perché sembrare giusto è solo metà del lavoro. Un tracciatore divide l'immagine in forme piatte per colore: sulla e-bike vtracer ha prodotto 9328 forme senza nome. La fedeltà è alta, ma nessuna forma è un oggetto e mancano tutte le parti nascoste. Il punteggio di struttura, il 35 % del totale, misura proprio ciò che serve a un designer per modificare il file, e lì i tracciatori perdono quasi tutto.

Come conta il benchmark costo e tempo?

Il costo sono i token di un'esecuzione moltiplicati per il prezzo di listino del fornitore nel giorno dell'esecuzione, per classe di token, con il listino salvato insieme all'esecuzione. È un equivalente API, non una fattura. Uno strumento conta al suo prezzo pubblicato per conversione. Il tempo va dall'avvio al rapporto finale. Entrambi sono mediane sulle esecuzioni di un partecipante, con l'intervallo quando ce n'è più di una.

Il benchmark vettorializzazione è indipendente?

Nessun benchmark condotto da un'azienda è del tutto indipendente, e Samsa usa modelli di Anthropic. Lo rendono verificabile: un prompt congelato per tutti, la valutazione automatica della fedeltà, due giudici di fornitori diversi su output anonimizzati, i prompt dei giudici pubblicati e ogni metrica grezza pubblicata con la sua esecuzione. Chiunque può ripetere il protocollo e confrontare.

Posso proporre un modello o uno strumento?

Sì. Esegui il prompt congelato su entrambe le immagini secondo il protocollo, oppure manda gli SVG di uno strumento per le due immagini con il prezzo e una prova cronometrata. Samsa valuta la proposta con lo stesso toolkit e la aggiunge nel prossimo aggiornamento. Usa la pagina dei contatti per scriverci.

Ogni quanto viene aggiornato il benchmark?

Quando esce un modello o uno strumento rilevante. Le righe si aggiungono e non si modificano mai: un partecipante misurato di nuovo riceve una nuova edizione, i listini restano con le loro esecuzioni, e il registro delle modifiche di questa pagina data ogni cambiamento. Claude Haiku 5.5, uscito mentre le esecuzioni dell'edizione 2026.10 erano in corso, è entrato così.

Crea immagini per il tuo brand ed esportale in SVG

Il generatore di immagini di Samsa impara il tuo brand. Scarica le immagini come SVG a livelli e passale ai tuoi designer.

# Benchmark vettorializzazione: quale AI trasforma un'illustrazione in un SVG modificabile?

> Benchmark vettorializzazione: Claude, GPT, Gemini, Recraft e Quiver AI su un'illustrazione da trasformare in SVG modificabile a livelli, con costo e tempo.

Language: Italiano · Machine index: [https://samsa.ai/llms.txt](/llms.txt)

---

Il benchmark vettorializzazione di Samsa misura quanto bene i modelli AI e gli strumenti di vettorializzazione trasformano un'illustrazione raster in un SVG che un designer può modificare. Ogni partecipante riceve lo stesso prompt e le stesse due immagini. Ogni risultato viene valutato su fedeltà all'originale, struttura (livelli con un nome e completi) e dettaglio nei punti chiave. Costo e tempo per immagine stanno accanto al punteggio, mai dentro, e i valori grezzi sono pubblicati.

---

## Classifica

Edizione 2026.10 · Aggiornato il 2026-10-08 · 87 esecuzioni · 2 immagini · 23 partecipanti

| # | Modello o strumento | Fornitore | Agente | Traccia | Effort | Punteggio | Fedeltà | Struttura | Dettaglio | Soglia di parità | Costo per immagine (USD) | Tempo per immagine | Esecuzioni |

| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |

| 1 | Claude Opus 5.5 · max | Anthropic | Claude Code 2.1.291 | Agentico | max | 82.1 | 78.5 | 92.1 | 70.6 | superata | $51.9 | 118 min | 2 |

| 2 | Claude Sonnet 5.5 · xhigh | Anthropic | Claude Code 2.1.291 | Agentico | xhigh | 79.5 | 76.0 | 89.2 | 68.8 | superata | $32.8 | 92 min | 4 |

| 3 | Claude Opus 5.5 · high | Anthropic | Claude Code 2.1.291 | Agentico | high | 78.5 | 71.7 | 92.2 | 69.1 | superata | $22.2 | 72 min | 4 |

| 4 | Claude Opus 5.5 · xhigh | Anthropic | Claude Code 2.1.291 | Agentico | xhigh | 78.4 | 72.6 | 90.7 | 68.8 | superata | $30.9 | 84 min | 6 |

| 5 | GPT 6.1 Sol · xhigh | OpenAI | Codex CLI 0.160.0 | Agentico | xhigh | 73.9 | 64.0 | 89.0 | 73.1 | superata | $8.0 | 75 min | 6 |

| 6 | GPT 6.1 Sol · high | OpenAI | Codex CLI 0.160.0 | Agentico | high | 73.3 | 60.8 | 91.1 | 73.1 | mista | $5.9 | 56 min | 2 |

| 7 | Claude Sonnet 5.5 · high | Anthropic | Claude Code 2.1.291 | Agentico | high | 72.7 | 65.2 | 88.2 | 61.3 | superata | $14.3 | 53 min | 2 |

| 8 | Claude Opus 5.5 · medium | Anthropic | Claude Code 2.1.291 | Agentico | medium | 72.5 | 64.2 | 88.3 | 63.1 | superata | $13.1 | 62 min | 2 |

| 9 | GPT 6.1 Sol · medium | OpenAI | Codex CLI 0.160.0 | Agentico | medium | 68.4 | 53.7 | 88.5 | 70.6 | mista | $5.2 | 52 min | 2 |

| 10 | GPT 6.1 Sol · xhigh | OpenAI | API call, no tools (Codex CLI 0.160.0) | Single-shot | xhigh | 48.8 | 15.1 | 87.2 | 67.5 | non superata | $0.34 | 13 min | 6 |

| 11 | GPT 6.1 Sol · medium | OpenAI | API call, no tools (Codex CLI 0.160.0) | Single-shot | medium | 47.3 | 15.4 | 86.9 | 68.1 | non superata | $0.17 | 5.4 min | 10 |

| 12 | vtracer 0.6.15, default settings | visioncortex (open source) | — | Strumento | — | 43.4 | 68.9 | 2.5 | 53.8 | mista | $0.00 | 0.1 min | 2 |

| 13 | Claude Opus 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Ciclo fisso | medium | 38.2 | 4.0 | 84.4 | 44.4 | non superata | $1.8 | 11 min | 4 |

| 14 | Claude Fable 5.1 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-shot | medium | 37.4 | 3.1 | 80.8 | 48.8 | non superata | $0.94 | 3.4 min | 6 |

| 15 | Claude Opus 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-shot | medium | 34.5 | 0.0 | 80.0 | 42.5 | non superata | $0.33 | 2.8 min | 6 |

| 16 | Claude Sonnet 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Ciclo fisso | medium | 32.8 | 4.5 | 74.8 | 29.4 | non superata | $0.38 | 3.7 min | 4 |

| 17 | Claude Haiku 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.294) | Single-shot | medium | 31.6 | 0.2 | 77.0 | 30.6 | non superata | $0.01 | 1 min | 6 |

| 18 | Claude Sonnet 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-shot | medium | 30.1 | 0.0 | 74.9 | 30.0 | non superata | $0.07 | 1.2 min | 6 |

| — | Claude Fable 5.1 · xhigh (Parziale: 1 di 2 immagini) | Anthropic | Claude Code 2.1.291 | Agentico | xhigh | 63.1 | 52.6 | 81.6 | 55.0 | non superata | $42.9 | 88 min | 1 |

| — | Gemini 3.1 Pro · max (Parziale: 1 di 2 immagini) | Google | Gemini CLI 0.62.0 | Agentico | max | 46.7 | 58.0 | 35.0 | 36.3 | superata | $1.6 | 11 min | 1 |

---

## Che cosa mostra l'edizione 2026.10 del benchmark vettorializzazione?

Nel benchmark vettorializzazione di Samsa, edizione 2026.10 (8 ottobre 2026), Claude Opus 5.5 con effort max ha ottenuto il Samsa Vectorization Score più alto, 82.1 su 100, con un costo mediano di $43.5 per l'immagine piatta del laptop e di $60.2 per quella con texture della e-bike. La classifica si basa su 87 esecuzioni valutate di 23 configurazioni, su due illustrazioni. Claude Opus 5.5 con effort max è un riferimento con un'esecuzione per immagine.

- Tra i modelli AI, solo le esecuzioni agentiche raggiungono la parità visiva. Un'esecuzione è agentica quando il modello lavora nell'agente di programmazione del suo fornitore, renderizza il suo SVG, lo confronta con l'originale e lo corregge per molti cicli. 29 esecuzioni agentiche su 32 hanno superato la soglia di parità con i suoi otto criteri. Nessuna delle 48 esecuzioni a chiamata singola o a ciclo fisso ci è riuscita, con qualunque modello.

- I tracciatori copiano i pixel e perdono gli oggetti. vtracer e Vectorize di Recraft rendono bene i colori, e vtracer supera perfino la soglia di parità sull'immagine piatta del laptop. Nella struttura restano entrambi a 4 su 100 o meno: sulla e-bike vtracer ha restituito 9328 forme senza nome e Recraft 1462, con ogni oggetto tagliato nei pezzi che si vedono.

- Il miglior rapporto tra punteggio e prezzo non è di Claude. GPT 6.1 Sol con effort xhigh ha ottenuto 73.9, con un costo mediano di $6.8 e $9.1 per immagine. Sono 8.2 punti in meno della configurazione migliore per circa 15 % del suo costo, e questo lo mette sulla linea di frontiera del grafico qui sopra.

- Quiver AI disegna oggetti, non ancora l'immagine. Arrow 2 Telos restituisce pochi oggetti grandi e raggruppati, quindi il suo punteggio di struttura sta tra i tracciatori e le esecuzioni agentiche (58.1 sulla e-bike). La fedeltà resta molto sotto la soglia di parità su entrambe le immagini.

- Più effort compra fedeltà, a caro prezzo. Claude Opus 5.5 con effort max ha raggiunto la fedeltà più alta di tutte le esecuzioni sulla e-bike (71.8), per $60.2. Il grafico dell'effort più in basso mostra da dove un dollaro in più smette di muovere il punteggio.

Claude Fable 5.1 con effort xhigh, un riferimento, è stato eseguito una volta sull'immagine del laptop e lì non ha superato la soglia di parità, per $42.9; compare come partecipante parziale, e la sua esecuzione sulla e-bike arriva con l'aggiornamento. Claude Haiku 5.5 è in questa edizione a chiamata singola, con effort medium: sei esecuzioni, $0.04 in tutto, nessuna alla parità, un punteggio complessivo di 31.6. Le sue varianti agentiche (xhigh e high) e l'ibrido, una bozza di GPT 6.1 Sol rifinita da Claude Opus 5.5 con effort high, sono ancora in corso e saranno aggiunti con un aggiornamento. Gemini 3.1 Pro è stato eseguito una volta, solo sull'immagine del laptop, e ha ottenuto 46.7: compare come partecipante parziale, senza posizione complessiva.

> **La variazione da un'esecuzione all'altra** La stessa configurazione agentica sulla stessa immagine è variata fino a 4.0 punti tra un'esecuzione e l'altra sulla e-bike, e il suo costo fino a 1.7 volte. Basta per scambiare due vicini in classifica. Per questo le configurazioni che contano per una decisione di prodotto sono state eseguite fino a tre volte, e la classifica mostra n e l'intervallo per ogni riga con più di un'esecuzione.

---

## Perché un SVG tracciato non supera il test di struttura?

Un SVG tracciato non lo supera perché descrive l'immagine come aree di colore, non come cose. Samsa ha costruito questo benchmark perché i clienti chiedono file modificabili: spostare il ciclista, cambiare il colore della giacca, togliere la bici dalla scena. In un tracciato la gamba dietro esiste solo come le strisce visibili tra telaio e pedivella, e il cielo è una dozzina di frammenti attorno alle nuvole. Niente ha un nome, quindi un designer non trova niente.

Un SVG ricostruito è quello che consegnerebbe un illustratore: oggetti con un nome in un ordine di livelli sensato, ognuno disegnato per intero, anche dove altri oggetti lo coprono. È ciò che premia il punteggio di struttura, ed è per questo che la struttura pesa il 35 % accanto al 50 % della fedeltà. Un file che sembra giusto ma non si può modificare non fa il lavoro per cui si ordina un file vettoriale.

---

## Che cosa significano i risultati se ti serve un SVG modificabile?

- Per un'icona o un logo che deve solo scalare, basta un tracciatore. Costa poco o niente e impiega pochi secondi.

- Per un'illustrazione che vuoi modificare, metti in conto un'esecuzione agentica: $5.3–$60.2 di calcolo e 31–128 minuti per immagine a questo livello, non centesimi e secondi.

- Non giudicare dalla miniatura. Un file tracciato e uno ricostruito possono sembrare uguali a grandezza piena: apri i livelli prima di accettare l'uno o l'altro.

- Un'esecuzione è un campione. Se il risultato conta, fanne due e tieni il file migliore, oppure prevedi una ripresa a mano dei dettagli delicati: volti, mani, meccanica.

La procedura passo per passo, con i controlli che un file finito deve superare, è nella guida su come [vettorializzare un'immagine con l'AI senza perdere la modificabilità](https://samsa.ai/it/guide/vettorializzare-immagine/).

> **Come citarlo** Samsa, «Benchmark vettorializzazione», edizione 2026.10, 8 ottobre 2026, samsa.ai/it/benchmarks/vettorializzazione/. I prompt, i prompt dei giudici e le metriche grezze di ogni esecuzione sono pubblicati con il dataset.

---

## Come funziona un'esecuzione del benchmark?

Ogni partecipante riceve lo stesso prompt congelato e le stesse immagini, secondo il protocollo 1.0.1. Un'esecuzione è una sessione nuova nell'agente del fornitore, con il prompt come unico input e nessun messaggio intermedio. L'esecuzione itera finché la soglia di parità è superata e la revisione dei dettagli è pulita, oppure finché raggiunge il limite di tre ore o 25 cicli valutati, e poi lascia il suo stato migliore.

- Un agente per fornitore, dichiarato. I modelli Claude girano in Claude Code 2.1.291 (Haiku 5.5 nella 2.1.294, la prima versione che conosce il modello), GPT 6.1 Sol in Codex CLI 0.160.0 sul fast tier, Gemini in Gemini CLI 0.62.0 con una chiave API. Si misura il modello insieme al suo agente, e la classifica nomina entrambi.

- Le esecuzioni interrotte vengono scartate e ripetute. Un'esecuzione fermata dall'esterno (limite d'uso, processo terminato, errore di rete) non viene valutata, e il suo costo non compare da nessuna parte. La ripetizione prende il numero successivo.

- I sub-agenti sono ammessi dove l'agente li offre. I loro token contano, e il dataset registra che l'esecuzione ha delegato.

- Una macchina, un toolkit. Tutte le esecuzioni agentiche girano sullo stesso Mac, e il toolkit di valutazione è fissato tramite hash e non cambia mai durante un'edizione.

---

## Quali sono le quattro categorie?

La categoria dice come un partecipante ha prodotto il suo SVG. Il grafico disegna ogni categoria con un proprio simbolo, e la classifica la mostra in una colonna.

**Le quattro categorie del benchmark vettorializzazione**

| Categoria | Come nasce l'SVG | Chi ne fa parte |

| --- | --- | --- |

| Agentica | Il modello lavora nell'agente del suo fornitore, scrive ed esegue codice, renderizza e confronta il suo SVG e itera entro i limiti. | Claude Fable, Opus e Sonnet, GPT 6.1 Sol e Gemini 3.1 Pro; Claude Haiku e l'ibrido Sol + Opus arrivano con un aggiornamento |

| Chiamata singola | Una chiamata con immagine e prompt, senza strumenti. La risposta è l'SVG. | Claude Opus, Sonnet, Fable e Haiku, GPT 6.1 Sol |

| Ciclo fisso | Quattro cicli in cui il modello vede il suo render e il riscontro di parità e riscrive l'SVG, senza strumenti. Conta il ciclo migliore. | Claude Opus 5.5 e Sonnet 5.5 |

| Strumento | L'output di uno strumento di vettorializzazione, valutato come ogni altro SVG. | Recraft Vectorize, Quiver AI Arrow 2 e Arrow 2 Telos, vtracer |

---

## Quali immagini compongono la suite?

Due illustrazioni create con Samsa, una per livello di difficoltà. Ognuna ha un inventario: l'elenco degli oggetti che una vettorializzazione completa deve contenere, scritto da Samsa e congelato per l'edizione.

- Laptop, livello 1 (piatto): campiture piatte, nessuna texture, forme organiche sovrapposte, un volto e delle mani. 1376 × 768 pixel, 32 oggetti in inventario.

- E-bike, livello 2 (con texture): grana pellicola, puntinato, sfumature, 56 raggi, un volto, parti nascoste dietro la gamba lontana e la pedivella. 2400 × 1792 pixel, 53 oggetti in inventario.

- Una scena di livello 3 è prevista per un'edizione successiva.

---

## Come viene valutata un'esecuzione?

Ogni esecuzione riceve tre punteggi parziali da 0 a 100, combinati nel Samsa Vectorization Score. Il valore di un partecipante per immagine è la mediana delle sue esecuzioni, la posizione complessiva la media di queste mediane. Un partecipante misurato su una sola immagine compare come parziale, senza posizione complessiva. Costo e tempo sono assi accanto al punteggio, mai dentro.

**Le tre parti del Samsa Vectorization Score e il loro peso**

| Parte | Peso | Che cosa misura |

| --- | --- | --- |

| Fedeltà | 50 % | Differenza di colore media, somiglianza strutturale, la peggiore finestra locale e, sulla e-bike, la corrispondenza della grana, rispetto all'originale, entrambe le immagini su fondo bianco. La soglia di parità a otto criteri compare come badge e non entra nel punteggio. |

| Struttura | 35 % | 60 % automatica: livelli con un nome, copertura dell'inventario, completezza delle forme nascoste ed economia dei tracciati, con penalità per immagini raster incorporate, tracciati di ritaglio che simulano l'occlusione e trasformazioni fissate. 40 % giudicata: significato degli oggetti, completezza sotto occlusione, modificabilità, ordine dei livelli e qualità dei tracciati. |

| Dettaglio | 15 % | Due ingrandimenti standard per immagine (volto e mani sul laptop, volto e trasmissione sulla e-bike), giudicati rispetto allo stesso ingrandimento dell'originale per somiglianza e cura. |

Le parti giudicate vengono da due modelli di visione di fornitori diversi, Claude Opus 5.5 e GPT 6.1 Sol, che vedono output anonimizzati e mescolati. I loro prompt sono pubblicati con i risultati.

---

## Come si contano costo e tempo?

- Il costo è un equivalente API: i token di un'esecuzione per classe (input, output compreso il ragionamento, scrittura e lettura della cache), moltiplicati per il prezzo di listino del fornitore nel giorno dell'esecuzione. Il listino usato è salvato con ogni esecuzione (6 ottobre 2026). È quanto costerebbe l'esecuzione tramite API, non una fattura.

- Le esecuzioni Codex sul fast tier registrano il costo fast tier e l'equivalente standard. Haiku 5.5 è calcolato per richiesta sulle sue due tariffe legate alla lunghezza del prompt.

- Uno strumento conta al suo prezzo pubblicato per conversione, e il suo tempo viene da una prova cronometrata.

- Il tempo è il tempo reale dall'avvio dell'agente al suo rapporto finale.

- Le righe con più esecuzioni mostrano la mediana e l'intervallo. Una riga con una sola esecuzione mostra solo il valore, perché un'esecuzione non ha variazione.

---

## Che cosa è cambiato con il protocollo 1.0.1?

Gli output con una tela diversa dall'originale ora si allineano in base al contenuto, non alla cornice. Il sistema di valutazione renderizza l'SVG, prende il riquadro di ciò che ha disegnato, lo porta sul riquadro del contenuto dell'originale con un'unica scala e completa con trasparenza. Se le proporzioni dei due riquadri differiscono di oltre il 10 %, si adatta l'intera tela. La regola vale per tutti i partecipanti. È stata introdotta perché gli export di Quiver AI hanno un margine di circa il 2,4 % che con la vecchia regola costava loro quasi tutta la fedeltà: un difetto di inquadratura, non di vettorializzazione.

---

## Quali sono i limiti?

- Due immagini. La classifica dice come i partecipanti gestiscono un'illustrazione piatta e una con texture, non foto, loghi o disegni tecnici.

- Modello più agente. Ogni modello gira nell'agente del suo fornitore, quindi l'agente fa parte della misura. Potrà seguire una categoria indipendente dall'agente.

- Esecuzioni singole dove indicato. Claude Fable 5.1 con xhigh e Claude Opus 5.5 con max sono riferimenti con un'esecuzione per immagine, per il loro costo, e anche i livelli di effort più bassi sono stati eseguiti una volta. Gemini 3.1 Pro è stato eseguito una volta, sul laptop, con un tetto API di 20 $. Claude Opus 5.5 con effort high ha per ora due esecuzioni per immagine, e Claude Sonnet 5.5 con xhigh due sulla e-bike; le terze esecuzioni sono in corso e saranno aggiunte con un aggiornamento. Claude Fable 5.1 con effort xhigh non ha ancora un'esecuzione sulla e-bike: è stata interrotta da un limite d'uso, scartata secondo il protocollo e sarà ripetuta per l'aggiornamento.

- Il controllo di completezza da solo premia pochi oggetti grandi, ed è così che disegna Arrow 2 Telos. Il punteggio di struttura nel suo insieme mette comunque i file ricostruiti davanti a Telos e Telos davanti ai tracciati, ma leggi quel punteggio parziale tenendone conto.

- I giudici sono modelli. Vedono output anonimizzati e i loro prompt sono pubblicati, ma non sono designer. Samsa controlla a mano gli ingrandimenti prima della pubblicazione.

- Samsa usa modelli di Anthropic, e uno dei due giudici è un modello di OpenAI. Il punteggio di fedeltà e la metà automatica del punteggio di struttura non hanno bisogno di un giudice, e ogni metrica grezza è pubblicata perché il risultato si possa verificare.

---

## Come posso proporre un modello o uno strumento?

Esegui il prompt congelato su entrambe le immagini secondo il protocollo, oppure, per uno strumento, manda gli SVG delle due immagini con il prezzo e una prova cronometrata. Samsa li valuta con lo stesso toolkit e li aggiunge nel prossimo aggiornamento. [Scrivici](/it/contatto/) per proporne uno.

---

## Domande frequenti: benchmark vettorializzazione

### Che cosa misura il benchmark vettorializzazione?

Un solo compito: trasformare un'illustrazione raster in un SVG che un designer può modificare. Ogni esecuzione viene valutata sulla fedeltà all'originale (50 %), sulla struttura, cioè livelli con un nome, completi ed economici (35 %), e sul dettaglio dei punti chiave come volti e mani (15 %). La somma ponderata è il Samsa Vectorization Score. Costo e tempo per immagine stanno accanto e non lo cambiano mai.

### Quale AI vettorializza meglio un'illustrazione?

Nell'edizione 2026.10 è in testa Claude Opus 5.5 con effort max con 82.1, davanti a Claude Sonnet 5.5 con effort xhigh (79.5). GPT 6.1 Sol con effort xhigh ha ottenuto 73.9 a una frazione del costo. Tutte le configurazioni di testa hanno lavorato come agente che renderizza e corregge il proprio SVG; nessun prompt singolo, a nessun modello, ci si è avvicinato.

### Un solo prompt a un modello AI può trasformare un'immagine in un SVG modificabile?

Non alla parità, in questo benchmark. Le chiamate singole a modelli Claude e GPT hanno restituito in pochi minuti SVG puliti e con nomi chiari, per pochi centesimi o circa un dollaro. Ma nessuna delle 48 esecuzioni a chiamata singola o a ciclo fisso ha superato la soglia di parità: sono versioni stilizzate dell'immagine, non copie. Mostrare al modello il suo render per quattro cicli non ha chiuso il divario. La parità ha richiesto un agente che misura e corregge.

### Perché gli strumenti di tracciatura hanno un punteggio basso se il loro SVG sembra giusto?

Perché sembrare giusto è solo metà del lavoro. Un tracciatore divide l'immagine in forme piatte per colore: sulla e-bike vtracer ha prodotto 9328 forme senza nome. La fedeltà è alta, ma nessuna forma è un oggetto e mancano tutte le parti nascoste. Il punteggio di struttura, il 35 % del totale, misura proprio ciò che serve a un designer per modificare il file, e lì i tracciatori perdono quasi tutto.

### Come conta il benchmark costo e tempo?

Il costo sono i token di un'esecuzione moltiplicati per il prezzo di listino del fornitore nel giorno dell'esecuzione, per classe di token, con il listino salvato insieme all'esecuzione. È un equivalente API, non una fattura. Uno strumento conta al suo prezzo pubblicato per conversione. Il tempo va dall'avvio al rapporto finale. Entrambi sono mediane sulle esecuzioni di un partecipante, con l'intervallo quando ce n'è più di una.

### Il benchmark vettorializzazione è indipendente?

Nessun benchmark condotto da un'azienda è del tutto indipendente, e Samsa usa modelli di Anthropic. Lo rendono verificabile: un prompt congelato per tutti, la valutazione automatica della fedeltà, due giudici di fornitori diversi su output anonimizzati, i prompt dei giudici pubblicati e ogni metrica grezza pubblicata con la sua esecuzione. Chiunque può ripetere il protocollo e confrontare.

### Posso proporre un modello o uno strumento?

Sì. Esegui il prompt congelato su entrambe le immagini secondo il protocollo, oppure manda gli SVG di uno strumento per le due immagini con il prezzo e una prova cronometrata. Samsa valuta la proposta con lo stesso toolkit e la aggiunge nel prossimo aggiornamento. Usa la [pagina dei contatti](/it/contatto/) per scriverci.

### Ogni quanto viene aggiornato il benchmark?

Quando esce un modello o uno strumento rilevante. Le righe si aggiungono e non si modificano mai: un partecipante misurato di nuovo riceve una nuova edizione, i listini restano con le loro esecuzioni, e il registro delle modifiche di questa pagina data ogni cambiamento. Claude Haiku 5.5, uscito mentre le esecuzioni dell'edizione 2026.10 erano in corso, è entrato così.

---

**Crea immagini per il tuo brand ed esportale in SVG** Il generatore di immagini di Samsa impara il tuo brand. Scarica le immagini come SVG a livelli e passale ai tuoi designer. [Vai al generatore](/it/immagine/)