# Vektorisierung im Benchmark: Welche KI macht aus einer Illustration ein editierbares SVG?

> Vektorisierung Benchmark: Claude, GPT, Gemini, Recraft und Quiver AI im Test, Illustration zu editierbarem SVG mit Ebenen. Score, Kosten und Zeit pro Bild.

Human version: https://samsa.ai/de/benchmarks/vektorisierung/
Language: Deutsch
Machine index: https://samsa.ai/llms.txt

---
Der Samsa Benchmark zur Vektorisierung misst, wie gut KI-Modelle und Vektorisierungs-Tools eine Raster-Illustration in ein SVG verwandeln, das ein Designer bearbeiten kann. Alle Teilnehmer bekommen denselben Prompt und dieselben zwei Bilder. Bewertet werden die Treue zum Original, die Struktur (benannte, vollständige Ebenen) und die Details an den wichtigen Stellen. Kosten und Zeit pro Bild stehen daneben und fliessen nie in den Score ein. Die Rohwerte jedes Laufs sind veröffentlicht.

---

## Rangliste

Ausgabe 2026.10 · Aktualisiert 2026-10-08 · 87 Läufe · 2 Bilder · 23 Teilnehmer

| # | Modell oder Tool | Anbieter | Agent | Track | Effort | Score | Treue | Struktur | Details | Parity-Gate | Kosten pro Bild (USD) | Zeit pro Bild | Läufe |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | Claude Opus 5.5 · max | Anthropic | Claude Code 2.1.291 | Agentisch | max | 82.1 | 78.5 | 92.1 | 70.6 | bestanden | $51.9 | 118 Min. | 2 |
| 2 | Claude Sonnet 5.5 · xhigh | Anthropic | Claude Code 2.1.291 | Agentisch | xhigh | 79.5 | 76.0 | 89.2 | 68.8 | bestanden | $32.8 | 92 Min. | 4 |
| 3 | Claude Opus 5.5 · high | Anthropic | Claude Code 2.1.291 | Agentisch | high | 78.5 | 71.7 | 92.2 | 69.1 | bestanden | $22.2 | 72 Min. | 4 |
| 4 | Claude Opus 5.5 · xhigh | Anthropic | Claude Code 2.1.291 | Agentisch | xhigh | 78.4 | 72.6 | 90.7 | 68.8 | bestanden | $30.9 | 84 Min. | 6 |
| 5 | GPT 6.1 Sol · xhigh | OpenAI | Codex CLI 0.160.0 | Agentisch | xhigh | 73.9 | 64.0 | 89.0 | 73.1 | bestanden | $8.0 | 75 Min. | 6 |
| 6 | GPT 6.1 Sol · high | OpenAI | Codex CLI 0.160.0 | Agentisch | high | 73.3 | 60.8 | 91.1 | 73.1 | gemischt | $5.9 | 56 Min. | 2 |
| 7 | Claude Sonnet 5.5 · high | Anthropic | Claude Code 2.1.291 | Agentisch | high | 72.7 | 65.2 | 88.2 | 61.3 | bestanden | $14.3 | 53 Min. | 2 |
| 8 | Claude Opus 5.5 · medium | Anthropic | Claude Code 2.1.291 | Agentisch | medium | 72.5 | 64.2 | 88.3 | 63.1 | bestanden | $13.1 | 62 Min. | 2 |
| 9 | GPT 6.1 Sol · medium | OpenAI | Codex CLI 0.160.0 | Agentisch | medium | 68.4 | 53.7 | 88.5 | 70.6 | gemischt | $5.2 | 52 Min. | 2 |
| 10 | GPT 6.1 Sol · xhigh | OpenAI | API call, no tools (Codex CLI 0.160.0) | Single-Shot | xhigh | 48.8 | 15.1 | 87.2 | 67.5 | nicht bestanden | $0.34 | 13 Min. | 6 |
| 11 | GPT 6.1 Sol · medium | OpenAI | API call, no tools (Codex CLI 0.160.0) | Single-Shot | medium | 47.3 | 15.4 | 86.9 | 68.1 | nicht bestanden | $0.17 | 5.4 Min. | 10 |
| 12 | vtracer 0.6.15, default settings | visioncortex (open source) | — | Tool | — | 43.4 | 68.9 | 2.5 | 53.8 | gemischt | $0.00 | 0.1 Min. | 2 |
| 13 | Claude Opus 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Feste Schleife | medium | 38.2 | 4.0 | 84.4 | 44.4 | nicht bestanden | $1.8 | 11 Min. | 4 |
| 14 | Claude Fable 5.1 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-Shot | medium | 37.4 | 3.1 | 80.8 | 48.8 | nicht bestanden | $0.94 | 3.4 Min. | 6 |
| 15 | Claude Opus 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-Shot | medium | 34.5 | 0.0 | 80.0 | 42.5 | nicht bestanden | $0.33 | 2.8 Min. | 6 |
| 16 | Claude Sonnet 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Feste Schleife | medium | 32.8 | 4.5 | 74.8 | 29.4 | nicht bestanden | $0.38 | 3.7 Min. | 4 |
| 17 | Claude Haiku 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.294) | Single-Shot | medium | 31.6 | 0.2 | 77.0 | 30.6 | nicht bestanden | $0.01 | 1 Min. | 6 |
| 18 | Claude Sonnet 5.5 · medium | Anthropic | API call, no tools (Claude Code 2.1.292) | Single-Shot | medium | 30.1 | 0.0 | 74.9 | 30.0 | nicht bestanden | $0.07 | 1.2 Min. | 6 |
| — | Claude Fable 5.1 · xhigh (Teilweise: 1 von 2 Bildern) | Anthropic | Claude Code 2.1.291 | Agentisch | xhigh | 63.1 | 52.6 | 81.6 | 55.0 | nicht bestanden | $42.9 | 88 Min. | 1 |
| — | Gemini 3.1 Pro · max (Teilweise: 1 von 2 Bildern) | Google | Gemini CLI 0.62.0 | Agentisch | max | 46.7 | 58.0 | 35.0 | 36.3 | bestanden | $1.6 | 11 Min. | 1 |

---

## Was zeigt die Ausgabe 2026.10 des Vektorisierung-Benchmarks?

Im Vektorisierung-Benchmark von Samsa, Ausgabe 2026.10 (8. Oktober 2026), erreichte Claude Opus 5.5 mit Effort max den höchsten Samsa Vectorization Score: 82.1 von 100, bei mittleren Kosten von $43.5 für das flache Laptop-Bild und $60.2 für das texturierte E-Bike-Bild. Die Rangliste beruht auf 87 bewerteten Läufen von 23 Konfigurationen an zwei Illustrationen. Claude Opus 5.5 mit Effort max ist eine Referenz mit einem Lauf pro Bild.

- Von den KI-Modellen erreichen nur agentische Läufe visuelle Parität. Agentisch heisst: Das Modell arbeitet im Coding-Agenten seines Anbieters, rendert sein SVG, vergleicht es mit dem Original und korrigiert es über viele Runden. 29 von 32 agentischen Läufen bestanden das Paritäts-Gate mit seinen acht Kriterien. Keiner der 48 Single-Shot- und Fixed-Loop-Läufe schaffte es, egal mit welchem Modell.
- Tracer treffen die Pixel und verlieren die Objekte. vtracer und Recrafts Vectorize geben die Farben gut wieder, vtracer besteht auf dem flachen Laptop-Bild sogar das Paritäts-Gate. Bei der Struktur kommen beide auf höchstens 4 von 100: Beim E-Bike lieferte vtracer 9328 namenlose Formen, Recraft 1462, und jedes Objekt ist in die Stücke zerschnitten, die gerade sichtbar sind.
- Das günstigste starke Ergebnis kommt nicht von Claude. GPT 6.1 Sol mit Effort xhigh erreichte 73.9, bei mittleren Kosten von $6.8 und $9.1 pro Bild. Das sind 8.2 Punkte weniger als die beste Konfiguration für rund 15 % ihrer Kosten, und damit liegt Sol auf der Frontier-Linie im Diagramm oben.
- Quiver AI zeichnet Objekte, aber noch nicht das Bild. Arrow 2 Telos liefert wenige grosse, gruppierte Objekte. Sein Struktur-Score liegt deshalb zwischen den Tracern und den agentischen Läufen (58.1 beim E-Bike), die Treue bleibt auf beiden Bildern weit unter dem Paritäts-Gate.
- Mehr Effort kauft Treue, zu einem hohen Preis. Claude Opus 5.5 mit Effort max erreichte die höchste E-Bike-Treue aller Läufe (71.8), für $60.2. Das Effort-Diagramm weiter unten zeigt, ab wann ein zusätzlicher Dollar den Score kaum noch bewegt.

Claude Fable 5.1 mit Effort xhigh, eine Referenz, lief einmal auf dem Laptop-Bild und fiel dort durch das Paritäts-Gate, bei Kosten von $42.9; es steht als Teilnahme mit einem Bild in der Liste, sein E-Bike-Lauf kommt mit dem Update. Claude Haiku 5.5 ist in dieser Ausgabe als Single-Shot mit Effort medium dabei: sechs Läufe, zusammen $0.04, keiner auf Parität, Gesamtscore 31.6. Seine agentischen Varianten (xhigh und high) und der Hybrid, ein Entwurf von GPT 6.1 Sol mit Feinschliff durch Claude Opus 5.5 mit Effort high, laufen noch und kommen mit einem Update dazu. Gemini 3.1 Pro lief einmal, nur auf dem Laptop-Bild, und erreichte 46.7: Es steht als Teilnahme mit einem Bild in der Liste, ohne Gesamtrang.

> **Streuung von Lauf zu Lauf** Dieselbe agentische Konfiguration auf demselben Bild schwankte beim E-Bike um bis zu 4.0 Punkte zwischen zwei Läufen, die Kosten um bis zum 1.7-Fachen. Das reicht, um Nachbarn in der Rangliste zu vertauschen. Deshalb liefen die Konfigurationen, die für einen Produktentscheid zählen, bis zu dreimal, und die Rangliste zeigt für jede Zeile mit mehr als einem Lauf n und die Spanne.

---

## Warum fällt ein per Tracing erzeugtes SVG beim Struktur-Test durch?

Ein per Tracing erzeugtes SVG fällt durch, weil es das Bild als Farbflächen beschreibt, nicht als Dinge. Samsa hat diesen Benchmark gebaut, weil Kunden nach editierbaren Dateien fragen: Sie wollen den Fahrer verschieben, die Jacke umfärben oder das Velo aus der Szene nehmen. Im Trace existiert das hintere Bein nur als die Streifen, die zwischen Rahmen und Kurbel sichtbar sind, und der Himmel besteht aus einem Dutzend Fragmenten rund um die Wolken. Nichts hat einen Namen, also findet ein Designer nichts.

Ein nachgebautes SVG ist das, was eine Illustratorin abgeben würde: benannte Objekte in einer sinnvollen Ebenenreihenfolge, jedes vollständig gezeichnet, auch dort, wo andere Objekte es verdecken. Genau das belohnt der Struktur-Score, und deshalb zählt die Struktur 35 % neben 50 % für die Treue. Eine Datei, die richtig aussieht und sich nicht bearbeiten lässt, erfüllt den Zweck nicht, für den man eine Vektordatei bestellt.

---

## Was heissen die Resultate, wenn du ein editierbares SVG brauchst?

- Für ein Icon oder ein Logo, das nur skalieren muss, reicht ein Tracer. Er kostet wenig bis nichts und braucht Sekunden.
- Für eine Illustration, die du bearbeiten willst, plane einen agentischen Lauf ein: $5.3–$60.2 an Rechenkosten und 31–128 Minuten pro Bild auf diesem Niveau, nicht Rappen und Sekunden.
- Urteile nicht nach dem Vorschaubild. Ein per Tracing erzeugtes und ein nachgebautes SVG können in voller Grösse gleich aussehen. Öffne die Ebenen, bevor du eine Datei abnimmst.
- Ein Lauf ist eine Stichprobe. Wenn das Ergebnis zählt, lass zwei Läufe machen und nimm die bessere Datei, oder plane eine Überarbeitung von Hand für die heiklen Details: Gesichter, Hände, Mechanik.

Die Anleitung Schritt für Schritt, mit den Prüfungen, die eine fertige Datei bestehen muss, findest du im Ratgeber [Bild vektorisieren mit KI, ohne die Editierbarkeit zu verlieren](https://samsa.ai/de/ratgeber/bild-vektorisieren/).

> **Zitieren** Samsa, «Vektorisierung Benchmark», Ausgabe 2026.10, 8. Oktober 2026, samsa.ai/de/benchmarks/vektorisierung/. Prompts, Juroren-Prompts und die Rohwerte jedes Laufs sind mit dem Datensatz veröffentlicht.

---

## Wie läuft ein Benchmark-Lauf ab?

Alle Teilnehmer bekommen denselben eingefrorenen Prompt und dieselben Bilder, nach Protokoll 1.0.1. Ein Lauf ist eine frische Sitzung im Agenten des Anbieters, mit dem Prompt als einziger Eingabe und ohne Nachrichten dazwischen. Der Lauf iteriert, bis das Paritäts-Gate besteht und die Detailprüfung sauber ist, oder bis er die Grenze von drei Stunden oder 25 bewerteten Runden erreicht. Dann hinterlässt er seinen besten Stand.

- Ein Agent pro Anbieter, offengelegt. Claude-Modelle laufen in Claude Code 2.1.291 (Haiku 5.5 in 2.1.294, der ersten Version, die das Modell kennt), GPT 6.1 Sol in Codex CLI 0.160.0 auf dem Fast Tier, Gemini in Gemini CLI 0.62.0 mit API-Schlüssel. Gemessen wird Modell plus Agent, und die Rangliste nennt beides.
- Unterbrochene Läufe werden verworfen und wiederholt. Ein Lauf, der von aussen gestoppt wird (Nutzungslimit, beendeter Prozess, Netzwerkfehler), wird nicht bewertet, und seine Kosten erscheinen nirgends. Die Wiederholung bekommt die nächste Laufnummer.
- Sub-Agenten sind erlaubt, wo der Agent sie anbietet. Ihre Tokens zählen mit, und der Datensatz vermerkt, dass der Lauf delegiert hat.
- Eine Maschine, ein Toolkit. Alle agentischen Läufe laufen auf demselben Mac, und das Bewertungs-Toolkit ist per Hash fixiert und wird während einer Ausgabe nie geändert.

---

## Welche vier Tracks gibt es?

Der Track sagt, wie ein Teilnehmer sein SVG erzeugt hat. Das Diagramm zeichnet jeden Track mit eigener Markierung, die Rangliste zeigt ihn als Spalte.

**Die vier Tracks des Vektorisierung-Benchmarks**

| Track | Wie das SVG entsteht | Wer dabei ist |
| --- | --- | --- |
| Agentisch | Das Modell arbeitet im Agenten seines Anbieters, schreibt und startet Code, rendert und vergleicht sein SVG und iteriert innerhalb der Grenzen. | Claude Fable, Opus und Sonnet, GPT 6.1 Sol und Gemini 3.1 Pro; Claude Haiku und der Hybrid aus Sol und Opus kommen mit einem Update dazu |
| Single-Shot | Ein Aufruf mit Bild und Prompt, ohne Werkzeuge. Die Antwort ist das SVG. | Claude Opus, Sonnet, Fable und Haiku, GPT 6.1 Sol |
| Fixed Loop | Vier Runden, in denen das Modell sein Rendering und das Paritäts-Feedback sieht und das SVG neu schreibt, ohne Werkzeuge. Die beste Runde zählt. | Claude Opus 5.5 und Sonnet 5.5 |
| Tool | Die Ausgabe eines Vektorisierers, bewertet wie jedes andere SVG. | Recraft Vectorize, Quiver AI Arrow 2 und Arrow 2 Telos, vtracer |

---

## Welche Bilder gehören zur Suite?

Zwei Illustrationen, erstellt mit Samsa, eine pro Schwierigkeitsstufe. Zu jeder gehört ein Inventar: die Liste der Objekte, die eine vollständige Vektorisierung enthalten muss, von Samsa geschrieben und für die Ausgabe eingefroren.

- Laptop, Stufe 1 (flach): flache Farbflächen, keine Textur, überlappende organische Formen, ein Gesicht und Hände. 1376 × 768 Pixel, 32 Objekte im Inventar.
- E-Bike, Stufe 2 (texturiert): Filmkorn, Punktierung, Verläufe, 56 Speichen, ein Gesicht, tiefe Verdeckung hinter dem hinteren Bein und der Kurbel. 2400 × 1792 Pixel, 53 Objekte im Inventar.
- Eine Szene der Stufe 3 folgt in einer späteren Ausgabe.

---

## Wie wird ein Lauf bewertet?

Jeder Lauf bekommt drei Teilwerte von 0 bis 100, zusammengefasst zum Samsa Vectorization Score. Der Wert eines Teilnehmers pro Bild ist der Median über seine Läufe, der Gesamtrang der Mittelwert dieser Mediane. Wer nur auf einem Bild gemessen wurde, steht ohne Gesamtrang in der Liste. Kosten und Zeit sind Achsen neben dem Score, nie ein Teil davon.

**Die drei Teile des Samsa Vectorization Score und ihre Gewichte**

| Teil | Gewicht | Was er misst |
| --- | --- | --- |
| Treue | 50 % | Mittlere Farbabweichung, strukturelle Ähnlichkeit, das schlechteste lokale Fenster und beim E-Bike die Übereinstimmung des Korns, gegen das Original, beide Bilder auf Weiss gelegt. Das Paritäts-Gate mit acht Kriterien erscheint als Abzeichen und fliesst nicht in den Score ein. |
| Struktur | 35 % | 60 % automatisch: benannte Ebenen, Abdeckung des Inventars, Vollständigkeit verdeckter Geometrie und Sparsamkeit der Pfade, mit Abzügen für eingebettete Rasterbilder, Clip-Pfade, die Verdeckung vortäuschen, und eingebrannte Transformationen. 40 % Urteil: Objekt-Semantik, Vollständigkeit unter Verdeckung, Editierbarkeit, Ebenenreihenfolge und Qualität der Pfade. |
| Details | 15 % | Zwei feste Zoom-Ausschnitte pro Bild (Gesicht und Hände beim Laptop, Gesicht und Antrieb beim E-Bike), im Vergleich mit dem Ausschnitt des Originals auf Ähnlichkeit und Handwerk beurteilt. |

Die beurteilten Teile stammen von zwei Bildmodellen verschiedener Anbieter, Claude Opus 5.5 und GPT 6.1 Sol. Sie sehen anonymisierte, gemischte Ausgaben, und ihre Prompts sind mit den Resultaten veröffentlicht.

---

## Wie werden Kosten und Zeit gezählt?

- Die Kosten sind API-Äquivalent: die Tokens eines Laufs nach Klasse (Input, Output inklusive Reasoning, Cache-Schreiben, Cache-Lesen), multipliziert mit dem Listenpreis des Anbieters am Lauftag. Der Preisstand ist bei jedem Lauf gespeichert (6. Oktober 2026). Es ist das, was der Lauf über die API kosten würde, keine Rechnung.
- Codex-Läufe auf dem Fast Tier halten die Fast-Tier-Kosten und das Standard-Äquivalent fest. Haiku 5.5 wird pro Anfrage nach seinen zwei Preisstufen für die Prompt-Länge berechnet.
- Ein Tool zählt mit seinem veröffentlichten Preis pro Umwandlung, seine Zeit stammt aus einem gestoppten Wiederholungslauf.
- Die Zeit ist die Uhrzeit vom Start des Agenten bis zu seinem Schlussbericht.
- Zeilen mit mehr als einem Lauf zeigen den Median und die Spanne. Eine Zeile mit einem Lauf zeigt nur den Wert, denn ein Lauf hat keine Streuung.

---

## Was hat sich mit Protokoll 1.0.1 geändert?

Ausgaben, deren Zeichenfläche vom Original abweicht, werden jetzt nach ihrem Inhalt ausgerichtet, nicht nach ihrem Rahmen. Der Scorer rendert das SVG, nimmt den Begrenzungsrahmen dessen, was es gezeichnet hat, legt ihn mit einem einheitlichen Massstab auf den Inhaltsrahmen des Originals und füllt transparent auf. Weichen die Proportionen der beiden Rahmen um mehr als 10 % ab, wird die ganze Zeichenfläche eingepasst. Die Regel gilt für alle Teilnehmer. Sie kam dazu, weil die Exporte von Quiver AI einen Rand von etwa 2,4 % haben, der sie unter der alten Regel fast die ganze Treue kostete: ein Rahmenfehler, kein Fehler der Vektorisierung.

---

## Wo liegen die Grenzen?

- Zwei Bilder. Die Rangliste sagt, wie die Teilnehmer mit einer flachen und einer texturierten Illustration umgehen, nicht mit Fotos, Logos oder technischen Zeichnungen.
- Modell plus Agent. Jedes Modell läuft im Agenten seines Anbieters, also wird der Agent mitgemessen. Ein Track unabhängig vom Agenten kann folgen.
- Einzelläufe, wo markiert. Claude Fable 5.1 mit xhigh und Claude Opus 5.5 mit max sind Referenzen mit einem Lauf pro Bild, wegen ihrer Kosten pro Lauf, und die tieferen Effort-Stufen liefen ebenfalls einmal. Gemini 3.1 Pro lief einmal auf dem Laptop-Bild, mit einer API-Grenze von $20. Claude Opus 5.5 mit Effort high hat bisher zwei Läufe pro Bild, Claude Sonnet 5.5 mit xhigh zwei auf dem E-Bike; ihre dritten Läufe laufen und kommen mit einem Update dazu. Claude Fable 5.1 mit Effort xhigh hat noch keinen E-Bike-Lauf: Er wurde von einem Nutzungslimit unterbrochen, nach dem Protokoll verworfen und wird für das Update wiederholt.
- Die Vollständigkeitsprüfung allein belohnt wenige grosse Objekte, und so zeichnet Arrow 2 Telos. Der Struktur-Score als Ganzes ordnet nachgebaute Dateien trotzdem vor Telos und Telos vor Traces ein, aber lies diesen Teilwert mit diesem Wissen.
- Die Juroren sind Modelle. Sie sehen anonymisierte Ausgaben, ihre Prompts sind veröffentlicht, aber sie sind keine Designer. Samsa prüft die Detail-Ausschnitte vor der Veröffentlichung von Hand.
- Samsa baut auf Modellen von Anthropic, und einer der beiden Juroren ist ein Modell von OpenAI. Der Treue-Score und die automatische Hälfte des Struktur-Scores brauchen keinen Juror, und jeder Rohwert ist veröffentlicht, damit sich das Ergebnis prüfen lässt.

---

## Wie kann ich ein Modell oder ein Tool einreichen?

Lass den eingefrorenen Prompt nach Protokoll auf beiden Bildern laufen oder schick für ein Tool die SVG-Ausgaben beider Bilder mit Preis und einem gestoppten Lauf. Samsa bewertet sie mit demselben Toolkit und nimmt sie in die nächste Aktualisierung auf. [Schreib uns](https://samsa.ai/de/kontakt/), um eines einzureichen.

---

## Häufige Fragen: Vektorisierung Benchmark

### Was misst der Vektorisierung-Benchmark?

Eine Aufgabe: aus einer Raster-Illustration ein SVG machen, das ein Designer bearbeiten kann. Jeder Lauf wird nach der Treue zum Original bewertet (50 %), nach der Struktur, also benannten, vollständigen und sparsamen Ebenen (35 %), und nach den Details wie Gesichtern und Händen (15 %). Die gewichtete Summe ist der Samsa Vectorization Score. Kosten und Zeit pro Bild stehen daneben und ändern ihn nie.

### Welche KI vektorisiert eine Illustration am besten?

In der Ausgabe 2026.10 lag Claude Opus 5.5 mit Effort max mit 82.1 vorne, gefolgt von Claude Sonnet 5.5 mit Effort xhigh (79.5). GPT 6.1 Sol mit Effort xhigh erreichte 73.9 zu einem Bruchteil der Kosten. Alle Spitzenkonfigurationen liefen als Agent, der sein eigenes SVG rendert und korrigiert. Kein einzelner Prompt an irgendein Modell kam in die Nähe.

### Kann ein einziger Prompt an ein KI-Modell ein Bild in ein editierbares SVG verwandeln?

In diesem Benchmark nicht mit Parität. Single-Shot-Aufrufe an Claude- und GPT-Modelle lieferten in wenigen Minuten saubere, gut benannte SVGs, für Rappen bis etwa einen Dollar. Keiner der 48 Single-Shot- und Fixed-Loop-Läufe bestand aber das Paritäts-Gate: Die Zeichnungen sind stilisierte Fassungen des Bildes, keine Kopien. Auch vier Runden mit Blick auf das eigene Rendering schlossen die Lücke nicht. Parität brauchte einen Agenten, der misst und korrigiert.

### Warum schneiden Tracing-Tools schlecht ab, obwohl ihr SVG richtig aussieht?

Weil richtig aussehen nur die halbe Arbeit ist. Ein Tracer zerlegt das Bild nach Farben in flache Formen: Beim E-Bike erzeugte vtracer 9328 namenlose Formen. Die Treue ist hoch, aber keine Form ist ein Objekt, und alle verdeckten Teile fehlen. Der Struktur-Score, 35 % der Gesamtwertung, misst genau das, was ein Designer zum Bearbeiten braucht, und dort verlieren Tracer fast alles.

### Wie werden Kosten und Zeit im Benchmark gezählt?

Die Kosten sind die Tokens eines Laufs mal der Listenpreis des Anbieters am Lauftag, getrennt nach Token-Klasse, mit dem Preisstand beim Lauf gespeichert. Es ist ein API-Äquivalent, keine Rechnung. Ein Tool zählt mit seinem veröffentlichten Preis pro Umwandlung. Die Zeit läuft vom Start bis zum Schlussbericht. Beides sind Mediane über die Läufe eines Teilnehmers, mit Spanne, wenn es mehr als einen Lauf gibt.

### Ist der Vektorisierung-Benchmark unabhängig?

Kein Benchmark einer Firma ist ganz unabhängig, und Samsa baut auf Modellen von Anthropic. Überprüfbar macht ihn: ein eingefrorener Prompt für alle, automatische Bewertung der Treue, zwei Juroren verschiedener Anbieter auf anonymisierten Ausgaben, veröffentlichte Juroren-Prompts und jeder Rohwert mit seinem Lauf. Wer will, kann das Protokoll nachfahren und vergleichen.

### Kann ich ein Modell oder ein Tool einreichen?

Ja. Lass den eingefrorenen Prompt nach Protokoll auf beiden Bildern laufen oder schick die SVG-Ausgaben eines Tools für beide Bilder mit Preis und einem gestoppten Lauf. Samsa bewertet die Einreichung mit demselben Toolkit und nimmt sie in die nächste Aktualisierung auf. Nutze die [Kontaktseite](https://samsa.ai/de/kontakt/), um dich zu melden.

### Wie oft wird der Benchmark aktualisiert?

Wenn ein relevantes Modell oder Tool erscheint. Zeilen kommen dazu, sie werden nie geändert: Ein später neu gemessener Teilnehmer bekommt eine neue Ausgabe, Preisstände bleiben bei ihren Läufen, und das Änderungsprotokoll auf dieser Seite hält jede Änderung mit Datum fest. Claude Haiku 5.5 erschien, während die Läufe der Ausgabe 2026.10 liefen, und kam so dazu.

---

**Markenkonforme Bilder erstellen und als SVG exportieren** Der Bildgenerator von Samsa lernt deine Marke. Lade deine Bilder als SVG mit Ebenen herunter und gib sie deinen Designern weiter. [Zum Bildgenerator](https://samsa.ai/de/bild/)
