// side-by-side-vergleich

Side-by-Side-Vergleich mit AI Playground.

Identische Prompts gleichzeitig gegen bis zu 3 Konkurrenten ausführen und Antwortgeschwindigkeit, Ausgabestruktur und Kosten abwägen.

Bildschirm „Modellvergleich“

Das Aushängeschild von AI Playground ist die Vergleichs-Oberfläche. Statt mehrere Browser-Tabs zu öffnen und Prompts nacheinander zu testen, prüfen Sie Modelle in einer einzigen Ansicht nebeneinander. Unverzichtbar für Kostenoptimierung, Qualitätsvergleiche und Geschwindigkeitstests.

Wann Sie den Vergleichsmodus nutzen

Der Vergleichsmodus eignet sich ideal, um diese Fragen zu beantworten:

  • Kosten vs. Qualität: Ist GPT-4o für meine konkrete Aufgabe das 10-fache des Preises von Gemini 2.0 Flash wert?
  • Geschwindigkeit: Welches Modell antwortet am schnellsten für Echtzeitanwendungen?
  • Ausgabeformat: Formatiert Claude JSON besser als GPT? Folgt Gemini System-Prompts strenger?
  • Modellauswahl: Welches Open-Source-Modell via Ollama kommt einem bezahlten Cloud-Modell am nächsten?

Einen Vergleich einrichten

So führen Sie Ihren ersten Vergleich durch:

  1. Klicken Sie in der linken Seitenleiste auf das Symbol Vergleichen (das Zweispalten-Symbol).
  2. Wählen Sie oben rechts zwischen Text- und Bild-Modus.
  3. Klicken Sie auf + Modellspalte hinzufügen. Sie können bis zu 3 Spalten hinzufügen.
  4. Konfigurieren Sie in jeder Spalte: den Anbieter (z. B. OpenAI, Anthropic, Google), das Modell (z. B. gpt-4o, claude-3.5-sonnet) und die individuellen Parameter (Temperature, Max Tokens usw.) pro Spalte.
  5. Tippen Sie Ihren Prompt in das gemeinsame Eingabefeld unten.
  6. Klicken Sie auf Ausführen, um den Prompt an alle Spalten gleichzeitig zu senden.

Tipp: Stellen Sie jede Spalte auf dieselben Werte für Temperature und Max Tokens, um fair zu vergleichen. Variieren Sie Parameter bewusst nur, um gezielt Konfigurationen zu testen.

Ergebnisse lesen

Nachdem alle Spalten fertig generiert haben, erscheinen unter jeder Antwort drei Kennzahlen:

Antwortlatenz (ms)

  • Zeit bis zum ersten Token. Niedriger = besser für Echtzeit-Chat. Zeigt, welche Anbieter/Modell-Kombination übers Netz am schnellsten reagiert.

Kostenanalyse

  • Exakte Kosten jeder Antwort laut Live-Preiskatalog. Zeigt die Sätze pro 1.000 Tokens und die Gesamtkosten für die konkreten Eingabe-/Ausgabetokens.

Qualitätsbewertung

  • Visuelle Indikatoren für die Ausgabestruktur — Formattreue, Antwortlänge und ob das Modell den Anweisungen treu geblieben ist.

Vergleichskonfigurationen speichern

Eine Gewinnerkombination gefunden? Speichern Sie Ihr Vergleichs-Setup zur Wiederverwendung:

  1. Konfigurieren Sie Ihre Spalten mit den gewünschten Anbietern, Modellen und Parametern.
  2. Klicken Sie oben in der Vergleichsansicht auf Config speichern.
  3. Vergeben Sie einen Namen (z. B. „GPT-4o vs Claude vs Gemini — Code-Generierung“).
  4. Gespeicherte Configs erscheinen im Dropdown Gespeicherte Vergleiche für Ein-Klick-Reload.

Multi-Runden-Vergleich

Innerhalb derselben Vergleichssitzung können Sie mehrere Prompts ausführen. Die Ergebnisse jeder Runde bleiben im Spaltenverlauf erhalten, sodass Sie vergleichen können, wie verschiedene Modelle auf eine Serie verwandter Prompts reagieren. Nützlich für Konversationstests, mehrzügiges Instruktionsfolien oder iteratives Prompt-Feintuning.

Up next

Prompt-Builder-Tools →

Effektive Prompts mit den Text- und Bild-Prompt-Buildern erstellen.