Direkt zur Rangliste
Tom Jansen

Blindbewertung · 250 Wörter · Why local

Welches Setup schreibt am besten?

Codex, Pi und Claude haben denselben Auftrag sowie denselben Tom-Writing-Voice-Skill erhalten. Das Leaderboard trennt Textqualität bewusst von Laufzeit und Kosten, macht jede Bewertung nachvollziehbar und zeigt den unveränderten Markdown-Text hinter jeder Kombination.

Platz 1

Why local: Die Lernschleife gehört nicht ins Mietfach

Codex · gpt-5.5 · Effort low

96,5 von 100

Warum diese Version vor Platz 2 liegt

Die Bilder vom Mietfach und der Datenschutzfolklore geben der These mehr Eigenheit als der sachliche Einstieg der nächsten Fassung; zugleich verbinden konkrete Harness-Fehler, Mandatsakten und Patientendaten Lernschleife und Pipeline enger.

Wo selbst die beste Version schwächer ist

Deutlichste Restschwäche: Die DRACO-Nähe bleibt ohne Messwerte und Protokollvorbehalt weich, und die reparierte Eval-Regel ist weniger konkret als die übrigen Harness-Beispiele.

Geplante Kombinationen 111 Harness × Modell × Effort
Bewertete Texte 110 Unveränderte Markdown-Ausgaben
Fehlgeschlagene Läufe 1 Ohne regulären Rang
Mittlerer Score 69,5 Qualität, nicht Kosten oder Tempo

Alle Versionen

Rangliste durchsuchen

Jede Zeile erklärt den Abstand zur nächsten Version.

Die Tabelle lässt sich horizontal verschieben.

Blind bewertete Artikelversionen nach Harness, Modell und Thinking Effort
Rang Score Konfiguration Wörter Teilwertungen Warum vor der nächsten Version Wo schwächer Text

Für die interaktive Rangliste ist JavaScript erforderlich.

Laufstatus

Fehlgeschlagene Kombinationen

Fehler erhalten keinen Qualitätsscore und keinen regulären Rang.

Noch keine Laufdaten eingesetzt.

Transparenz

Methodik und Grenzen

Der Score misst diesen Text unter diesem Auftrag, nicht ein Modell im Allgemeinen.

So wird bewertet

  • Alle Kombinationen erhalten denselben Schreibauftrag und denselben Tom-Writing-Voice-Skill.
  • Die Blindbewertung gewichtet formale Compliance mit 15, Inhalt und Faktentreue mit 25, Tom-Voice mit 35, Aufbau und Kompression mit 15 sowie Sprache mit 10 Punkten.
  • Byte-identische Texte erhalten denselben Score; Nachbarschaftsvergleiche erklären jeden Rangabstand anhand konkreter Textmerkmale.
  • Laufzeit und Kosten werden als Metadaten geführt, verändern den Qualitätsscore aber nicht.

Was daraus nicht folgt

  • Eine einzelne Ausgabe pro Kombination misst keine Streuung und ist kein allgemeiner Modellbenchmark.
  • Harness, Skill-Auflösung und Werkzeugzugriff können das Ergebnis zusätzlich zum Modell beeinflussen.
  • Gleich benannte Thinking-Stufen müssen zwischen Providern nicht dieselbe Rechenarbeit bedeuten; einzelne Labels können technisch auf dieselbe Backend-Konfiguration abgebildet werden.
  • Kosten und Laufzeiten erscheinen nur, wenn der jeweilige CLI-Lauf sie strukturiert zurückgegeben hat; fehlende Werte sind deshalb kein Nullwert und nicht vergleichbar.
  • Fehlgeschlagene oder leere Ausgaben bleiben sichtbar, werden aber nicht künstlich in die Rangliste eingeordnet.

Unveränderte Ausgabe

Markdown-Text