Blindbewertung · 250 Wörter · Why local
Welches Setup schreibt am besten?
Codex, Pi und Claude haben denselben Auftrag sowie denselben Tom-Writing-Voice-Skill erhalten. Das Leaderboard trennt Textqualität bewusst von Laufzeit und Kosten, macht jede Bewertung nachvollziehbar und zeigt den unveränderten Markdown-Text hinter jeder Kombination.
Why local: Die Lernschleife gehört nicht ins Mietfach
Warum diese Version vor Platz 2 liegt
Die Bilder vom Mietfach und der Datenschutzfolklore geben der These mehr Eigenheit als der sachliche Einstieg der nächsten Fassung; zugleich verbinden konkrete Harness-Fehler, Mandatsakten und Patientendaten Lernschleife und Pipeline enger.
Wo selbst die beste Version schwächer ist
Deutlichste Restschwäche: Die DRACO-Nähe bleibt ohne Messwerte und Protokollvorbehalt weich, und die reparierte Eval-Regel ist weniger konkret als die übrigen Harness-Beispiele.
Alle Versionen
Rangliste durchsuchen
Jede Zeile erklärt den Abstand zur nächsten Version.
Die Tabelle lässt sich horizontal verschieben.
| Rang | Score | Konfiguration | Wörter | Teilwertungen | Warum vor der nächsten Version | Wo schwächer | Text |
|---|
Für die interaktive Rangliste ist JavaScript erforderlich.
Laufstatus
Fehlgeschlagene Kombinationen
Fehler erhalten keinen Qualitätsscore und keinen regulären Rang.
Noch keine Laufdaten eingesetzt.
Transparenz
Methodik und Grenzen
Der Score misst diesen Text unter diesem Auftrag, nicht ein Modell im Allgemeinen.
So wird bewertet
- Alle Kombinationen erhalten denselben Schreibauftrag und denselben Tom-Writing-Voice-Skill.
- Die Blindbewertung gewichtet formale Compliance mit 15, Inhalt und Faktentreue mit 25, Tom-Voice mit 35, Aufbau und Kompression mit 15 sowie Sprache mit 10 Punkten.
- Byte-identische Texte erhalten denselben Score; Nachbarschaftsvergleiche erklären jeden Rangabstand anhand konkreter Textmerkmale.
- Laufzeit und Kosten werden als Metadaten geführt, verändern den Qualitätsscore aber nicht.
Was daraus nicht folgt
- Eine einzelne Ausgabe pro Kombination misst keine Streuung und ist kein allgemeiner Modellbenchmark.
- Harness, Skill-Auflösung und Werkzeugzugriff können das Ergebnis zusätzlich zum Modell beeinflussen.
- Gleich benannte Thinking-Stufen müssen zwischen Providern nicht dieselbe Rechenarbeit bedeuten; einzelne Labels können technisch auf dieselbe Backend-Konfiguration abgebildet werden.
- Kosten und Laufzeiten erscheinen nur, wenn der jeweilige CLI-Lauf sie strukturiert zurückgegeben hat; fehlende Werte sind deshalb kein Nullwert und nicht vergleichbar.
- Fehlgeschlagene oder leere Ausgaben bleiben sichtbar, werden aber nicht künstlich in die Rangliste eingeordnet.