Benchmark-Grundlage v0.1
Benchmark
Jede Kategorie nutzt versionierte Prompts und einen festen Veröffentlichungsvertrag. Der Quellcode kann variieren; jedes lauffähige Artefakt endet als isoliertes statisches Bundle.
5 Benchmark-Kategorien0 Veröffentlichte Läufe
Katalog · Benchmark-Kategorien
Veröffentlichte LäufeNur für Entwicklung
Veröffentlichte Läufe
0Noch wurde kein Benchmark-Ergebnis veröffentlicht.
Das ist beabsichtigt. Das erste öffentliche Ergebnis muss eine echte Modellkennung, eine unveränderliche Prompt-Version, das Quellartefakt und Evidenz enthalten.
Nur für Entwicklung
Architektur-Testobjekt
Methode
Wann darf ein Lauf veröffentlicht werden?
- 01Prompt und Systemanweisungen werden versioniert und gehasht.
- 02Die genaue Modellkennung des Anbieters und die Laufzeit werden erfasst.
- 03Unveränderter Quellcode und jeder fehlgeschlagene Versuch bleiben erhalten.
- 04Der Build erzeugt ein statisches Bundle mit einem HTML-Einstiegspunkt.
- 05Das Bundle besteht die Prüfungen für Isolation, Laufzeit und Evidenz.