Cereio
Benchmark-Grundlage v0.1

Benchmark

Jede Kategorie nutzt versionierte Prompts und einen festen Veröffentlichungsvertrag. Der Quellcode kann variieren; jedes lauffähige Artefakt endet als isoliertes statisches Bundle.

5 Benchmark-Kategorien0 Veröffentlichte Läufe
Katalog · Benchmark-Kategorien
Veröffentlichte LäufeNur für Entwicklung

Veröffentlichte Läufe

0

Noch wurde kein Benchmark-Ergebnis veröffentlicht.

Das ist beabsichtigt. Das erste öffentliche Ergebnis muss eine echte Modellkennung, eine unveränderliche Prompt-Version, das Quellartefakt und Evidenz enthalten.

Methode

Wann darf ein Lauf veröffentlicht werden?

  1. 01Prompt und Systemanweisungen werden versioniert und gehasht.
  2. 02Die genaue Modellkennung des Anbieters und die Laufzeit werden erfasst.
  3. 03Unveränderter Quellcode und jeder fehlgeschlagene Versuch bleiben erhalten.
  4. 04Der Build erzeugt ein statisches Bundle mit einem HTML-Einstiegspunkt.
  5. 05Das Bundle besteht die Prüfungen für Isolation, Laufzeit und Evidenz.