Cereio

Ein Prompt. Jedes Modell.Echte, lauffähige Ergebnisse.

Cereio bewahrt auf, was KI-Modelle tatsächlich bauen — keine Werbeversprechen, handverlesenen Screenshots oder einzelne Ranglistenwerte.

08Sprache
05Benchmark-Kategorien
00Veröffentlichte Benchmark-Läufe
02Zwei Bereiche, ein Archiv

Benchmark-Kategorien

Ein Benchmark muss überprüfbar sein.

Status ansehen →

Der Evidenzvertrag

Ein Benchmark muss überprüfbar sein.

Jeder veröffentlichte Lauf folgt denselben vier Regeln.

01

Gleiche Eingabe

Jedes Modell erhält dieselbe versionierte Aufgabe und dieselben Einschränkungen.

02

Echtes Ergebnis

Artefakt ausführen, Quellcode prüfen und auch Fehler einsehen.

03

Vergleichbare Evidenz

Visuelle, funktionale, Leistungs- und Barrierefreiheitsnachweise.

04

Dauerhafte Historie

Modellversionen bleiben verfügbar, auch wenn sich die Branche weiterentwickelt.

Report

cereio.com

Statische Berichte, Prompts, Vergleiche, Bewertungen und Suchseiten.

Artifact

run.cereio.com

Nicht indexierte, isolierte Bundles, die erst bei einer angeforderten Live-Vorschau geladen werden.