Cereio
Base du benchmark v0.1

Benchmark

Chaque catégorie utilise des prompts versionnés et un contrat de publication fixe. La source peut varier ; chaque artefact exécutable devient un bundle statique isolé.

5 Catégories du benchmark0 Exécutions publiées
Catalogue · Catégories du benchmark
Exécutions publiéesDéveloppement uniquement

Exécutions publiées

0

Aucun résultat de benchmark n'a encore été publié.

C'est volontaire. Le premier résultat public doit inclure un véritable identifiant de modèle, une version immuable du prompt, l'artefact source et les preuves.

Méthode

Qu'est-ce qui rend une exécution publiable ?

  1. 01Le prompt et les instructions système sont versionnés et hachés.
  2. 02L'identifiant exact du modèle et l'heure d'exécution sont enregistrés.
  3. 03Le code source non modifié et chaque tentative échouée sont conservés.
  4. 04Le build produit un bundle statique avec un point d'entrée HTML.
  5. 05Le bundle passe les contrôles d'isolation, d'exécution et de preuve.