prompt_spec
prompt_id, release, track, text, genre, constraints, rubric_version, provenance, license, contamination_status
Audit layer
CreativeBench is designed as event-sourced records: prompts, model responses, judge runs, pairwise comparisons, revision deltas, evaluator reputation, and release metadata remain auditable and reproducible.
prompt_specprompt_id, release, track, text, genre, constraints, rubric_version, provenance, license, contamination_status
candidate_responseresponse_id, prompt_id, model_id, decoding, text_hash, token_count
judge_runjudge_run_id, judge_id, judge_model, rubric_version, dimension scores, confidence, critique_hash
pairwise_comparisoncomparison_id, response_a, response_b, winner, margin, position_swapped, judge_id
revision_deltadraft_hash, critique_hash, revised_hash, revision_lift, regression_risk, preserved_voice
evaluator_profiletrust_score, specialist_badges, calibration agreement, conflicts, reciprocity tier
Aggregation
Model-output hashes, critique hashes, scoring-script commits, release names, track labels, prompt contamination state, and judge versions stay attached to the public score receipt.