{"methodology_version":"1.0.0","principle":"Rate methodology, not conclusions. Detect bias, contextualize, never suppress. We are the audience, not the expert.","score_thresholds":{"PASS":">= 0.75","CONDITIONAL":"0.50 <= score < 0.75","FAIL":"< 0.50"},"single_model_dimensions":["perception","generation","attention","learning","memory","reasoning","metacognition","executive_functions","problem_solving","social_cognition","novelty","orchestration"],"tasks_per_dimension_target":10,"judge_model_target":"claude-opus-4-6","judge_model_actual_used":"claude-sonnet-4-6 (per agi_complex_evaluations records)","budget_cap_usd":50.0,"includes":{"helm_benchmarks":true,"orchestration":true,"production":true,"novelty":true},"complex_ai_system_evaluation":{"description":"For complex agentic systems (Codex CLI, Claude Code, Cursor, etc.) we use 10 task-specific dimensions plus persona-based runs.","personas_used":["first_timer","small_business_owner","enterprise_dev","academic_researcher"],"scoring_axes":["completion","correctness","code_quality","user_experience","accessibility","productivity_gain","errors_encountered","recovery_success"],"interaction_log_evidence":"Every persona run records turn-by-turn user_prompt + predicted_response + confusion_level — full transcripts at /api/v4/site-data/evaluation/{system_id}"},"data_provenance":{"completed_audits":77,"persona_runs":150,"audit_definitions":106,"primary_collection":"corpus_taas_profiles","evidence_collections":["corpus_taas_profiles (composite_score + dimension_scores + SVG badges)","corpus_agi_audits (audit definitions + practical_tasks)","agi_evaluation_profiles (system criteria_map + intended_strengths + boundary_tests)","agi_complex_evaluations (persona-based runs with full interaction_log + judge narrative)","agi_audits.config (canonical methodology config)"]},"reproducibility":{"judge_model_disclosed":true,"task_set_disclosed":true,"thresholds_disclosed":true,"budget_cap_disclosed":true,"raw_scores_disclosed":true,"interaction_logs_disclosed":true,"limitations":["Judge model bias — single judge per audit may carry implicit preferences. Cross-judge runs are a v2.0 upgrade.","Task selection bias — task pool is curated, not exhaustively sampled. Task list is published.","Persona realism — personas are simulated, not real users. Real-user studies are a separate validation layer.","Date sensitivity — model scores reflect a snapshot in time; capabilities change."]}}