GPT-4o Competent

Aletheion methodology evaluation · system_id: gpt-4o · audit date: 2026-03-23

70.9
Vendor: OpenAI
Tier: Competent · rank 38
Tasks: 24 total · 14 passed · 10 failed
Methodology version: 1.0.0
Composite score: 0.709 CONDITIONAL

Cognitive-dimension radar

PerceptionGenerationAttentionLearningMemoryReasoningMetacognitionExecutive functionsProblem solvingSocial cognitionNoveltyOrchestration

Dimension scores

Perception99.3Generation71.7Attention98.8Learning9.0Memory99.0Reasoning87.3Metacognition74.7Executive functions74.0Problem solving58.7Social cognition90.0Novelty71.3Orchestration43.3

Per-dimension breakdown (task-level)

DimensionScoreTasksPer-task scoresResult
perception0.993 2 (2p / 0f)1.00, 0.99PASS
generation0.717 2 (1p / 1f)0.45, 0.85CONDITIONAL
attention0.988 2 (2p / 0f)1.00, 0.98PASS
learning0.090 2 (0p / 2f)0.00, 0.15FAIL
memory0.990 1 (1p / 0f)0.99PASS
reasoning0.873 3 (3p / 0f)0.99, 0.90, 0.82PASS
metacognition0.747 2 (1p / 1f)0.94, 0.65CONDITIONAL
executive_functions0.740 1 (1p / 0f)0.74CONDITIONAL
problem_solving0.587 3 (1p / 2f)0.98, 0.50, 0.50CONDITIONAL
social_cognition0.900 1 (1p / 0f)0.90PASS
novelty0.713 3 (1p / 2f)0.65, 0.60, 0.82CONDITIONAL
orchestration0.433 2 (0p / 2f)0.50, 0.40FAIL

Strongest dimensions

Weakest dimensions

Evidence provenance
Profile: corpus_taas_profiles[system_id=gpt-4o] · Audit definition: corpus_agi_audits[system_id=gpt-4o] · System profile: agi_evaluation_profiles[system=gpt-4o] · Persona runs: agi_complex_evaluations[system.system_id=gpt-4o] · Methodology config: agi_audits.config
Per-dimension evidence: /evidence/alitheion-eval-gpt-4o

Live API endpoint: /api/v4/site-data/evaluation/gpt-4o
Methodology document: /api/v4/site-data/methodology