MindGym 是什么?
MindGym 把经典心理学与行为经济学实验改造成 Agent 可以逐 trial 参与的环境。我们分别测量任务表现、规范理性和人类相似度,不把“答对” 和“像人”混成同一个分数。
当前网站同时展示三层信息:任务环境、Agent 的记忆与决策架构,以及使用 真实人类行为训练的 MLP / GRU-RNN 参考模型。
怎么运作
- 环境在每个 trial 给 Agent 当前可见信息与合法动作。
- Agent 架构构造决策上下文,由选定的 LLM backbone 或规则控制器作答。
- 环境返回下一观察;架构按自己的 state-updating 规则更新记忆。
- 同一条轨迹同时计算任务表现、规范理性和人类选择概率。
工程实现清单(不计入正式比较任务):另有 53 个辅助环境; 代码共注册 114 个环境实现。
Agent 架构18 CONDITIONS
在同一任务、同一 backbone 和同一信息边界下,比较 Agent 如何构造 context、 做决策并更新内部 state。
主比较架构
| 架构 | 类型 | 每次决策调用 | 记忆 / 状态 | 工作原理 | 状态 |
|---|---|---|---|---|---|
| Direct | LLM baseline | 1 | 当前观察 | 最小控制组:同一 backbone 直接读取当前任务状态并作答。 Observe → Prompt → Decide → Act | v1 paid pilot · diagnostic |
| CoALA-lite | CoALA-inspired | 1 | working + episodic + semantic | 把工作记忆、有限情景记忆、动作—结果统计和程序性决策循环组合成可审计的 bounded controller。 Perceive → Working memory → Retrieve episodes → Update semantics → Act | v2 public-feedback gate pending |
| RAFA-inspired | belief / planning | 1 | bounded trajectory + belief | 维护有限轨迹,显式更新 belief,并在相同的一次模型调用内做短视界 future-value 判断。 Observe → Update belief → Sketch futures → Value actions → Act | v2 public-feedback gate pending |
| ACT-R-inspired | symbolic cognitive | 0 | chunks + activation + utility | 本地机制级认知对照:base-level activation、production utility、噪声冲突消解与结果驱动的 utility learning;只在数值反馈已审计为参与者可见的任务上运行。 Encode chunks → Retrieve → Match productions → Resolve conflict → Learn utility | requires audited numeric feedback |
| Random | negative control | 0 | 无 | 按任务 seed 复现的均匀随机动作,是最低信息量负对照。 Seed → Sample valid action → Act | v1 diagnostic control |
查看全部 18 个已实现或已有 adapter 的 Agent 条件
| Agent | 比较层 | 调用量 | 记忆 / 控制 | 当前状态 |
|---|---|---|---|---|
| Direct / Stateless 统一 Runner 中的最小 LLM 基线;等价于既有 MiniPsych stateless 臂。 | 一次调用 · 主矩阵 | 1 / decision | 仅当前 observation | v1 付费 pilot · 诊断数据 |
| Cumulative Transcript 只在短任务面板运行;超过字符上限直接 fail-closed,不偷偷截成窗口。 | 一次调用 · 记忆消融 | 1 / decision | 完整局内 transcript · 12k hard cap | Expanded v2 · 新反馈门待重跑 |
| Window Memory 固定窗口历史;控制上下文长度并保留局部时序。 | 一次调用 · 记忆消融 | 1 / decision | 最近 K 个 turns | Expanded v2 · 新反馈门待重跑 |
| Lexical Retrieval 用确定性的词项相似度检索局内经历,不增加 embedding 或模型调用。 | 一次调用 · 记忆消融 | 1 / decision | top-k 相似情景记忆 | Expanded v2 · 新反馈门待重跑 |
| ACT-R Retrieval 用 ACT-R 式近因、频率和语义扩散激活替换纯词项检索。 | 一次调用 · 记忆消融 | 1 / decision | 激活加权情景记忆 | Expanded v2 · 新反馈门待重跑 |
| Outcome Summary 按动作归组参与者可见的 next observation,不使用 Gym raw reward。 | 一次调用 · 记忆消融 | 1 / decision | 公开 action—outcome 文本 + 近因 | Expanded v2 · 新反馈门待重跑 |
| Outcome Stats 去掉结果值与逐次轨迹,只保留近期动作频率统计。 | 一次调用 · 组件消融 | 1 / decision | 仅公开 choice counts | Expanded v2 · 新反馈门待重跑 |
| Outcome Trace 去掉统计聚合,只保留 action 与可见 next observation 的时序。 | 一次调用 · 组件消融 | 1 / decision | 动作—公开结果时序 | Expanded v2 · 新反馈门待重跑 |
| Memory Placebo 保留动作计数与公开结果文本,确定性打乱配对以构造信息负对照。 | 一次调用 · 负对照 | 1 / decision | 轮转公开 outcome mapping | Expanded v2 · 新反馈门待重跑 |
| CoALA-lite 可审计的 bounded CoALA-inspired controller。 | 一次调用 · 主矩阵 | 1 / decision | working + episodic + semantic | Expanded v2 · 新反馈门待重跑 |
| RAFA-inspired 一次调用内完成 belief update、短视界价值比较与动作选择。 | 一次调用 · 主矩阵 | 1 / decision | 轨迹 + belief + future value | Expanded v2 · 新反馈门待重跑 |
| Reflection 每个 block 额外生成策略摘要;不能与一次调用臂伪装成同预算。 | 额外计算 · 单列比较 | 1 + periodic | 滚动策略反思 | Expanded v2 · 新反馈门待重跑 |
| Propose + Verify 第二次调用审查并可纠正候选动作。 | 额外计算 · 单列比较 | 2 / decision | 候选动作 + 审核 | Expanded v2 · 新反馈门待重跑 |
| Self-consistency 同一 prompt 多次采样,按有效动作多数票决策。 | 额外计算 · 单列比较 | N / decision | 多样本多数投票 | Expanded v2 · 新反馈门待重跑 |
| ACT-R-inspired Python 机制级控制,不冒充原生 ACT-R production system。 | 模型无关 · 主矩阵 | 0 | chunks + activation + utility | 需逐任务公开数值反馈契约 |
| Random 按任务 seed 可复现的均匀随机动作。 | 模型无关 · 负对照 | 0 | 无 | v1 诊断控制 · v2 待重跑 |
| Native ACT-R 需要外部 dispatcher 与逐任务 production model,不能用 inspired 结果代替。 | 原生 runtime | 0 | ACT-R 7.6+ productions | adapter 已实现 · 缺任务 bridge |
| Native Soar 需要 soar-sml;复杂任务还需要 task-specific productions。 | 原生 runtime | 0 | SML operators + Soar-RL | adapter 已实现 · 缺本机 runtime |
61 个正式比较任务与人类 NN61/61 RUNTIME READY
非序列任务使用 MLP,序列任务使用因果 GRU-RNN;统一按 participant-group 做 80% 训练、10% 验证、10% 最终测试。单项正式实验最低 N = 505 个 participant-group records。
61 个正式比较任务中的 8 个代表性实验 8 EXAMPLES
| 任务 | 模型 | N | 训练 / 验证 / 测试 | NN 测试准确率 | 基线准确率 | 差值 | CE | AUC | 运行状态 |
|---|---|---|---|---|---|---|---|---|---|
| 奖励学习二选一 根据当前进度和此前公开奖励,在两个选项间持续学习。 | Causal GRU-RNN | 3,332 | 2,666 / 333 / 333 | 73.73% | 69.65% 训练集因果逻辑基线 | +4.08 pp | 0.508 | 0.800 | 环境 + NN 已接入 |
| 努力与进度选择 在不同任务切换成本和进度反馈下选择下一项任务。 | Causal GRU-RNN | 580 | 464 / 58 / 58 | 68.42% | 67.23% 训练集因果逻辑基线 | +1.18 pp | 0.537 | 0.754 | 环境 + NN 已接入 |
| 威胁下觅食 根据可见威胁和历史状态,在觅食、查看与躲藏间决策。 | Causal GRU-RNN | 1,070 | 856 / 107 / 107 | 82.72% | 69.97% 训练集因果基线 | +12.75 pp | 0.409 | 0.934 | 环境 + NN 已接入 |
| 任务切换与注意流 根据连续提示完成四方向任务切换,测试短期时序状态。 | Causal GRU-RNN | 1,000 | 800 / 100 / 100 | 96.06% | 96.06% 训练集因果逻辑基线 | ≈ 持平 | 0.160 | — | 环境 + NN 已接入 |
| 努力选择与工作记忆 联合预测任务选择和工作记忆更新方向,按动作类型分别计分。 | Causal GRU-RNN | 760 | 608 / 76 / 76 | 77.37% | 74.76% 训练集因果树基线 | +2.61 pp | 0.447 | — | 环境 + NN 已接入 |
| 风险觅食移动 根据当前位置、资源和风险线索预测下一次有效移动方向。 | Causal GRU-RNN | 781 | 625 / 78 / 78 | 86.33% | 78.86% 训练集因果基线 | +7.47 pp | 0.366 | 0.975 | 环境 + NN 已接入 |
| 价格趋势与延迟购买 根据公开票价走势预测现在购买还是等待。 | MLP | 722 | 578 / 72 / 72 | 70.83% | 70.83% 同输入频率基线 | ≈ 持平 | 0.560 | 0.705 | 环境 + NN 已接入 |
| 行动与不作为判断 统一不同问法的语义方向,预测采取行动还是不行动。 | MLP | 871 | 697 / 87 / 87 | 66.67% | 65.52% 同题面频率基线 | +1.15 pp | 0.624 | 0.667 | 环境 + NN 已接入 |
查看全部 61 项正式 human-NN 实验 / 原生环境 · 70 个持久化顶层模型头 · 84 个语义运行组件
每项正式实验都只对应一个可执行原生任务环境和一套真实 artifact 推理。 科学状态单独标明确认性、来源忠实路径或材料缺失替代协议。
| 正式实验 / 任务协议 | 运行模式 | 模型 | 模型头 / 运行输出 | 原生任务环境 | 分析资格 | N | 训练 / 验证 / 测试 |
|---|---|---|---|---|---|---|---|
| amir2022_k_in_a_row_gru k_in_a_row_strategic_search.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 2 runtime components | 1 external_amir2022_k_in_a_row_gru | 可做确认性比较 | 915 | 732 / 92 / 91 |
| bach_risky_foraging risky_foraging_successful_direction_move.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 risky_foraging_successful_direction_move | 可做确认性比较 | 781 | 625 / 78 / 78 |
| bahrami_restless_bandit bahrami_restless_four_arm_chosen_reward_only.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_bahrami_restless_bandit | 可做确认性比较 | 965 | 772 / 97 / 96 |
| barnby_reversal probabilistic_three_choice_reversal_learning.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_barnby_reversal | 可做确认性比较 | 692 | 554 / 69 / 69 |
| bavard_range_learning_transfer bavard_range_learning_transfer.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_bavard_range_learning_transfer | 可做确认性比较 | 800 | 640 / 80 / 80 |
| cec_static_choice_engineering choice_engineering_operant_learning.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 choice_engineering_operant_learning | 可做确认性比较 | 3,332 | 2,666 / 333 / 333 |
| clay_effort_nback nback_letter_target_detection_clay.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_clay_effort_nback | 来源忠实路径(非确认性) | 1,578 | 1,262 / 158 / 158 |
| cpc18 cpc18_repeated_risky_choice.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_cpc18 | 可做确认性比较 | 926 | 741 / 93 / 92 |
| dercon_pst probabilistic_selection_training_transfer.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_dercon_pst | 可做确认性比较 | 935 | 748 / 94 / 93 |
| devine_effort_progress effort_progress_demand_selection.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 effort_progress_demand_selection | 可做确认性比较 | 580 | 464 / 58 / 58 |
| ebb_flow ebb_flow_task_switching.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 ebb_flow_task_switching | 可做确认性比较 | 1,000 | 800 / 100 / 100 |
| fairness_information_sampling fairness_information_sampling_ultimatum.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 2 runtime components | 1 external_fairness_information_sampling | 明确替代协议(非确认性) | 4,668 | 3,734 / 467 / 467 |
| fan_volatile_bandit volatile_two_arm_choice.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_fan_volatile_bandit | 可做确认性比较 | 985 | 788 / 99 / 98 |
| gaechter_rule_following rule_following_protocol_typed_suite.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_gaechter_rule_following | 可做确认性比较 | 11,093 | 8,875 / 1,109 / 1,109 |
| garcia_retrieve_compare retrieve_compare_hybrid_choice.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_garcia_retrieve_compare | 可做确认性比较 | 673 | 539 / 67 / 67 |
| heffner_emotion_prediction emotion_prediction_errors_heffner.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 4 runtime components | 1 external_heffner_emotion_prediction | 可做确认性比较 | 943 | 755 / 94 / 94 |
| hertz2021_social_bandit social_information_two_armed_bandit.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_hertz2021_social_bandit | 可做确认性比较 | 1,489 | 1,191 / 149 / 149 |
| hussain_risk_ratings semantic_risk_psychometric_ratings.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 external_hussain_risk_ratings | 可做确认性比较 | 2,295 | 1,836 / 230 / 229 |
| jansen_self_assessment performance_self_assessment_jansen.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_jansen_self_assessment | 可做确认性比较 | 3,415 | 2,732 / 342 / 341 |
| koppel_economic_games economic_games_koppel.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 2 runtime components | 1 external_koppel_economic_games | 可做确认性比较 | 1,553 | 1,243 / 155 / 155 |
| kucina_conflict_suite cognitive_conflict_protocol_typed_suite.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_kucina_conflict_suite | 明确替代协议(非确认性) | 1,027 | 822 / 103 / 102 |
| kuper_smith_loss_cooperation one_shot_loss_cooperation_2x2.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 external_kuper_smith_loss_cooperation | 可做确认性比较 | 1,653 | 1,323 / 165 / 165 |
| lin_effort_valuation_typed_gru lin_effort_valuation_typed_sequence.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 2 runtime components | 1 lin_effort_valuation_typed_sequence | 可做确认性比较 | 760 | 608 / 76 / 76 |
| mantas_mood_state reward_to_momentary_mood_update.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_mantas_mood_state | 可做确认性比较 | 1,204 | 963 / 121 / 120 |
| manylabs_anchoring anchoring_manylabs_four_item.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 external_manylabs_anchoring | 可做确认性比较 | 6,299 | 5,039 / 630 / 630 |
| manylabs_behavior_suite manylabs1_original_item_behavior_suite.v1 | 原生任务环境 + 真实评分器 | MLP | allowed_forbidden_wording, asian_disease_framing, gambler_fallacy, quote_source_bias, reciprocity_reporter_access, sunk_cost_football 6 heads · 6 runtime components | 1 external_manylabs_behavior_suite | 可做确认性比较 | 6,342 | 5,073 / 635 / 634 |
| mi_multicue multi_cue_weather_mi.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_mi_multicue | 可做确认性比较 | 574 | 459 / 58 / 57 |
| nitsch_choi_c14 revealed_preference_budget_allocation_c14.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 external_nitsch_choi_c14 | 可做确认性比较 | 1,182 | 946 / 118 / 118 |
| pauli_passive_avoidance pauli_passive_avoidance_go_nogo.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_pauli_passive_avoidance | 可做确认性比较 | 742 | 594 / 74 / 74 |
| psych201_anllo_counterfactual counterfactual_context_learning_anllo.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_anllo_counterfactual | 可做确认性比较 | 505 | 404 / 51 / 50 |
| psych201_barnby_knowing social_value_self_other_learning_barnby.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 5 runtime components | 1 external_psych201_barnby_knowing | 可做确认性比较 | 627 | 502 / 63 / 62 |
| psych201_cheung_moral_act_omission moral_act_omission_choice.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 moral_act_omission_choice | 可做确认性比较 | 871 | 697 / 87 / 87 |
| psych201_choices13k choices13k_repeated_risky_choice.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_choices13k | 可做确认性比较 | 15,100 | 12,080 / 1,510 / 1,510 |
| psych201_evangelidis_upscaling consumer_upscaling_choice.v1 | 原生任务环境 + 真实评分器 | MLP | 3, 4 2 heads · 2 runtime components | 1 external_psych201_evangelidis_upscaling | 可做确认性比较 | 1,914 | 1,531 / 192 / 191 |
| psych201_gillan_twostage two_stage_decision_gillan_exp2.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_gillan_twostage | 可做确认性比较 | 1,639 | 1,311 / 164 / 164 |
| psych201_gunadi_deferral flight_ticket_price_trend_deferral.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 flight_ticket_price_trend_deferral | 可做确认性比较 | 722 | 578 / 72 / 72 |
| psych201_hunter_patent_race patent_race_simultaneous_investment.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_hunter_patent_race | 可做确认性比较 | 669 | 535 / 67 / 67 |
| psych201_iag insider_attacker_game_psych201.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_iag | 来源忠实路径(非确认性) | 823 | 659 / 82 / 82 |
| psych201_krueger_info resource_rational_risky_choice_information_acquisition.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 2 runtime components | 1 external_psych201_krueger_info | 可做确认性比较 | 1,858 | 1,486 / 186 / 186 |
| psych201_moutoussis_baseline pavlovian_go_nogo_moutoussis_baseline.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_moutoussis_baseline | 可做确认性比较 | 736 | 589 / 74 / 73 |
| psych201_risk_happiness risk_happiness_rutledge.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 2 runtime components | 1 external_psych201_risk_happiness | 可做确认性比较 | 46,972 | 37,578 / 4,697 / 4,697 |
| psych201_tesslerfranke_vague vague_predicate_rating.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 external_psych201_tesslerfranke_vague | 可做确认性比较 | 645 | 516 / 65 / 64 |
| psych201_tomov_navigation hierarchical_ring_navigation_tomov.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_psych201_tomov_navigation | 可做确认性比较 | 634 | 507 / 64 / 63 |
| radulescu_risk_experience experiential_risk_learning_four_stimuli.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_radulescu_risk_experience | 可做确认性比较 | 563 | 451 / 56 / 56 |
| rao_hastie_sequence binary_sequence_prediction_rao_hastie.v1 | 原生任务环境 + 真实评分器 | MLP | binary_choice, probability_0_100 2 heads · 2 runtime components | 1 external_rao_hastie_sequence | 可做确认性比较 | 1,351 | 1,081 / 135 / 135 |
| rischall_information_demand instrumental_information_demand_rischall | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_rischall_information_demand | 可做确认性比较 | 595 | 476 / 60 / 59 |
| rossi_goldthorpe_c2 rossi_goldthorpe_c2_social_influence_perception.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_rossi_goldthorpe_c2 | 明确替代协议(非确认性) | 987 | 790 / 99 / 98 |
| rouhani_niv_old_recognition rouhani_niv_old_item_recognition_symbolic_surrogate.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_rouhani_niv_old_recognition | 明确替代协议(非确认性) | 732 | 586 / 73 / 73 |
| salomon_cat cue_approach_training_to_probe_choice.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_salomon_cat | 可做确认性比较 | 864 | 691 / 87 / 86 |
| scholl_sequential_search sequential_search_bank_or_spin.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_scholl_sequential_search | 可做确认性比较 | 1,205 | 964 / 121 / 120 |
| shin_latent_cause sparse_event_average_estimation_shin_niv.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 2 runtime components | 1 external_shin_latent_cause | 可做确认性比较 | 906 | 725 / 91 / 90 |
| sikos_referential_language sikos_referential_language_game | 原生任务环境 + 真实评分器 | MLP | listener, salience, speaker 3 heads · 3 runtime components | 1 external_sikos_referential_language | 可做确认性比较 | 5,625 | 4,500 / 563 / 562 |
| sro_information_sampling information_sampling_sro | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_sro_information_sampling | 可做确认性比较 | 522 | 418 / 52 / 52 |
| sro_task_switching threebytwo_task_switching | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_sro_task_switching | 可做确认性比较 | 522 | 418 / 52 / 52 |
| steiner_frey_bart bart_representative_design_test_retest.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_steiner_frey_bart | 可做确认性比较 | 694 | 555 / 70 / 69 |
| sustainable_common_pool sustainable_common_pool_reciprocation_share.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_sustainable_common_pool | 来源忠实路径(非确认性) | 2,080 | 1,664 / 208 / 208 |
| tomov2021_mtrl multitask_castle_two_step.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_tomov2021_mtrl | 可做确认性比较 | 617 | 493 / 62 / 62 |
| trier_foraging_under_threat trier_foraging_under_threat | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 foraging_under_threat_three_action | 可做确认性比较 | 1,070 | 856 / 107 / 107 |
| vonclarenau_numerical_integration sequential_numerical_integration_vonclarenau.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_vonclarenau_numerical_integration | 可做确认性比较 | 586 | 469 / 59 / 58 |
| weirdbandit_explicit_lottery weirdbandit_explicit_lottery.v1 | 原生任务环境 + 真实评分器 | MLP | default 1 heads · 1 runtime components | 1 external_weirdbandit_explicit_lottery | 可做确认性比较 | 561 | 449 / 56 / 56 |
| weirdbandit_rl_learning_transfer weirdbandit_rl_learning_transfer.v1 | 原生任务环境 + 真实评分器 | GRU-RNN | default 1 heads · 1 runtime components | 1 external_weirdbandit_rl_learning_transfer | 可做确认性比较 | 561 | 449 / 56 / 56 |
训练与测试协议
- 按 participant-group 生成互斥的 80 / 10 / 10 三折,禁止同一身份跨集合。
- 编码器只在训练集拟合;验证集只用于模型选择和 early stopping。
- 非序列输入送入 MLP;需要过往 trial 状态的输入送入因果 GRU-RNN。
- artifact 固定后重新加载,最终测试集只评估一次,并与 train-only 基线同输入比较。
辅助库中的 30 个人类参考模型 30 AUXILIARY MODELS
53 个辅助环境中,30 个保留了旧的人类参考模型:7 MLP · 23 GRU-RNN, 评分链路均已验证。这些模型用于辅助分析,不增加上面的 61 个正式比较任务。
| 任务 / 数据源 | 层级 | 模型 / 输出头 | 参与者记录 | 训练 / 验证 / 测试 | 最终测试准确率 | AUC | Loss |
|---|---|---|---|---|---|---|---|
| horizon Psych-201 wilson2014humans (N=225) | A | GRU-RNN · bernoulli | 225 | 180 / 23 / 22 | 73.97% | 0.757 | 0.497 |
| two_step Psych-201 kool2016when/exp2 (N=188) | A | GRU-RNN · bernoulli | 188 | 150 / 19 / 19 | 62.52% | 0.655 | 0.608 |
| k_armed Psych-201 bahrami2020four (N=869) | A | GRU-RNN · group softmax | 869 | 695 / 87 / 87 | 77.61% | 0.936 | 0.614 |
| probability_learning Psych-201 Thoma_et_al_2025_probability_learning (N=435) | A | GRU-RNN · bernoulli | 435 | 348 / 44 / 43 | 69.59% | 0.751 | 0.579 |
| reward_learning Psych-201 bavard2021range (N=720) | A | GRU-RNN · group softmax | 720 | 576 / 72 / 72 | 71.69% | 0.820 | 0.498 |
| columbia_card Psych-201 frey2017cct (N=1,406) | A | GRU-RNN · bernoulli | 1,406 | 1,125 / 141 / 140 | 92.70% | 0.843 | 0.207 |
| intertemporal Psych-201 ruggeri2022globalizability (N=13,132) | A | MLP · bernoulli | 13,132 | 10,506 / 1,313 / 1,313 | 68.55% | 0.638 | 0.606 |
| iowa Psych-201 steingroever2015data (N=520) | A | GRU-RNN · group softmax | 520 | 416 / 52 / 52 | 60.65% | 0.840 | 0.954 |
| moral_machine Psych-201 awad2018moral (all parseable sessions) | A | MLP · bernoulli | 33,002 | 26,402 / 3,300 / 3,300 | 72.38% | 0.790 | 0.552 |
| risky_choice Psych-201 frey2017lotteries (N=1,407) | A | MLP · bernoulli | 1,407 | 1,125 / 141 / 141 | 73.94% | 0.812 | 0.528 |
| contribution_game Psych-201 heffner2022economicgames/prd (N=286) | A | GRU-RNN · ordered softmax | 286 | 229 / 29 / 28 | 62.82% | 0.933 | 1.122 |
| ultimatum Psych-201 heffner2022economicgames/ug (N=669) | A | GRU-RNN · bernoulli | 669 | 535 / 67 / 67 | 90.75% | 0.962 | 0.219 |
| observe_or_bet Psych-201 anvari2024observe_bet (N=834) | B | GRU-RNN · bernoulli | 834 | 667 / 84 / 83 | 89.19% | 0.904 | 0.276 |
| spatial_search Psych-201 Meder (2021), Schulz (2019) (N=118) | B | GRU-RNN · group softmax | 118 | 94 / 12 / 12 | 32.72% | 0.928 | 2.425 |
| metacognition Psych-201 hellmann_unpublished_brightness (N=42; 13,590 non-tie trials used) | B | GRU-RNN · ordered softmax | 42 | 34 / 4 / 4 | 22.93% | 0.743 | 2.093 |
| multi_cue_judgment Psych-201 collsiöö2023MCPL exp1-3; numeric and verbal levels mapped to the same ordered scale (N=234 sessions) | B | GRU-RNN · ordered softmax | 234 | 187 / 24 / 23 | 53.04% | 0.887 | 1.297 |
| probability_estimation Psych-201 zhu2020bayesian (N=129) | B | GRU-RNN · ordered softmax | 129 | 103 / 13 / 13 | 24.76% | 0.736 | 2.082 |
| digit_span Psych-201 enkavi2019digitspan (N=472) | B | GRU-RNN · group softmax | 472 | 378 / 47 / 47 | 40.29% | 0.853 | 1.569 |
| nback Psych-201 enkavi2019adaptivenback (N=470) | B | GRU-RNN · bernoulli | 470 | 376 / 47 / 47 | 78.43% | 0.845 | 0.461 |
| stroop Psych-201 busch2024_stroop (N=113) | B | GRU-RNN · group softmax | 113 | 91 / 11 / 11 | 98.05% | 0.993 | 0.104 |
| counterfactual_bandit Psych-201 chambon2020feedback (N=70) | B | GRU-RNN · group softmax | 70 | 56 / 7 / 7 | 82.29% | 0.914 | 0.373 |
| optimism_learning Psych-201 lefebvre2017behavioural (N=77) | B | GRU-RNN · group softmax | 77 | 61 / 8 / 8 | 78.52% | 0.877 | 0.440 |
| reversal_learning Psych-201 suthaharan2021paranoia (N=912) | B | GRU-RNN · group softmax | 912 | 730 / 91 / 91 | 78.87% | 0.932 | 0.503 |
| bart Psych-201 frey2017risk (N=1,407) | B | GRU-RNN · bernoulli | 1,407 | 1,125 / 141 / 141 | 98.22% | 0.894 | 0.067 |
| risk_mpl Psych-201 frey2017mpl (N=1,405) | B | MLP · bernoulli | 1,405 | 1,124 / 141 / 140 | 82.03% | 0.892 | 0.412 |
| sampling_choice Psych-201 wulff2018sampling (all parseable sessions) | B | GRU-RNN · bernoulli | 2,755 | 2,204 / 276 / 275 | 95.86% | 0.847 | 0.138 |
| skewness_choice Psych-201 olschewski2024skewness (N=776) | B | MLP · bernoulli | 776 | 621 / 78 / 77 | 58.62% | 0.608 | 0.653 |
| repeated_games Psych-201 akata2023repeatedgames (N=176) | B | GRU-RNN · bernoulli | 176 | 141 / 18 / 17 | 71.18% | 0.752 | 0.562 |
| things_odd_one_out Psych-201 hebart2023things (N=12,240) | C | MLP · bernoulli | 4,629 | 4,044 / 289 / 296 | 67.44% | 0.699 | 0.594 |
| rsa_pragmatics Psych-201 hu2023lm-pragmatics (N=337) | C | MLP · bernoulli | 337 | 269 / 34 / 34 | 88.93% | 0.792 | 0.292 |
Agent 初步结果RERUN REQUIRED
正式表只接受 strict v2.1、observation_only.v1、且不向架构暴露 raw Gym reward 的运行。
0 / 200 valid episodes · 0.0%
可比较结果明细
Performance 使用每个任务自己的主指标;Normativity 衡量是否接近规范最优; Humanness 是人类参考模型给 Agent 实际选择的概率;Output Quality 记录解析兜底与 输出截断。各列不可互相替代。
当前筛选没有可比较结果
未完成或协议不匹配的运行不会被补成成绩。
公平性与解释边界
公平比较不只是“参数一样”,还要锁定环境、信息、预算、切分和统计单位。
- 同一 task × seed 使用同一个环境生成过程与任务长度
- 三家 backbone 统一关闭 thinking,temperature=0.6,top_p=0.95
- Direct、CoALA-lite、RAFA-inspired 均为每个决策一次 LLM 调用
- observation_only.v1 只向 Agent 暴露公开 observation、action 与 next observation
- Gym raw reward 仅用于研究者评分;依赖数值强化的架构必须逐任务显式 opt-in
- mock/live 使用不同 fingerprint 与物理目录,避免续跑互相污染
- 不同量纲任务不合并成一个总榜,A/B/C 迁移层级分开报告