🧭 MindGym 是什么?

MindGym 把经典心理学与行为经济学实验改造成 Agent 可以逐 trial 参与的环境。我们分别测量任务表现、规范理性和人类相似度,不把“答对” 和“像人”混成同一个分数。

当前网站同时展示三层信息:任务环境、Agent 的记忆与决策架构,以及使用 真实人类行为训练的 MLP / GRU-RNN 参考模型。

正式比较任务61外部 human-NN experiments
正式原生环境61与正式任务一一对应
外部 NN 任务接通61/61一项正式实验对应一个任务环境
Agent 条件18LLM、认知架构与控制组

怎么运作

  1. 环境在每个 trial 给 Agent 当前可见信息与合法动作。
  2. Agent 架构构造决策上下文,由选定的 LLM backbone 或规则控制器作答。
  3. 环境返回下一观察;架构按自己的 state-updating 规则更新记忆。
  4. 同一条轨迹同时计算任务表现、规范理性和人类选择概率。
计数口径:正式比较基准恰好是 61 个外部 human-NN 实验、61 个正式任务和 61 个原生任务环境,一项实验对应一个任务。70 个持久化顶层模型头和 84 个语义运行组件只是模型元数据,不增加任务数; participant-group 记录数也不等于全球去重的真人数。

工程实现清单(不计入正式比较任务):另有 53 个辅助环境; 代码共注册 114 个环境实现。

🧠 Agent 架构18 CONDITIONS

在同一任务、同一 backbone 和同一信息边界下,比较 Agent 如何构造 context、 做决策并更新内部 state。

主比较架构

架构类型每次决策调用记忆 / 状态工作原理状态
DirectLLM baseline1当前观察最小控制组:同一 backbone 直接读取当前任务状态并作答。
Observe → Prompt → Decide → Act
v1 paid pilot · diagnostic
CoALA-liteCoALA-inspired1working + episodic + semantic把工作记忆、有限情景记忆、动作—结果统计和程序性决策循环组合成可审计的 bounded controller。
Perceive → Working memory → Retrieve episodes → Update semantics → Act
v2 public-feedback gate pending
RAFA-inspiredbelief / planning1bounded trajectory + belief维护有限轨迹,显式更新 belief,并在相同的一次模型调用内做短视界 future-value 判断。
Observe → Update belief → Sketch futures → Value actions → Act
v2 public-feedback gate pending
ACT-R-inspiredsymbolic cognitive0chunks + activation + utility本地机制级认知对照:base-level activation、production utility、噪声冲突消解与结果驱动的 utility learning;只在数值反馈已审计为参与者可见的任务上运行。
Encode chunks → Retrieve → Match productions → Resolve conflict → Learn utility
requires audited numeric feedback
Randomnegative control0无按任务 seed 复现的均匀随机动作,是最低信息量负对照。
Seed → Sample valid action → Act
v1 diagnostic control
查看全部 18 个已实现或已有 adapter 的 Agent 条件
Agent比较层调用量记忆 / 控制当前状态
Direct / Stateless
统一 Runner 中的最小 LLM 基线;等价于既有 MiniPsych stateless 臂。
一次调用 · 主矩阵1 / decision仅当前 observationv1 付费 pilot · 诊断数据
Cumulative Transcript
只在短任务面板运行;超过字符上限直接 fail-closed,不偷偷截成窗口。
一次调用 · 记忆消融1 / decision完整局内 transcript · 12k hard capExpanded v2 · 新反馈门待重跑
Window Memory
固定窗口历史;控制上下文长度并保留局部时序。
一次调用 · 记忆消融1 / decision最近 K 个 turnsExpanded v2 · 新反馈门待重跑
Lexical Retrieval
用确定性的词项相似度检索局内经历,不增加 embedding 或模型调用。
一次调用 · 记忆消融1 / decisiontop-k 相似情景记忆Expanded v2 · 新反馈门待重跑
ACT-R Retrieval
用 ACT-R 式近因、频率和语义扩散激活替换纯词项检索。
一次调用 · 记忆消融1 / decision激活加权情景记忆Expanded v2 · 新反馈门待重跑
Outcome Summary
按动作归组参与者可见的 next observation,不使用 Gym raw reward。
一次调用 · 记忆消融1 / decision公开 action—outcome 文本 + 近因Expanded v2 · 新反馈门待重跑
Outcome Stats
去掉结果值与逐次轨迹,只保留近期动作频率统计。
一次调用 · 组件消融1 / decision仅公开 choice countsExpanded v2 · 新反馈门待重跑
Outcome Trace
去掉统计聚合,只保留 action 与可见 next observation 的时序。
一次调用 · 组件消融1 / decision动作—公开结果时序Expanded v2 · 新反馈门待重跑
Memory Placebo
保留动作计数与公开结果文本,确定性打乱配对以构造信息负对照。
一次调用 · 负对照1 / decision轮转公开 outcome mappingExpanded v2 · 新反馈门待重跑
CoALA-lite
可审计的 bounded CoALA-inspired controller。
一次调用 · 主矩阵1 / decisionworking + episodic + semanticExpanded v2 · 新反馈门待重跑
RAFA-inspired
一次调用内完成 belief update、短视界价值比较与动作选择。
一次调用 · 主矩阵1 / decision轨迹 + belief + future valueExpanded v2 · 新反馈门待重跑
Reflection
每个 block 额外生成策略摘要;不能与一次调用臂伪装成同预算。
额外计算 · 单列比较1 + periodic滚动策略反思Expanded v2 · 新反馈门待重跑
Propose + Verify
第二次调用审查并可纠正候选动作。
额外计算 · 单列比较2 / decision候选动作 + 审核Expanded v2 · 新反馈门待重跑
Self-consistency
同一 prompt 多次采样,按有效动作多数票决策。
额外计算 · 单列比较N / decision多样本多数投票Expanded v2 · 新反馈门待重跑
ACT-R-inspired
Python 机制级控制,不冒充原生 ACT-R production system。
模型无关 · 主矩阵0chunks + activation + utility需逐任务公开数值反馈契约
Random
按任务 seed 可复现的均匀随机动作。
模型无关 · 负对照0无v1 诊断控制 · v2 待重跑
Native ACT-R
需要外部 dispatcher 与逐任务 production model,不能用 inspired 结果代替。
原生 runtime0ACT-R 7.6+ productionsadapter 已实现 · 缺任务 bridge
Native Soar
需要 soar-sml;复杂任务还需要 task-specific productions。
原生 runtime0SML operators + Soar-RLadapter 已实现 · 缺本机 runtime
命名边界:CoALA-lite、RAFA-inspired 与 ACT-R-inspired 是可审计的机制实现,不声称等于 原论文或原生 runtime 的唯一标准实现。原生 ACT-R / Soar adapter 单独标记。

👥 61 个正式比较任务与人类 NN61/61 RUNTIME READY

非序列任务使用 MLP,序列任务使用因果 GRU-RNN;统一按 participant-group 做 80% 训练、10% 验证、10% 最终测试。单项正式实验最低 N = 505 个 participant-group records。

正式比较任务6161 项外部 human-NN 实验
原生任务环境6161/61 可运行并评分
持久化顶层模型头70artifact / checkpoint 层元数据
语义运行组件84推理时可评分的输出语义,不是任务数
接入边界:61 项外部 human-NN 实验均已接到各自的原生任务环境与真实评分器, 合计恰好 61 个正式比较任务;一项实验只登记一个任务,多模型头和多输出组件不会膨胀任务数。 它们不是对 15 个现有低 N 任务的偷换,因此完全同协议替代仍为0 / 15。
C / U 能测什么:多 trial 原生任务会把 Agent 自己过去的动作、可见反馈和环境状态带到下一次决策, 因而可以分别比较 C(怎样从历史构造新 context)与 U(决策后怎样更新 state)。 如果原实验天然只有一次决策,我们保留它的一次性结构:它可以检验 C 和当前决策, 但没有同一 episode 内的后续状态,所以不能据此检验 U,也不会人为添加不存在的 trial。
确认性分析边界:54 个任务可做内部 held-out 确认性比较;7 个任务明确不进入确认性汇总。来源忠实但非确认性 3 个(clay_effort_nback、psych201_iag、sustainable_common_pool); 因原始材料缺失而采用明确替代协议 4 个(fairness_information_sampling、kucina_conflict_suite、rossi_goldthorpe_c2、rouhani_niv_old_recognition)。

61 个正式比较任务中的 8 个代表性实验 8 EXAMPLES

任务模型N训练 / 验证 / 测试NN 测试准确率基线准确率差值CEAUC运行状态
奖励学习二选一
根据当前进度和此前公开奖励,在两个选项间持续学习。
Causal GRU-RNN3,3322,666 / 333 / 333
73.73%69.65%
训练集因果逻辑基线
+4.08 pp0.5080.800环境 + NN 已接入
努力与进度选择
在不同任务切换成本和进度反馈下选择下一项任务。
Causal GRU-RNN580464 / 58 / 58
68.42%67.23%
训练集因果逻辑基线
+1.18 pp0.5370.754环境 + NN 已接入
威胁下觅食
根据可见威胁和历史状态,在觅食、查看与躲藏间决策。
Causal GRU-RNN1,070856 / 107 / 107
82.72%69.97%
训练集因果基线
+12.75 pp0.4090.934环境 + NN 已接入
任务切换与注意流
根据连续提示完成四方向任务切换,测试短期时序状态。
Causal GRU-RNN1,000800 / 100 / 100
96.06%96.06%
训练集因果逻辑基线
≈ 持平0.160—环境 + NN 已接入
努力选择与工作记忆
联合预测任务选择和工作记忆更新方向,按动作类型分别计分。
Causal GRU-RNN760608 / 76 / 76
77.37%74.76%
训练集因果树基线
+2.61 pp0.447—环境 + NN 已接入
风险觅食移动
根据当前位置、资源和风险线索预测下一次有效移动方向。
Causal GRU-RNN781625 / 78 / 78
86.33%78.86%
训练集因果基线
+7.47 pp0.3660.975环境 + NN 已接入
价格趋势与延迟购买
根据公开票价走势预测现在购买还是等待。
MLP722578 / 72 / 72
70.83%70.83%
同输入频率基线
≈ 持平0.5600.705环境 + NN 已接入
行动与不作为判断
统一不同问法的语义方向,预测采取行动还是不行动。
MLP871697 / 87 / 87
66.67%65.52%
同题面频率基线
+1.15 pp0.6240.667环境 + NN 已接入
查看全部 61 项正式 human-NN 实验 / 原生环境 · 70 个持久化顶层模型头 · 84 个语义运行组件

每项正式实验都只对应一个可执行原生任务环境和一套真实 artifact 推理。 科学状态单独标明确认性、来源忠实路径或材料缺失替代协议。

正式实验 / 任务协议运行模式模型模型头 / 运行输出原生任务环境分析资格N训练 / 验证 / 测试
amir2022_k_in_a_row_gru
k_in_a_row_strategic_search.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 2 runtime components
1
external_amir2022_k_in_a_row_gru
可做确认性比较915732 / 92 / 91
bach_risky_foraging
risky_foraging_successful_direction_move.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
risky_foraging_successful_direction_move
可做确认性比较781625 / 78 / 78
bahrami_restless_bandit
bahrami_restless_four_arm_chosen_reward_only.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_bahrami_restless_bandit
可做确认性比较965772 / 97 / 96
barnby_reversal
probabilistic_three_choice_reversal_learning.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_barnby_reversal
可做确认性比较692554 / 69 / 69
bavard_range_learning_transfer
bavard_range_learning_transfer.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_bavard_range_learning_transfer
可做确认性比较800640 / 80 / 80
cec_static_choice_engineering
choice_engineering_operant_learning.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
choice_engineering_operant_learning
可做确认性比较3,3322,666 / 333 / 333
clay_effort_nback
nback_letter_target_detection_clay.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_clay_effort_nback
来源忠实路径(非确认性)1,5781,262 / 158 / 158
cpc18
cpc18_repeated_risky_choice.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_cpc18
可做确认性比较926741 / 93 / 92
dercon_pst
probabilistic_selection_training_transfer.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_dercon_pst
可做确认性比较935748 / 94 / 93
devine_effort_progress
effort_progress_demand_selection.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
effort_progress_demand_selection
可做确认性比较580464 / 58 / 58
ebb_flow
ebb_flow_task_switching.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
ebb_flow_task_switching
可做确认性比较1,000800 / 100 / 100
fairness_information_sampling
fairness_information_sampling_ultimatum.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 2 runtime components
1
external_fairness_information_sampling
明确替代协议(非确认性)4,6683,734 / 467 / 467
fan_volatile_bandit
volatile_two_arm_choice.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_fan_volatile_bandit
可做确认性比较985788 / 99 / 98
gaechter_rule_following
rule_following_protocol_typed_suite.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_gaechter_rule_following
可做确认性比较11,0938,875 / 1,109 / 1,109
garcia_retrieve_compare
retrieve_compare_hybrid_choice.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_garcia_retrieve_compare
可做确认性比较673539 / 67 / 67
heffner_emotion_prediction
emotion_prediction_errors_heffner.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 4 runtime components
1
external_heffner_emotion_prediction
可做确认性比较943755 / 94 / 94
hertz2021_social_bandit
social_information_two_armed_bandit.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_hertz2021_social_bandit
可做确认性比较1,4891,191 / 149 / 149
hussain_risk_ratings
semantic_risk_psychometric_ratings.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
external_hussain_risk_ratings
可做确认性比较2,2951,836 / 230 / 229
jansen_self_assessment
performance_self_assessment_jansen.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_jansen_self_assessment
可做确认性比较3,4152,732 / 342 / 341
koppel_economic_games
economic_games_koppel.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 2 runtime components
1
external_koppel_economic_games
可做确认性比较1,5531,243 / 155 / 155
kucina_conflict_suite
cognitive_conflict_protocol_typed_suite.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_kucina_conflict_suite
明确替代协议(非确认性)1,027822 / 103 / 102
kuper_smith_loss_cooperation
one_shot_loss_cooperation_2x2.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
external_kuper_smith_loss_cooperation
可做确认性比较1,6531,323 / 165 / 165
lin_effort_valuation_typed_gru
lin_effort_valuation_typed_sequence.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 2 runtime components
1
lin_effort_valuation_typed_sequence
可做确认性比较760608 / 76 / 76
mantas_mood_state
reward_to_momentary_mood_update.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_mantas_mood_state
可做确认性比较1,204963 / 121 / 120
manylabs_anchoring
anchoring_manylabs_four_item.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
external_manylabs_anchoring
可做确认性比较6,2995,039 / 630 / 630
manylabs_behavior_suite
manylabs1_original_item_behavior_suite.v1
原生任务环境 + 真实评分器MLPallowed_forbidden_wording, asian_disease_framing, gambler_fallacy, quote_source_bias, reciprocity_reporter_access, sunk_cost_football
6 heads · 6 runtime components
1
external_manylabs_behavior_suite
可做确认性比较6,3425,073 / 635 / 634
mi_multicue
multi_cue_weather_mi.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_mi_multicue
可做确认性比较574459 / 58 / 57
nitsch_choi_c14
revealed_preference_budget_allocation_c14.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
external_nitsch_choi_c14
可做确认性比较1,182946 / 118 / 118
pauli_passive_avoidance
pauli_passive_avoidance_go_nogo.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_pauli_passive_avoidance
可做确认性比较742594 / 74 / 74
psych201_anllo_counterfactual
counterfactual_context_learning_anllo.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_anllo_counterfactual
可做确认性比较505404 / 51 / 50
psych201_barnby_knowing
social_value_self_other_learning_barnby.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 5 runtime components
1
external_psych201_barnby_knowing
可做确认性比较627502 / 63 / 62
psych201_cheung_moral_act_omission
moral_act_omission_choice.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
moral_act_omission_choice
可做确认性比较871697 / 87 / 87
psych201_choices13k
choices13k_repeated_risky_choice.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_choices13k
可做确认性比较15,10012,080 / 1,510 / 1,510
psych201_evangelidis_upscaling
consumer_upscaling_choice.v1
原生任务环境 + 真实评分器MLP3, 4
2 heads · 2 runtime components
1
external_psych201_evangelidis_upscaling
可做确认性比较1,9141,531 / 192 / 191
psych201_gillan_twostage
two_stage_decision_gillan_exp2.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_gillan_twostage
可做确认性比较1,6391,311 / 164 / 164
psych201_gunadi_deferral
flight_ticket_price_trend_deferral.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
flight_ticket_price_trend_deferral
可做确认性比较722578 / 72 / 72
psych201_hunter_patent_race
patent_race_simultaneous_investment.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_hunter_patent_race
可做确认性比较669535 / 67 / 67
psych201_iag
insider_attacker_game_psych201.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_iag
来源忠实路径(非确认性)823659 / 82 / 82
psych201_krueger_info
resource_rational_risky_choice_information_acquisition.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 2 runtime components
1
external_psych201_krueger_info
可做确认性比较1,8581,486 / 186 / 186
psych201_moutoussis_baseline
pavlovian_go_nogo_moutoussis_baseline.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_moutoussis_baseline
可做确认性比较736589 / 74 / 73
psych201_risk_happiness
risk_happiness_rutledge.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 2 runtime components
1
external_psych201_risk_happiness
可做确认性比较46,97237,578 / 4,697 / 4,697
psych201_tesslerfranke_vague
vague_predicate_rating.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
external_psych201_tesslerfranke_vague
可做确认性比较645516 / 65 / 64
psych201_tomov_navigation
hierarchical_ring_navigation_tomov.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_psych201_tomov_navigation
可做确认性比较634507 / 64 / 63
radulescu_risk_experience
experiential_risk_learning_four_stimuli.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_radulescu_risk_experience
可做确认性比较563451 / 56 / 56
rao_hastie_sequence
binary_sequence_prediction_rao_hastie.v1
原生任务环境 + 真实评分器MLPbinary_choice, probability_0_100
2 heads · 2 runtime components
1
external_rao_hastie_sequence
可做确认性比较1,3511,081 / 135 / 135
rischall_information_demand
instrumental_information_demand_rischall
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_rischall_information_demand
可做确认性比较595476 / 60 / 59
rossi_goldthorpe_c2
rossi_goldthorpe_c2_social_influence_perception.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_rossi_goldthorpe_c2
明确替代协议(非确认性)987790 / 99 / 98
rouhani_niv_old_recognition
rouhani_niv_old_item_recognition_symbolic_surrogate.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_rouhani_niv_old_recognition
明确替代协议(非确认性)732586 / 73 / 73
salomon_cat
cue_approach_training_to_probe_choice.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_salomon_cat
可做确认性比较864691 / 87 / 86
scholl_sequential_search
sequential_search_bank_or_spin.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_scholl_sequential_search
可做确认性比较1,205964 / 121 / 120
shin_latent_cause
sparse_event_average_estimation_shin_niv.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 2 runtime components
1
external_shin_latent_cause
可做确认性比较906725 / 91 / 90
sikos_referential_language
sikos_referential_language_game
原生任务环境 + 真实评分器MLPlistener, salience, speaker
3 heads · 3 runtime components
1
external_sikos_referential_language
可做确认性比较5,6254,500 / 563 / 562
sro_information_sampling
information_sampling_sro
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_sro_information_sampling
可做确认性比较522418 / 52 / 52
sro_task_switching
threebytwo_task_switching
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_sro_task_switching
可做确认性比较522418 / 52 / 52
steiner_frey_bart
bart_representative_design_test_retest.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_steiner_frey_bart
可做确认性比较694555 / 70 / 69
sustainable_common_pool
sustainable_common_pool_reciprocation_share.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_sustainable_common_pool
来源忠实路径(非确认性)2,0801,664 / 208 / 208
tomov2021_mtrl
multitask_castle_two_step.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_tomov2021_mtrl
可做确认性比较617493 / 62 / 62
trier_foraging_under_threat
trier_foraging_under_threat
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
foraging_under_threat_three_action
可做确认性比较1,070856 / 107 / 107
vonclarenau_numerical_integration
sequential_numerical_integration_vonclarenau.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_vonclarenau_numerical_integration
可做确认性比较586469 / 59 / 58
weirdbandit_explicit_lottery
weirdbandit_explicit_lottery.v1
原生任务环境 + 真实评分器MLPdefault
1 heads · 1 runtime components
1
external_weirdbandit_explicit_lottery
可做确认性比较561449 / 56 / 56
weirdbandit_rl_learning_transfer
weirdbandit_rl_learning_transfer.v1
原生任务环境 + 真实评分器GRU-RNNdefault
1 heads · 1 runtime components
1
external_weirdbandit_rl_learning_transfer
可做确认性比较561449 / 56 / 56

训练与测试协议

  1. 按 participant-group 生成互斥的 80 / 10 / 10 三折,禁止同一身份跨集合。
  2. 编码器只在训练集拟合;验证集只用于模型选择和 early stopping。
  3. 非序列输入送入 MLP;需要过往 trial 状态的输入送入因果 GRU-RNN。
  4. artifact 固定后重新加载,最终测试集只评估一次,并与 train-only 基线同输入比较。

辅助库中的 30 个人类参考模型 30 AUXILIARY MODELS

53 个辅助环境中,30 个保留了旧的人类参考模型:7 MLP · 23 GRU-RNN, 评分链路均已验证。这些模型用于辅助分析,不增加上面的 61 个正式比较任务。

30 models
任务 / 数据源层级模型 / 输出头参与者记录训练 / 验证 / 测试最终测试准确率AUCLoss
horizon
Psych-201 wilson2014humans (N=225)
AGRU-RNN · bernoulli225180 / 23 / 2273.97%0.7570.497
two_step
Psych-201 kool2016when/exp2 (N=188)
AGRU-RNN · bernoulli188150 / 19 / 1962.52%0.6550.608
k_armed
Psych-201 bahrami2020four (N=869)
AGRU-RNN · group softmax869695 / 87 / 8777.61%0.9360.614
probability_learning
Psych-201 Thoma_et_al_2025_probability_learning (N=435)
AGRU-RNN · bernoulli435348 / 44 / 4369.59%0.7510.579
reward_learning
Psych-201 bavard2021range (N=720)
AGRU-RNN · group softmax720576 / 72 / 7271.69%0.8200.498
columbia_card
Psych-201 frey2017cct (N=1,406)
AGRU-RNN · bernoulli1,4061,125 / 141 / 14092.70%0.8430.207
intertemporal
Psych-201 ruggeri2022globalizability (N=13,132)
AMLP · bernoulli13,13210,506 / 1,313 / 1,31368.55%0.6380.606
iowa
Psych-201 steingroever2015data (N=520)
AGRU-RNN · group softmax520416 / 52 / 5260.65%0.8400.954
moral_machine
Psych-201 awad2018moral (all parseable sessions)
AMLP · bernoulli33,00226,402 / 3,300 / 3,30072.38%0.7900.552
risky_choice
Psych-201 frey2017lotteries (N=1,407)
AMLP · bernoulli1,4071,125 / 141 / 14173.94%0.8120.528
contribution_game
Psych-201 heffner2022economicgames/prd (N=286)
AGRU-RNN · ordered softmax286229 / 29 / 2862.82%0.9331.122
ultimatum
Psych-201 heffner2022economicgames/ug (N=669)
AGRU-RNN · bernoulli669535 / 67 / 6790.75%0.9620.219
observe_or_bet
Psych-201 anvari2024observe_bet (N=834)
BGRU-RNN · bernoulli834667 / 84 / 8389.19%0.9040.276
spatial_search
Psych-201 Meder (2021), Schulz (2019) (N=118)
BGRU-RNN · group softmax11894 / 12 / 1232.72%0.9282.425
metacognition
Psych-201 hellmann_unpublished_brightness (N=42; 13,590 non-tie trials used)
BGRU-RNN · ordered softmax4234 / 4 / 422.93%0.7432.093
multi_cue_judgment
Psych-201 collsiöö2023MCPL exp1-3; numeric and verbal levels mapped to the same ordered scale (N=234 sessions)
BGRU-RNN · ordered softmax234187 / 24 / 2353.04%0.8871.297
probability_estimation
Psych-201 zhu2020bayesian (N=129)
BGRU-RNN · ordered softmax129103 / 13 / 1324.76%0.7362.082
digit_span
Psych-201 enkavi2019digitspan (N=472)
BGRU-RNN · group softmax472378 / 47 / 4740.29%0.8531.569
nback
Psych-201 enkavi2019adaptivenback (N=470)
BGRU-RNN · bernoulli470376 / 47 / 4778.43%0.8450.461
stroop
Psych-201 busch2024_stroop (N=113)
BGRU-RNN · group softmax11391 / 11 / 1198.05%0.9930.104
counterfactual_bandit
Psych-201 chambon2020feedback (N=70)
BGRU-RNN · group softmax7056 / 7 / 782.29%0.9140.373
optimism_learning
Psych-201 lefebvre2017behavioural (N=77)
BGRU-RNN · group softmax7761 / 8 / 878.52%0.8770.440
reversal_learning
Psych-201 suthaharan2021paranoia (N=912)
BGRU-RNN · group softmax912730 / 91 / 9178.87%0.9320.503
bart
Psych-201 frey2017risk (N=1,407)
BGRU-RNN · bernoulli1,4071,125 / 141 / 14198.22%0.8940.067
risk_mpl
Psych-201 frey2017mpl (N=1,405)
BMLP · bernoulli1,4051,124 / 141 / 14082.03%0.8920.412
sampling_choice
Psych-201 wulff2018sampling (all parseable sessions)
BGRU-RNN · bernoulli2,7552,204 / 276 / 27595.86%0.8470.138
skewness_choice
Psych-201 olschewski2024skewness (N=776)
BMLP · bernoulli776621 / 78 / 7758.62%0.6080.653
repeated_games
Psych-201 akata2023repeatedgames (N=176)
BGRU-RNN · bernoulli176141 / 18 / 1771.18%0.7520.562
things_odd_one_out
Psych-201 hebart2023things (N=12,240)
CMLP · bernoulli4,6294,044 / 289 / 29667.44%0.6990.594
rsa_pragmatics
Psych-201 hu2023lm-pragmatics (N=337)
CMLP · bernoulli337269 / 34 / 3488.93%0.7920.292

🏆 Agent 初步结果RERUN REQUIRED

正式表只接受 strict v2.1、observation_only.v1、且不向架构暴露 raw Gym reward 的运行。

协议有效 episodes0 / 200任务环境已修复:旧结果全部撤榜,等待正确版本重跑
当前可比较单元0strict v2.1 only
模型调用00 provider error
估算成本¥0.00当前 strict pilot

0 / 200 valid episodes · 0.0%

STRICT V2.1 ONLY:0 comparable episodes · observation_only.v1 · raw reward exposed = false。
LEGACY V1 · DIAGNOSTIC ONLY:旧版 375/990 episodes 已保留, 但不进入当前排名。历史失效审计:135 个旧实验单元已因任务环境修复失效;当前主结果目录仍有旧版本:135 个。只有当前协议和指纹一致的运行才会进入正式结果表。

可比较结果明细

Performance 使用每个任务自己的主指标;Normativity 衡量是否接近规范最优; Humanness 是人类参考模型给 Agent 实际选择的概率;Output Quality 记录解析兜底与 输出截断。各列不可互相替代。

0 rows

当前筛选没有可比较结果

未完成或协议不匹配的运行不会被补成成绩。

📐 公平性与解释边界

公平比较不只是“参数一样”,还要锁定环境、信息、预算、切分和统计单位。

人类模型边界:一个 bundle 是一个通过审计的模型产物;身份计数语义随原始数据而异,不能把所有 group records 当作全球去重真人。
任务迁移边界:协议、action 或公开信息不同的数据只作为新任务或 aligned variant,不会静默合并到现有任务来“凑 N”。