Fisher-R1:用强化学习训练可靠的假设检验 Agent
论文阅读笔记:P-Bench 基准与 Fisher-R1——用合成任务 + SFT/RL 训练小模型,在统计方法选择与 p-value 计算上超越 GPT-5.4 与 DeepSeek-V4-Pro。
摘要:Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing
核心内容
这篇文章首先给出了一个 Benchmark,比较一个 Agent 系统在选择统计方法上的能力,然后利用强化学习的方法训练了一个小参数模型,在这个 Benchmark 下做出了比 GPT-5.4 和 DeepSeek-V4-Pro 更好的成绩。
现有问题
面对一些统计问题的时候,模型需要自己决策使用一些 Statistic Model 去计算 p-value 然后进行 hypothesis test,然而 p-value 本身是依赖统计模型的,模型如果无法选择正确的统计模型则没有办法可靠的实现这一点。现有的通用模型如 GPT 5.4 等可以可靠的看到数据、生成代码并且运行分析给出报告,但是他们选取的统计模型本身未必可靠,导致最终可能结果错误。

这里的数据集中有两个 outliers 导致数据拟合出现了误差,线性回归模型给出了 \(p<2.2\times 10^{-16}\) 的 p-value,然而 Spearman 给出 \(p=0.085\) 的结果,导致最终判断结果不同。事实上 GPT-5.4 已经意识到了 outliers 的问题,但是它仍然给出了错误回答。
P-Bench
一个专门为这种任务设计的 Banchmark。P-Bench 中的一个任务包括:
- 一个分析的请求,描述具体的科学问题和相关数据
- 一个 CSV 格式的数据集
模型必须根据这些内容选择一个统计方法,通过在沙箱中运行 R 代码计算得到 p-value 并且最终给出一个结果。这些统计方法不会提前给出给模型。最终的 Benchmark 包含了共 425 个测试,包括 203 个 Easy 和 222 个 Hard。这些问题来自权威数据集的真实执行路径,覆盖了 17 类真实的 hypothesis-testing methods,从而确保这个 benchmark 本身足够可靠。
Fisher-R1
这里作者设计了一个六维的任务空间,包括 method, scenario, sample size, effect size, prompt style 和 seed 等维度,使用 LLM 合成了一批数据集。然后使用 Claude Sonnet 4.6 作为教师模型按照固定工作流生成了一批分析路径,格式化为 ReAct 的格式之后,对基础模型进行了监督微调,接着使用 DAPO 算法进行 RL。
RL 的时候构造奖励函数:
\[R(o) = I_{\text{valid}}(o) \left(w_{p}r_{p}(o) + w_{c}r_{c}(o)\right),\quad w_{p} + w_{c} = 1\]这里取:
\[z(p) = \Phi^{-1} \left( 1-\frac{p}{2} \right), \quad r_{p}(o) = \exp\left( -\frac{\left|\min\{z(\hat{p}), 5\} - \min\{z(p^*), 5\}\right|}{\sigma} \right)\]这里选择 \(\Phi^{-1}\) 对概率做一个重新标度,更能真实反映 \(\Delta p\) 的统计学差异。然后根据同一组 rollout 中的奖励函数 \(R(o)\) 构造归一化的 \(\hat{A}\),并且抛弃掉 \(\sigma^2 = 0\) 的组。\(r_{c}\) 则取最终判断结果的正确性,给出正确判断则 \(r_{c}(o)=1\) 否则为 \(0\)。这里可以看到实际上 p-value 的正确性是一个比最终结果更加重要的信号,因此作者在这里把 \(w_{p}\) 取值为 \(0.9\)。作者在这里没有引入一个固定的奖励信号用于奖励与合成数据一致的方法选择,因为针对一个实际问题可能会有多种不同的但是同样足够合理的方法。
亮点与缺陷
这份研究首先构建了一个数据集用于可靠的测试一个模型在选择统计模型上的能力强弱。最终测试中使用 Qwen-2.5-Coder-14B 训练出来了 Fisher-R1-14B,并且在相关任务上明显优于同等参数量的通用大语言模型,达到甚至部分超越了闭源旗舰模型 GPT-5.4。这意味着当前的 LLM Agent 面对这类统计任务的时候仍然有很大的提升空间,并且针对性的 SFT+RL 可以有效的提高一个模型的相关能力。
这篇文章同样有缺陷在于,现在只是测试了在单个假设检验任务上的能力而没有多阶段分析的工作流,以及统计模型和方法本身的选择可能会具有不确定性,同时对于一些任务可能根本没有单一的可靠的假设检验方法。这些也是作者认为的未来更新方向。