并行阅读
每个文档块由专属阅读器并发、对称地检查。
文档的顺序不应决定推理的顺序。
香港中文大学 *同等贡献
引言
sequential memory agents 逐块阅读长文档,并维护一份紧凑的记忆状态。这把文档遍历与推理深度绑在一起,使准确率对证据出现位置敏感,并迫使延迟随文档长度增长。
PARSER 把文档长度从顺序深度变成并行宽度。轻量级子智能体并发阅读每一块,主智能体则迭代提出聚焦问题、收集证据,并只在问题真正需要的轮次上推理。
每个文档块由专属阅读器并发、对称地检查。
主智能体随着新证据出现,在 scatter–gather 轮次中不断细化查询。
只对主策略用可验证奖励优化;轻量阅读器保持冻结。
“并行阅读文档。把顺序计算留给推理。”
方法
给定问题 q 与长文档 D,PARSER 先将 D 切成 T 个定长块。多跳证据通常稀疏且分布在这些块中,因此核心挑战不只是把文档塞进上下文窗口,而是按正确的推理顺序定位并组合正确证据。
sequential memory agents 反复把每个新块压缩进文本记忆。 PARSER 则把文档长度变成并行宽度。 每一轮,全部 T 个子智能体并发阅读各自块,主智能体只把 K 轮问题驱动的推理保持为顺序。
每个冻结的子智能体永久绑定一个短块。收到聚焦查询后,它只检查该块,返回有据发现或弃权。全部 T 个阅读器并发执行,使每个块无论在文档中的位置如何都获得对称访问。
主智能体看到原始问题和已收集发现,但不看原始文档 token。在 ReAct 风格循环中,它决定发出一条或多条新查询,或提交最终答案。
第 k 轮,聚焦查询 scatter 到所有阅读器,非空发现 gather 进主智能体历史。这些发现条件化第 k + 1 轮,使后续跳转无需循环压缩或不可逆信息损失即可被发现。
只优化主策略;所有阅读器保持冻结。GRPO 用二元精确匹配结果奖励来学习查询分解、阅读器协同与作答时机。汇集的观察 token 被掩码,使梯度只作用于主智能体决策。
实验
01 / 主要结果 在 HotpotQA 与 2WikiMultiHopQA 上,从 7K 到 896K token,PARSER 几乎对长度不变,而 full-context 与 sequential-memory 方法下降。
Full-context 直接把问题与整篇文档送入一次模型调用,不做分块,也不用外部记忆。
MemAgent 顺序阅读文档块,反复把当前块与上一状态压缩成定长文本记忆,再据此给出最终答案。
Sub_EM (%) · 3 次运行平均
| 骨干 | 方法 | 507K | 10014K | 20028K | 40056K | 800112K | 1600224K | 3200448K | 6400896K | Max δpp | 平均 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek-V4-Pro | Full-context (non-think) | 78.12 | 77.34 | 76.56 | 79.69 | 77.34 | 75.78 | 73.44 | 62.50 | 17.19 | 75.10 |
| Full-context (think-max) | 82.03 | 82.81 | 80.47 | 80.47 | 80.47 | 81.25 | 77.34 | 78.91 | 5.47 | 80.47 | |
| Qwen3.5-4B | Full-context (non-think) | 75.78 | 75.78 | 71.88 | 74.22 | 67.97 | 61.72 | 53.13 | 34.38 | 41.40 | 64.36 |
| Full-context (think) | 80.47 | 78.91 | 78.12 | 76.56 | 74.22 | 60.94 | 46.09 | 31.25 | 49.22 | 65.82 | |
| MemAgent | 81.25 | 81.51 | 83.59 | 77.86 | 77.86 | 79.69 | 73.96 | 72.92 | 10.67 | 78.58 | |
| ReMemR1 | 82.03 | 79.95 | 82.03 | 78.91 | 77.86 | 79.95 | 77.08 | 73.44 | 8.59 | 78.91 | |
| PARSER | 85.68 | 84.64 | 83.60 | 85.68 | 85.42 | 83.07 | 83.07 | 85.42 | 2.61 | 84.57 | |
| Qwen3.5-9B | Full-context (non-think) | 75.00 | 72.66 | 72.66 | 71.88 | 70.31 | 65.62 | 58.59 | 47.66 | 27.34 | 66.80 |
| Full-context (think) | 77.34 | 74.22 | 78.91 | 76.56 | 77.34 | 65.62 | 53.91 | 46.88 | 32.03 | 68.85 | |
| MemAgent | 81.77 | 80.73 | 82.03 | 79.95 | 79.95 | 81.25 | 79.69 | 75.00 | 7.03 | 80.05 | |
| ReMemR1 | 81.25 | 79.69 | 77.60 | 78.39 | 78.13 | 78.13 | 77.86 | 76.04 | 5.21 | 78.39 | |
| PARSER | 86.72 | 88.80 | 87.24 | 85.68 | 86.46 | 86.72 | 86.72 | 85.94 | 3.12 | 86.79 |
列标题为段落数与大致总 token 长度。Max δ 为八个上下文长度上的极差(最大 − 最小)。
HotpotQA · 4B
84.6% 平均准确率 比最强 sequential baseline 高 5.7 个百分点HotpotQA · 9B
86.8% 平均准确率 比 DeepSeek-V4-Pro 高 6.3 个百分点896K tokens · 4B
+12.0 百分点 相对最强 sequential memory baseline从 7K 到 896K token,PARSER 的准确率极差在 4B 骨干上仅为 2.61 个百分点,在 9B 上为 3.12 个百分点。sequential memory 与 full-context 方法随文档变长会波动数十个百分点。
在约 894K token 的文档中,全部支持段落被放入一个 10 百分位窗口,并从 0–10% 扫到 90–100%。
PARSER 在全部十个位置区间上保持稳定。sequential memory agents 在证据位于文档中部时下降,因为早期发现最容易被覆盖。
512 道两跳桥接比较题各配两份 894K token 文档,仅在支持段落遵循或颠倒其标注逻辑顺序上不同。
支持段落被颠倒时,PARSER 仍保持准确率。sequential memory agents 下降,因为前一跳可能在其相关性变得可见之前就被挤出记忆。
对需要两段证据的问题,在两者之间插入数量不等的干扰段落。
两段证据间距增大时,PARSER 保持平稳。sequential methods 恶化,因为第一段发现必须挺过更多次记忆更新,第二跳才到来。
工作负载。我们在 50 到 6,400 段共八种文档长度上运行同一组 128 道 HotpotQA 题,对应约 7K–896K token。
计时与比值。对每种长度,测量完成全部 128 条样本所需的墙上时钟时间并除以 128,得到每条样本的摊销时间。图中每一点为 MemAgent 摊销时间 ÷ PARSER 摊销时间;在 896K token 上,876.20s ÷ 78.22s 得到 11.2× 加速。
比值 = MemAgent 延迟 ÷ PARSER 延迟
MemAgent 一块接一块地更新记忆,因此其顺序深度随文档增长。PARSER 在同一轮阅读所有块;只有主智能体的问题驱动轮次保持串行。
每一长度都使用同一组 HotpotQA 题,因此 PARSER 的步数从 7K 到 896K token 都接近 4,而 MemAgent 从 3.1 升到 177。
固定 4B 主智能体时,子智能体从 2B 升到 4B,HotpotQA 平均准确率从 78.3% 升到 84.6%;9B 阅读器随后饱和于 84.8%。经过问题分解与分块后,每个子智能体只需在短上下文上回答聚焦查询,轻量 4B 阅读器已经足够。
把整篇文档交给单个子智能体,平均准确率从 84.6% 降到 73.8%,最长子集损失最大。块从 4K 增到 131K token 时准确率也会下降。短块让每个阅读器留在紧凑窗口内,避免 context rot。
同一主智能体无需重训,即可协同 thinking 与 DCI 子智能体,并超过对应独立基线:thinking 为 85.6% 对 65.8%,DCI 为 84.7% 对 75.6%。主智能体的协同并不绑定某一种阅读器设计。
The lead agent broadcasts parallel director queries, then parallel death-date queries, and selects the film whose director died earlier.
Which film has the director who died earlier, Everything's Ducky or Karthika (Film)?
<think>
This is a multi-hop question that requires information about two films: “Everything's Ducky” and “Karthika”. I need to find who directed each film, then determine which director died earlier. Let me start by querying the agents for the directors.
</think>
Observations
Everything's Ducky is a 1961 comedy film directed by Don Taylor
Don TaylorKarthika is a 1968 Indian Malayalam film, directed by M. Krishnan Nair
M. Krishnan Nair<think>
“Everything's Ducky” is directed by Don Taylor; “Karthika (Film)” is directed by M. Krishnan Nair. Now I need to find which of these two directors died earlier.
</think>
Observations
Donald Richie Taylor (December 13, 1920 – December 29, 1998) was an American actor and film director.
December 29, 1998M. Krishnan Nair (2 November 1926 – 10 May 2001 in Thiruvananthapuram) was an Indian film director of Malayalam films.
10 May 2001<think>
Don Taylor died on December 29, 1998; M. Krishnan Nair died on 10 May 2001. Don Taylor died earlier, so the film with the earlier-deceased director is “Everything's Ducky”.
</think>
<answer>
Everything's Ducky
</answer>
Success case · PARSER-4B on 2WikiMultiHopQA (6400 paragraphs / ~896K tokens).
工程设计
持续服务冻结的子智能体
策略更新与 rollout 生成在分离的计算池上持续运行。主策略更新期间,子智能体集群继续服务 rollout 请求,而不是等待下一同步训练阶段。
结论
PARSER 表明,有效的长上下文推理并不要求每一步都带着整篇文档前进。通过把局部阅读与全局推理分开,它在极端长度上保持准确,并对证据放置位置稳健。
由此得到的架构也易于优化:冻结轻量阅读器,用可验证奖励训练一个主策略,再通过并行宽度扩展文档覆盖。
引用
@misc{li2026parserreadparallelreason,
title={PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents},
author={Kun Li and Zexuan Qiu and Tianhua Zhang and Irwin King and Helen Meng},
year={2026},
eprint={2609.06702},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2609.06702},
}