PARSER Read in Parallel, Reason in Depth for Long-Context LLM Agents

文档的顺序不应决定推理的顺序。

Kun Li* Zexuan Qiu* Tianhua Zhang* Irwin King Helen Meng

香港中文大学 *同等贡献

896K评测上下文
+12.0在 896K 上提升
11×更低延迟
01

引言

将阅读与推理解耦。

sequential memory agents 逐块阅读长文档,并维护一份紧凑的记忆状态。这把文档遍历与推理深度绑在一起,使准确率对证据出现位置敏感,并迫使延迟随文档长度增长。

PARSER 把文档长度从顺序深度变成并行宽度。轻量级子智能体并发阅读每一块,主智能体则迭代提出聚焦问题、收集证据,并只在问题真正需要的轮次上推理。

1

并行阅读

每个文档块由专属阅读器并发、对称地检查。

2

深度推理

主智能体随着新证据出现,在 scatter–gather 轮次中不断细化查询。

3

RL 训练的协同

只对主策略用可验证奖励优化;轻量阅读器保持冻结。

“并行阅读文档。把顺序计算留给推理。”
02

方法

并行阅读,顺序推理

给定问题 q 与长文档 D,PARSER 先将 D 切成 T 个定长块。多跳证据通常稀疏且分布在这些块中,因此核心挑战不只是把文档塞进上下文窗口,而是按正确的推理顺序定位并组合正确证据。

sequential memory agents 反复把每个新块压缩进文本记忆。 PARSER 则把文档长度变成并行宽度。 每一轮,全部 T 个子智能体并发阅读各自块,主智能体只把 K 轮问题驱动的推理保持为顺序。

sequential memory agents 与 PARSER 并行阅读流程的对比
PARSER 用 K 轮推理取代 T 次依赖的记忆更新, 所有块级阅读并行执行
01 / 并行阅读

并行块阅读器

每个冻结的子智能体永久绑定一个短块。收到聚焦查询后,它只检查该块,返回有据发现或弃权。全部 T 个阅读器并发执行,使每个块无论在文档中的位置如何都获得对称访问。

02 / 推理

问题驱动的主智能体

主智能体看到原始问题和已收集发现,但不看原始文档 token。在 ReAct 风格循环中,它决定发出一条或多条新查询,或提交最终答案。

03 / 自适应

多轮 scatter–gather

k 轮,聚焦查询 scatter 到所有阅读器,非空发现 gather 进主智能体历史。这些发现条件化第 k + 1 轮,使后续跳转无需循环压缩或不可逆信息损失即可被发现。

04 / 优化

智能体强化学习

只优化主策略;所有阅读器保持冻结。GRPO 用二元精确匹配结果奖励来学习查询分解、阅读器协同与作答时机。汇集的观察 token 被掩码,使梯度只作用于主智能体决策。

关键路径
Sequential memory: O(T) PARSER: O(K),其中 K ≪ T
03

实验

在极端长度上保持稳定准确率。

01 / 主要结果 在 HotpotQA 与 2WikiMultiHopQA 上,从 7K 到 896K token,PARSER 几乎对长度不变,而 full-context 与 sequential-memory 方法下降。

HotpotQA · ID 2WikiMultiHopQA · OOD Sub_EM · 3 次运行
基线范式

Full-context 直接把问题与整篇文档送入一次模型调用,不做分块,也不用外部记忆。

MemAgent 顺序阅读文档块,反复把当前块与上一状态压缩成定长文本记忆,再据此给出最终答案。

HOTPOTQA · 分布内

不同上下文长度上的准确率

Sub_EM (%) · 3 次运行平均

骨干 方法 507K 10014K 20028K 40056K 800112K 1600224K 3200448K 6400896K Max δpp 平均
DeepSeek-V4-Pro Full-context (non-think) 78.1277.3476.5679.69 77.3475.7873.4462.50 17.1975.10
Full-context (think-max) 82.0382.8180.4780.47 80.4781.2577.3478.91 5.4780.47
Qwen3.5-4B Full-context (non-think) 75.7875.7871.8874.22 67.9761.7253.1334.38 41.4064.36
Full-context (think) 80.4778.9178.1276.56 74.2260.9446.0931.25 49.2265.82
MemAgent 81.2581.5183.5977.86 77.8679.6973.9672.92 10.6778.58
ReMemR1 82.0379.9582.0378.91 77.8679.9577.0873.44 8.5978.91
PARSER 85.6884.64 83.6085.68 85.4283.07 83.0785.42 2.61 84.57
Qwen3.5-9B Full-context (non-think) 75.0072.6672.6671.88 70.3165.6258.5947.66 27.3466.80
Full-context (think) 77.3474.2278.9176.56 77.3465.6253.9146.88 32.0368.85
MemAgent 81.7780.7382.0379.95 79.9581.2579.6975.00 7.0380.05
ReMemR1 81.2579.6977.6078.39 78.1378.1377.8676.04 5.2178.39
PARSER 86.7288.80 87.2485.68 86.4686.72 86.7285.94 3.12 86.79

列标题为段落数与大致总 token 长度。Max δ 为八个上下文长度上的极差(最大 − 最小)。

HotpotQA · 4B

84.6% 平均准确率 比最强 sequential baseline 高 5.7 个百分点

HotpotQA · 9B

86.8% 平均准确率 比 DeepSeek-V4-Pro 高 6.3 个百分点

896K tokens · 4B

+12.0 百分点 相对最强 sequential memory baseline
长度稳定性 · HOTPOTQA

Max δ 控制在 3 个百分点以内

从 7K 到 896K token,PARSER 的准确率极差在 4B 骨干上仅为 2.61 个百分点,在 9B 上为 3.12 个百分点。sequential memory 与 full-context 方法随文档变长会波动数十个百分点。

02 / 受控分析

对证据位置、顺序与距离的变化稳健。

A

证据位置

在约 894K token 的文档中,全部支持段落被放入一个 10 百分位窗口,并从 0–10% 扫到 90–100%。

PARSER 在全部十个位置区间上保持稳定。sequential memory agents 在证据位于文档中部时下降,因为早期发现最容易被覆盖。

B

证据顺序

512 道两跳桥接比较题各配两份 894K token 文档,仅在支持段落遵循或颠倒其标注逻辑顺序上不同。

支持段落被颠倒时,PARSER 仍保持准确率。sequential memory agents 下降,因为前一跳可能在其相关性变得可见之前就被挤出记忆。

C

证据距离

对需要两段证据的问题,在两者之间插入数量不等的干扰段落。

两段证据间距增大时,PARSER 保持平稳。sequential methods 恶化,因为第一段发现必须挺过更多次记忆更新,第二跳才到来。

PARSER 在受控证据位置、顺序与距离下的稳健性
证据放置变化时,sequential methods 准确率大幅波动。PARSER 保持稳定,因为每个块都能在不断演化的查询下被再次访问。
03 / 推理效率

延迟优势随上下文长度扩大。

测量协议

并发度为 1 时的摊销墙上时钟时间

工作负载。我们在 50 到 6,400 段共八种文档长度上运行同一组 128 道 HotpotQA 题,对应约 7K–896K token。

计时与比值。对每种长度,测量完成全部 128 条样本所需的墙上时钟时间并除以 128,得到每条样本的摊销时间。图中每一点为 MemAgent 摊销时间 ÷ PARSER 摊销时间;在 896K token 上,876.20s ÷ 78.22s 得到 11.2× 加速。

并发度 = 1

相对 MemAgent 的加速

比值 = MemAgent 延迟 ÷ PARSER 延迟

PARSER 相对 MemAgent 的延迟加速随上下文长度变化 加速从 7K token 的 2.0 倍增至 896K token 的 11.2 倍。 12× 2.0× 2.7× 4.5× 6.7× 8.5× 9.9× 10.4× 11.2× 7K 14K 28K 56K 112K 224K 448K 896K 上下文长度(token)
单请求并发下,PARSER 的墙上时钟延迟从 5.33s 增至 78.22s,而 MemAgent 从 10.56s 增至 876.20s。
差距为何扩大

推理步数留在关键路径上

MemAgent 一块接一块地更新记忆,因此其顺序深度随文档增长。PARSER 在同一轮阅读所有块;只有主智能体的问题驱动轮次保持串行。

每一长度都使用同一组 HotpotQA 题,因此 PARSER 的步数从 7K 到 896K token 都接近 4,而 MemAgent 从 3.1 升到 177。

PARSER 每个长度约 4 步 MemAgent 3.1 → 177 步
MemAgent 与 PARSER 的推理步数随上下文长度变化 MemAgent 的步数从 7K token 的 3.1 增至 896K token 的 177。PARSER 在每个长度都接近 4 步。 200 150 100 50 0 177 ≈4 7K 14K 28K 56K 112K 224K 448K 896K 上下文长度(token)
MemAgent 的顺序深度跟随文档块数,PARSER 的顺序深度跟随推理跳数。
04 / 其他分析

轻量阅读器、短块、可替换实现。

1

子智能体规模

固定 4B 主智能体时,子智能体从 2B 升到 4B,HotpotQA 平均准确率从 78.3% 升到 84.6%;9B 阅读器随后饱和于 84.8%。经过问题分解与分块后,每个子智能体只需在短上下文上回答聚焦查询,轻量 4B 阅读器已经足够。

2

块大小

把整篇文档交给单个子智能体,平均准确率从 84.6% 降到 73.8%,最长子集损失最大。块从 4K 增到 131K token 时准确率也会下降。短块让每个阅读器留在紧凑窗口内,避免 context rot。

3

与子智能体实现的兼容性

同一主智能体无需重训,即可协同 thinking 与 DCI 子智能体,并超过对应独立基线:thinking 为 85.6% 对 65.8%,DCI 为 84.7% 对 75.6%。主智能体的协同并不绑定某一种阅读器设计。

05 / Case study
PARSER-4B 2WikiMultiHopQA 6400 paragraphs

Which film has the director who died earlier, Everything's Ducky or Karthika (Film)?

The lead agent broadcasts parallel director queries, then parallel death-date queries, and selects the film whose director died earlier.

Question User

Which film has the director who died earlier, Everything's Ducky or Karthika (Film)?

Step 1 Find both directors
<think>

This is a multi-hop question that requires information about two films: “Everything's Ducky” and “Karthika”. I need to find who directed each film, then determine which director died earlier. Let me start by querying the agents for the directors.

</think>
query_agents Everything's Ducky film director
query_agents Karthika film director

Observations

agent_15

Everything's Ducky is a 1961 comedy film directed by Don Taylor

Don Taylor
agent_121

Karthika is a 1968 Indian Malayalam film, directed by M. Krishnan Nair

M. Krishnan Nair
Step 2 Compare death dates
<think>

“Everything's Ducky” is directed by Don Taylor; “Karthika (Film)” is directed by M. Krishnan Nair. Now I need to find which of these two directors died earlier.

</think>
query_agents Don Taylor director death date
query_agents M. Krishnan Nair death date

Observations

agent_172

Donald Richie Taylor (December 13, 1920 – December 29, 1998) was an American actor and film director.

December 29, 1998
agent_175

M. Krishnan Nair (2 November 1926 – 10 May 2001 in Thiruvananthapuram) was an Indian film director of Malayalam films.

10 May 2001
Step 3 Compose the answer
<think>

Don Taylor died on December 29, 1998; M. Krishnan Nair died on 10 May 2001. Don Taylor died earlier, so the film with the earlier-deceased director is “Everything's Ducky”.

</think>

<answer> Everything's Ducky </answer>

Success case · PARSER-4B on 2WikiMultiHopQA (6400 paragraphs / ~896K tokens).

04

工程设计

完全异步的强化学习训练

SGLang Rollouts持续生成
轨迹参数
Megatron Trainer持续策略更新
SGLang Model Gateway

持续服务冻结的子智能体

关键系统收益 消除子智能体空闲时间

策略更新与 rollout 生成在分离的计算池上持续运行。主策略更新期间,子智能体集群继续服务 rollout 请求,而不是等待下一同步训练阶段。

  • 资源解耦Rollout 与 actor 训练异步进行。
  • 缓存感知路由SGLang Radix Cache 跨轮复用固定块前缀。
05

结论

按问题推理,而不是按文档顺序推理。

PARSER 表明,有效的长上下文推理并不要求每一步都带着整篇文档前进。通过把局部阅读与全局推理分开,它在极端长度上保持准确,并对证据放置位置稳健。

由此得到的架构也易于优化:冻结轻量阅读器,用可验证奖励训练一个主策略,再通过并行宽度扩展文档覆盖。

06

引用

引用 PARSER

@misc{li2026parserreadparallelreason,
      title={PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents}, 
      author={Kun Li and Zexuan Qiu and Tianhua Zhang and Irwin King and Helen Meng},
      year={2026},
      eprint={2609.06702},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2609.06702}, 
}