同等参数规模下,深度搜索表现强劲。
XYZ-Aquila-mini 与 XYZ-Aquila-pro 在 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity’s Last Exam 和 WideSearch 上接受评测。外部评测套件不参与日常优化,开发决策通过私有、答案隐藏的门控评测完成。这些结果评估的是最终系统,而不是任何单项改进的因果贡献。
在报告列出的 <40B 开放权重对比中,XYZ-Aquila-mini 领先每一项基准。
| 模型 | BrowseComp | BrowseComp-ZH | DeepSearchQA | GAIA | LiveBrowseComp | HLE | WideSearch |
|---|---|---|---|---|---|---|---|
| Agents-A1 | 75.5 | — | — | 96.0 | 29.6† | 47.6 | — |
| Nex-N2-mini | 74.1 | 79.6† | 87.2† | — | 41.4† | 37.1† | 62.0 |
| apodex-mini | 71.5 | 80.6 | 82.2 | — | 32.8† | 46.8 | — |
| MiroThinker 1.7 mini | 67.9 | — | — | 80.3 | 34.9† | 36.4 | 73.3† |
| XYZ-Aquila-mini | 78.8 | 82.9 | 89.5 | 97.1 | 48.7 | 51.1 | 80.8 |
这是逐列比较:没有一个基线报告了全部七项结果。DeepSearchQA 使用 F1,WideSearch 使用 Item F1 Max@4。† 表示由报告作者在其评测设置中复现;无标记的基线值来自公开报告或基准提交。
XYZ-Aquila-pro 领先所列 <400B 开放权重组,并在更广泛对比中保持竞争力。
| 模型 | BrowseComp | BrowseComp-ZH | DeepSearchQA | LiveBrowseComp | HLE | WideSearch |
|---|---|---|---|---|---|---|
| 开放权重智能体(参数量 <400B) | ||||||
| Nex-N2-Pro | 83.7 | 79.6† | 92.3† | 50.4† | 50.0† | 75.6 |
| MiroThinker 1.7 | 74.0 | 75.3 | — | 34.1† | 42.9 | — |
| apodex-1.0 | 75.5 | 82.6 | 84.6 | — | 49.0 | — |
| XYZ-Aquila-pro | 84.8 | 85.1 | 92.5 | 53.7 | 53.3 | 81.2 |
| 前沿规模与闭源智能体 | ||||||
| apodex-h1 | 90.3 | 84.1 | 94.4 | — | 60.8 | — |
| DeepSeek-V4-Pro (1.6T, Max) | 83.4 | — | — | 38.3 | — | — |
| Kimi-K2.6 (1T) | 83.2 | — | 92.5 | 31.7 | 55.5 | 80.8 |
| Claude Opus 4.7 | 79.3 | — | 89.1 | — | 54.7 | — |
| GPT-5.5 xhigh | 84.4 | — | — | — | 52.2 | — |
| Qwen3.6-Plus | — | — | — | — | — | 74.3 |
<400B 开放权重组是主要的同规模对比,第二组只提供更广泛的参照。无标记的公开数值来自不同评测栈与日期,不能视为完全受控的横向比较。DeepSearchQA 使用 F1,WideSearch 使用 Item F1 Max@4;† 表示复现结果。
递归改进,但边界先行。
AI4AI 用智能体改进智能体系统,但不把目标本身交给 AI。人类定义目标、代理评测集(proxy benchmarks)、资源范围、风险边界和验收标准;AI 智能体提出并执行范围明确的干预;评估器返回指标与获批诊断信息,但不会暴露答案或私有标签。每个候选方案在周期边界最多只能查询门控评估一次。
这个闭环具有递归性,却不是无限开放的。被采纳与被拒绝的尝试都会沉淀为可审计经验,让开发记忆成为可复用资产,而不是彼此割裂的实验堆积。
有边界的 AI4AI 闭环既保留足够的系统优化空间,也让每一步可检查;图中沿用原报告英文标注。
XYZ-Aquila 是完整的系统配置,而不只是模型权重检查点。
XYZ-Aquila-mini 采用 Qwen3.6-35B-A3B 基座,XYZ-Aquila-pro 采用 Qwen3.5-397B-A17B。每个发布系统都把相应基座与图谱约束的数据构建、状态忠实的监督后训练、固定三工具执行协议、上下文管理、回放基础设施和版本化评测门控组合起来。
图谱约束、工具可达的任务。
AI4AI 引导任务构造聚焦于能够通过可观察搜索行为解决、而不是依赖记忆答案的问题。答案隐藏机制确保执行任务的智能体无法接触评估器侧标签。
面向长轨迹的状态忠实 SFT。
训练样本与每个回合中智能体实际可见的状态严格对齐,既保留当时真正面对的决策条件,也支持长序列打包与经过上下文管理的执行轨迹。
固定接口,精确回放。
智能体只能在固定语义、可见上下文上限与回合预算内调用 search、scrape 和 python。只有在不增强任务接口的前提下改善执行或可观测性,运行时和回放改进才可被采纳。
工具使用会随基准自适应变化。
在 BrowseComp、BrowseComp-ZH 与 LiveBrowseComp 中,搜索占采样调用的 78%–84%;在 DeepSearchQA 与 GAIA 中,抓取和 Python 合计占 54%–55%。强搜索智能体需要灵活分配工具,而不是套用固定交互模板。
哪些已经采纳,哪些仅通过筛选,哪些仍待验证。
发布的 XYZ-Aquila-mini 与 XYZ-Aquila-pro 已纳入数据、SFT、运行时、上下文和回放方面的改进。基于过程奖励的 RL 方案通过了低成本筛选,但尚未走完整训练与门控路径,因此不计入本次发布系统。
三项原则让改进闭环保持可信。
外部基准不进入优化状态,只用于最终评测或经过明确授权的评测。
候选方案不能通过增加工具、扩大可见上下文或提高回合预算来获得增益。
每个被监督或被分析的决策,都绑定到当时真正可见的精确状态。
局限与后续工作
报告支持的是特定契约下、有边界的系统优化结论。它尚不能证明哪些组件在因果上不可或缺,也没有证明开发过程具备端到端的资源效率,更没有证明这套方法能够自然迁移到搜索之外。
因果归因
研究评估的是最终系统,并未完整拆解数据、训练、运行时与上下文改进之间的路径依赖。仍需受控重训与针对高交互组件的析因消融实验。
自适应过拟合
评估器隔离只能降低、不能消除对私有开发分布的适应。轮换数据划分、刷新隐藏留出集与定期迁移审计仍然必要。
可比性与成本
部分基线来自不同工具、评审器、日期和实时网络条件。报告也尚未提供开发算力、延迟、工具、评估器及人工审查的端到端成本。
RL 与迁移
过程奖励 RL 方案只通过了低成本筛选,不属于两个发布系统。实证验证仍局限于深度搜索任务和两个模型基座。