技术博客 · 2026 年 7 月

规模化 AI4AI: 构建开放权重深度搜索智能体

XYZ-Aquila 是一组通过边界明确、以验证为门控的 AI-for-AI 闭环打造的搜索智能体:人类设定目标与验收门槛,AI 智能体在这一范围内诊断失败,并对数据、后训练、运行时、上下文管理与基础设施实施范围明确的改进。

26 页精简技术报告 2026 年 7 月 22 日 2.8 MB PDF
柱状图对比 XYZ-Aquila-mini、XYZ-Aquila-pro 与其他搜索智能体在六项基准上的表现
七项智能体搜索基准中六项的结果概览;图中沿用原报告英文标注。
01 · 评测结果

同等参数规模下,深度搜索表现强劲。

XYZ-Aquila-mini 与 XYZ-Aquila-pro 在 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity’s Last Exam 和 WideSearch 上接受评测。外部评测套件不参与日常优化,开发决策通过私有、答案隐藏的门控评测完成。这些结果评估的是最终系统,而不是任何单项改进的因果贡献。

78.8%
XYZ-Aquila-mini 的 BrowseComp 准确率。
<40B 表中领先
89.5%
XYZ-Aquila-mini 的 DeepSearchQA F1。
证据聚合
85.1%
XYZ-Aquila-pro 的 BrowseComp-ZH 准确率。
<400B 开放权重组领先
81.2%
XYZ-Aquila-pro 的 WideSearch Item F1 Max@4。
广域检索
小规模开放权重智能体

在报告列出的 <40B 开放权重对比中,XYZ-Aquila-mini 领先每一项基准。

模型BrowseCompBrowseComp-ZHDeepSearchQAGAIALiveBrowseCompHLEWideSearch
Agents-A175.596.029.6†47.6
Nex-N2-mini74.179.6†87.2†41.4†37.1†62.0
apodex-mini71.580.682.232.8†46.8
MiroThinker 1.7 mini67.980.334.9†36.473.3†
XYZ-Aquila-mini78.882.989.597.148.751.180.8

这是逐列比较:没有一个基线报告了全部七项结果。DeepSearchQA 使用 F1,WideSearch 使用 Item F1 Max@4。† 表示由报告作者在其评测设置中复现;无标记的基线值来自公开报告或基准提交。

大规模模型对比

XYZ-Aquila-pro 领先所列 <400B 开放权重组,并在更广泛对比中保持竞争力。

模型BrowseCompBrowseComp-ZHDeepSearchQALiveBrowseCompHLEWideSearch
开放权重智能体(参数量 <400B)
Nex-N2-Pro83.779.6†92.3†50.4†50.0†75.6
MiroThinker 1.774.075.334.1†42.9
apodex-1.075.582.684.649.0
XYZ-Aquila-pro84.885.192.553.753.381.2
前沿规模与闭源智能体
apodex-h190.384.194.460.8
DeepSeek-V4-Pro (1.6T, Max)83.438.3
Kimi-K2.6 (1T)83.292.531.755.580.8
Claude Opus 4.779.389.154.7
GPT-5.5 xhigh84.452.2
Qwen3.6-Plus74.3

<400B 开放权重组是主要的同规模对比,第二组只提供更广泛的参照。无标记的公开数值来自不同评测栈与日期,不能视为完全受控的横向比较。DeepSearchQA 使用 F1,WideSearch 使用 Item F1 Max@4;† 表示复现结果。

02 · AI4AI

递归改进,但边界先行。

AI4AI 用智能体改进智能体系统,但不把目标本身交给 AI。人类定义目标、代理评测集(proxy benchmarks)、资源范围、风险边界和验收标准;AI 智能体提出并执行范围明确的干预;评估器返回指标与获批诊断信息,但不会暴露答案或私有标签。每个候选方案在周期边界最多只能查询门控评估一次。

这个闭环具有递归性,却不是无限开放的。被采纳与被拒绝的尝试都会沉淀为可审计经验,让开发记忆成为可复用资产,而不是彼此割裂的实验堆积。

有边界的 AI4AI 闭环:人类定义契约,智能体负责诊断和干预,隔离评估器执行门控,结果沉淀到共享经验记忆

有边界的 AI4AI 闭环既保留足够的系统优化空间,也让每一步可检查;图中沿用原报告英文标注。

01
定义契约确定目标能力、基准、工具、预算和验收门槛。
02
诊断失败智能体分析轨迹、日志、审查意见、成本和可靠性信号。
03
提出改进候选方案可涉及数据、SFT、运行时、上下文策略、基础设施或仅通过初筛的 RL。
04
门控采纳隔离评估器衡量候选方案,但不暴露私有标签或答案。
05
沉淀经验采纳与拒绝记录都连同来源和决策状态一并保留。
03 · 系统

XYZ-Aquila 是完整的系统配置,而不只是模型权重检查点。

XYZ-Aquila-mini 采用 Qwen3.6-35B-A3B 基座,XYZ-Aquila-pro 采用 Qwen3.5-397B-A17B。每个发布系统都把相应基座与图谱约束的数据构建、状态忠实的监督后训练、固定三工具执行协议、上下文管理、回放基础设施和版本化评测门控组合起来。

构造图谱约束、工具可达的搜索任务,同时将答案保留在评估器侧的数据流程
数据

图谱约束、工具可达的任务。

AI4AI 引导任务构造聚焦于能够通过可观察搜索行为解决、而不是依赖记忆答案的问题。答案隐藏机制确保执行任务的智能体无法接触评估器侧标签。

从每一步精确可见状态生成训练样本的状态忠实监督微调流程
后训练

面向长轨迹的状态忠实 SFT。

训练样本与每个回合中智能体实际可见的状态严格对齐,既保留当时真正面对的决策条件,也支持长序列打包与经过上下文管理的执行轨迹。

保留固定搜索、抓取和 Python 工具并记录精确回放状态的执行框架
运行时

固定接口,精确回放。

智能体只能在固定语义、可见上下文上限与回合预算内调用 searchscrapepython。只有在不增强任务接口的前提下改善执行或可观测性,运行时和回放改进才可被采纳。

堆叠柱状图展示六项基准中搜索、抓取与 Python 调用占比的差异
行为

工具使用会随基准自适应变化。

在 BrowseComp、BrowseComp-ZH 与 LiveBrowseComp 中,搜索占采样调用的 78%–84%;在 DeepSearchQA 与 GAIA 中,抓取和 Python 合计占 54%–55%。强搜索智能体需要灵活分配工具,而不是套用固定交互模板。

04 · 边界

哪些已经采纳,哪些仅通过筛选,哪些仍待验证。

发布的 XYZ-Aquila-mini 与 XYZ-Aquila-pro 已纳入数据、SFT、运行时、上下文和回放方面的改进。基于过程奖励的 RL 方案通过了低成本筛选,但尚未走完整训练与门控路径,因此不计入本次发布系统。

三项原则让改进闭环保持可信。

隔离性。

外部基准不进入优化状态,只用于最终评测或经过明确授权的评测。

不变性。

候选方案不能通过增加工具、扩大可见上下文或提高回合预算来获得增益。

可审计性。

每个被监督或被分析的决策,都绑定到当时真正可见的精确状态。

局限与后续工作

报告支持的是特定契约下、有边界的系统优化结论。它尚不能证明哪些组件在因果上不可或缺,也没有证明开发过程具备端到端的资源效率,更没有证明这套方法能够自然迁移到搜索之外。

因果归因

研究评估的是最终系统,并未完整拆解数据、训练、运行时与上下文改进之间的路径依赖。仍需受控重训与针对高交互组件的析因消融实验。

自适应过拟合

评估器隔离只能降低、不能消除对私有开发分布的适应。轮换数据划分、刷新隐藏留出集与定期迁移审计仍然必要。

可比性与成本

部分基线来自不同工具、评审器、日期和实时网络条件。报告也尚未提供开发算力、延迟、工具、评估器及人工审查的端到端成本。

RL 与迁移

过程奖励 RL 方案只通过了低成本筛选,不属于两个发布系统。实证验证仍局限于深度搜索任务和两个模型基座。