星空(中国)xingkong·官方网站

星空(中国)xingkong·官方网站

AgentOmnia:面向全场景能力扩展的Agent大模型后训练技术实践

近日,华为云大模型后训练团队发布技术报告《AgentOmnia: Scaling Agentic Models for Full-Scenario Applications》,提出面向全场景应用的Agent大模型后训练体系AgentOmnia,探索如何推动Agent从“在专项测试中表现优秀”进一步确保“能够适应不同用户、业务系统和复杂任务”,从而提升其面向多类真实应用场景的通用能力。

大语言模型驱动的Agent正从工具调用走向与用户和复杂环境的持续交互。然而,现有训练与评测通常围绕有限的领域或平台展开。模型在单项benchmark上取得高分,并不代表它能够稳定处理企业软件、消费者服务、办公文档、数据分析和复杂规划等不同任务。

针对这一问题,华为云大模型后训练团队提出AgentOmnia,探索Full-Scenario Agentic Scaling,即如何通过统一的任务空间,衔接数据构造、模型后训练、评测诊断与持续迭代,系统扩展Agent大模型的全场景能力。

以Qwen3-30B-A3B-Thinking-2507为基础模型进行Agentic后训练,AgentOmnia-30B-A3B在全场景测评基准OmniaBench挑战集上的任务通过率由9.16%提升至37.11%,提升覆盖 76/90 个L1 domain及全部capability和atomic difficulty维度。此外,AgentOmnia在OmniaBench、τ²-Bench、DeepPlanning和VitaBench四项基准的宏平均由22.86%提升至41.69%,综合得分超过多项同类型前沿工作。

999.jpg

AgentOmnia整体评测结果。 以Qwen3-30B-A3B-Thinking-2507为基础模型,展示AgentOmnia在四项基准宏平均、跨基准表现,以及领域、能力和原子难度维度上的提升。

AgentOmnia以全场景分类体系定义任务空间,以环境、任务和轨迹合成构建训练数据,再通过SFT与在线Agentic RL提升模型能力。评测结果和外部需求还可以进一步转化为PRD,指导下一轮针对性数据构造。

AgentOmnia全场景Agent大模型后训练体系。 全场景分类体系定义并度量任务空间,数据合成模块构建可执行环境、任务与可靠轨迹,SFT和在线Agentic RL将其转化为模型能力,评测诊断与PRD则进一步指导后续数据合成和模型迭代。

用统一坐标描述全场景能力

AgentOmnia建立了Domain × Capability × Atomic Difficulty三轴分类体系,覆盖To-Consumer、To-Business和To-Employee三类应用,包括90个一级领域、354个二级领域、10类能力和8类原子难度因素。

该体系既用于规划合成数据的覆盖范围,也用于评测后的细粒度诊断。同期发布的OmniaBench将其落实为包含1,431个任务的全场景Agent benchmark。

面向全场景Agent任务的三轴分类体系。Domain描述任务所在的应用场景,Capability描述完成任务所需的能力,Atomic Difficulty描述任务困难的原因,三者共同连接数据构造与评测诊断。

构建“困难但可验证”的训练数据

AgentOmnia共构建5,018个代码驱动的有状态环境、255,375个工具和52,361个任务。环境与任务采用双向合成,并通过三类任务管线扩展不同推理结构:

DAG-based synthesis构建多工具依赖与长链工作流;

Program-based synthesis表达分支、循环和运行时数据依赖;

Solver-based synthesis覆盖选择、调度、规划与全局约束优化。

与单纯依赖教师模型生成答案不同,AgentOmnia使用程序、求解器、状态变化、评分细则和验证器建立独立的正确性依据。在此基础上形成53K个SFT样本和5K个RL训练任务。

AgentOmnia的全场景数据合成体系。 双向环境—任务合成连接代码驱动的可执行环境、DAG、Program和Solver三类任务管线,并进一步生成经过校验的训练轨迹。

让困难任务真正产生学习信号

对于教师模型难以直接求解的任务,AgentOmnia在数据合成阶段引入特权指导,帮助教师生成可靠轨迹;最终保留的轨迹仍须通过任务评分、逻辑一致性、证据grounding和泄漏检查。

在线Agentic RL阶段,Rollback-based Curriculum Reinforcement Learning会在一组rollout全部失败时,从经过验证的轨迹前缀恢复探索,再随着模型能力提升逐步缩短前缀,使困难任务也能产生有效训练信号。

AgentOmnia SFT与Agentic RL后训练流程。 特权指导帮助生成困难任务的可靠监督轨迹,RCRL则为常规rollout全部失败的任务恢复学习信号。

从评测诊断走向持续演进

AgentOmnia利用Diagnose Agent从评测结果中自动抽取Product Requirements Documents(PRDs),明确目标场景、能力缺口、环境语义、任务结构、合成约束和验收条件,从而指导下一轮环境、任务和轨迹合成。另一方面,PRD作为AgentOmnia的自演进数据协议,还可以高效连接业务需求与模型研发,产品经理或业务人员撰写PRD即可直接引导后续的数据合成与模型演进。

依据OmniaBench诊断结果构建121个环境和804个任务,进行小规模的自演进技术验证。完成一轮增量训练后,OmniaBench挑战集由37.11%提升至38.49%,三项外部基准宏平均由43.22%提升至44.14%,初步证明了技术的有效性和泛化性。

PRD引导的模型持续演进闭环。 评测失败被聚合为能力诊断,并转化为包含环境、任务、验证和数据优先级要求的PRD,进一步指导下一轮数据合成与模型后训练。

团队后续将尝试在性能更强的新一代基础模型上验证这一体系,扩大数据合成与诊断规模,开展多轮自演进的实验。同时也将探索如何从产品文档、业务需求和代表性用户Query出发,构建更贴近真实产品运行条件的环境和任务,在华为云智果AgentArts、OfficeAce办公智能体等核心产品场景中完成后训练技术能力的迁移应用。

星空(中国)xingkong·官方网站 倡导尊重与保护知识产权。如发现本站文章存在版权等问题,烦请30天内提供版权疑问、身份证明、版权证明、联系方式等发邮件至1851688011@qq.com我们将及时沟通与处理。!:星空(中国)xingkong·官方网站 > 人工智能产业 > AI大模型 » AgentOmnia:面向全场景能力扩展的Agent大模型后训练技术实践

感觉不错,很赞哦! ()
分享到:

相关推荐

留言与评论(共有 0 条评论)
   
验证码: