摘要
今天,我们正式推出 Hyra-1.0,这是 Hyra(Hunyuan Research Agent,混元研究智能体)的首个版本——一个具备递归自我改进(recursive self-improvement)能力的智能体,专为性能驱动的研究和工程任务打造。
过去一年中,递归自我改进(RSI)和自动化研究已成为 AI 领域最活跃的前沿方向之一。Google DeepMind 的 AlphaEvolve 找到了仅用 48 次标量乘法完成 4×4 复值矩阵相乘的方法;Together AI 在开放环境中使用智能体团队,将 11 维接吻数(kissing number)的已知下界从 593 提升到 604;Andrej Karpathy 的 autoresearch 引入了用于自主模型训练研究的最小循环。此后,一波基于进化的系统相继涌现:智能体正在超越封闭基准,开始在开放科学发现中超越人类。
今天,我们推出 Hyra:一个简单而有效的系统,将智能和算力转化为更丰富、更多样化、更高价值场景中的切实实用价值。在腾讯,机会尤其广泛。除了公开基准,Hyra 还可以在产品系统、真实 AI 研发管线、科学研究乃至工业环境中学习和进化。下面,我们将展示 Hyra 如何使用一个简单的通用 Harness,在涵盖 AI for AI、AI for Science 和 AI for Fun 的十多个场景中创造价值。
Hyra Harness
Hyra 的 Harness 遵循"苦涩的教训"(The Bitter Lesson)原则:保持框架轻量简洁,同时给予智能体广阔的行动空间。给定任务描述后,Hyra 运行一个持续循环,借鉴过去的经验探索更好的解决方案。这些经验包括执行日志、评估器反馈、源代码以及之前解决方案的其他产物。循环持续进行,直到智能体选择停止或预算耗尽,然后返回找到的最佳解决方案。Hyra Harness 包括:
- 上下文智能体(Context Agent):维护经验库(Experience Bank, EB),记录提出的解决方案及其评估结果,并从 EB 中为任务队列综合"灵感"(inspirations)。每个灵感是一个上下文包,可能包含来自整个 EB 的代码、文件、产物和日志。它捕捉 Hyra 在探索过程中学到的知识,帮助激发更强的解决方案。
- 多个提案智能体(Proposal Agents):每个智能体从任务队列中获取一个灵感上下文,对其进行反思,并编写一个新的解决方案,以
solution/目录形式呈现,入口点为solve.sh。解决方案随后在全新的沙箱中运行并获得评分。上下文智能体准备多样化的灵感,使提案智能体可以向多个方向探索。
Hyra 是一个异步的生产者-消费者流水线。上下文智能体持续准备灵感上下文并填充任务队列。提案智能体消费队列,提交完成的解决方案进行沙箱执行和评估,并将结果返回给 EB。信号量保持沙箱、模型推理和任务队列等资源安全地满负荷利用,使解决方案质量能够随时间高效扩展。
对于没有评估器的任务,Hyra 将单层循环升级为双层循环。首先,Hyra 根据任务描述创建一个初始评估器。内层循环根据该评估器反复改进解决方案。内层循环结束后,Hyra 使用 EB 中积累的经验改进评估器,例如提高评估代码效率、减少奖励黑客风险、添加更细粒度的反馈,或为进展创造更大空间。然后使用升级后的评估器启动下一轮循环。以"设计一个世界冠军级别的国际象棋 AI"为例:初始评估器可能使用来自随机生成对手梯队的 Elo 评分。随着循环继续,这些对手可以被 EB 中记录的更强 AI 取代,使评估器和解决方案共同改进。
Hyra 演示
以下是 Hyra 实际应用的几个示例。本文讨论的所有产物均已在 GitHub 仓库开源。
AI for AI
基础模型研发涉及许多可以执行、评估和迭代的研究循环。它是研究智能体最自然的应用之一,也是递归自我改进的实际起点。训练配方、数据策略、训练和推理系统、底层内核以及评估框架都需要研究人员形成假设、实现想法、运行实验并根据反馈迭代。研究智能体可以将每一次成功和失败转化为可复用的经验,然后以远超手动实验节奏的规模继续探索。
我们在 Recursive 的自动化 AI 研究系统使用的三个任务上测试了 Hyra:NanoChat Autoresearch、NanoGPT Speedrun 和 SOL-ExecBench。这些任务涵盖固定预算训练、训练速度优化和 GPU 内核优化。为了直接比较,我们复用了 Recursive 的公开设置,包括相同的任务定义、评估协议和初始解决方案。NanoChat 从相同的种子解决方案开始,NanoGPT 从相同的领先解决方案开始,SOL-ExecBench 使用相同的 235 个内核和 B200 评分协议。Hyra-1.0 在所有三个任务上都超越了 Recursive 报告的结果:
| 基准 | 任务 | 指标 | Recursive | Hyra-1.0 |
|---|---|---|---|---|
| NanoChat Autoresearch | 模型训练 | 验证 BPB ↓ | 0.9109 | 0.9015 |
| NanoGPT Speedrun | 训练加速 | 达到 3.28 loss 的时间 ↓ | 77.5s | 76.4s |
| SOL-ExecBench | GPU 内核优化 | 平均 SOL ↑ | 0.754 | 0.771 † |
† 为与 Recursive 的报告方法保持一致,该指标遵循 Evaluation Stack v1.0 评估设置,结果来自本地运行。 这些问题已被研究界广泛探索和优化,因此现有基线已经极具竞争力。
在 NanoChat Autoresearch 上,Hyra 需要在固定预算内平衡模型架构、优化器设计、学习率调度、数据流和执行效率。它最终将验证 BPB 降至 0.9015。在 NanoGPT Speedrun 上——一个被社区广泛打磨、几乎没有提升空间的基准——Hyra 将达到验证损失 3.28 的时间缩短至 76.4 秒。在 SOL-ExecBench 上,Hyra 联合优化了 235 个真实工作负载的内核,目前平均 SOL 达到 0.771。这些结果涵盖训练算法、训练系统和底层内核,表明同一研究循环可以跨不同反馈环境迁移,并持续产生可执行、可验证的改进。
更强的搜索也会更快触及评估器的极限。在 NanoChat 中,一个解决方案将因果语言模型转换为近双向注意力架构,泄露未来 token 以产生人为的低 BPB。在 SOL-ExecBench 中,另一个解决方案在正确性检查期间缓存输出,在计时期间运行空内核。两者都获得了高分,但并未真正解决预期任务。
因此,自动化研究不能只优化最终分数。评估本身必须成为研究循环的一部分。随着解决方案搜索能力增强,评估器和验证流水线必须随之进化,以持续区分真正的进展和奖励黑客。在 AI for AI 中,更强的研究智能体加速模型、训练系统和基础设施的开发。这些改进的 AI 系统反过来使下一代研究智能体更强大。
AI for Science
我们从 EinsteinArena 和 Erich's Packing Center 等来源收集了 55 个公开数学问题,其中许多问题数十年来没有进展。Hyra 在其中 29 个问题上创造了新的已知最佳结果,展示了其大规模数学发现的潜力。这些结果也已在我们的 GitHub 仓库开源。
我们还向 Hyra 提供了天文观测、地质活动甚至宏观经济学的数据,然后要求它发现潜在规律。在一项实验中,我们提供了 1749 年至 1932 年的月度太阳黑子数据。Hyra 发现了一个预测太阳黑子数量的递推关系,在 1932 年至 2026 年近一个世纪的样本外记录上达到了 $R^2=0.77$。同样,Hyra 可以检查 AI 模型训练日志、发现缩放定律(scaling laws),并使用它们指导训练配方设计。
Hyra 不仅能在实验数据中发现模式,还可以直接设计科学和工程产物。以下是三个代表性示例:
- Hyra 设计了一个仅用 15 个可训练参数就能完成两个 10 位数相加的 Transformer。这比 AdderBoard 上 36 参数的公开记录少了 58.3%。除了创造新的参数数量记录外,该结果表明 Hyra 可以在严格资源约束下联合搜索模型架构和计算机制。这有助于研究神经网络能力的极限,并将模型压缩推向新的极致。
- 在量子计算中,逻辑量子比特必须映射到物理芯片有限的耦合拓扑上。非相邻量子比特之间的操作通常需要插入 SWAP 门,增加双量子比特门开销和噪声。Hyra 设计了一种量子比特路由算法,在 IBM Q20 上的路由效率比经典 SABRE 方法提高了 44.4%。更少的双量子比特门通常意味着更短的执行时间和更少的累积误差,使电路在噪声受限的量子硬件上更高效执行。
- PARP1(聚腺苷二磷酸核糖聚合酶 1)是 DNA 损伤修复中的关键酶。它与具有同源重组修复(HRR)缺陷的肿瘤细胞的合成致死相互作用,使其成为精准肿瘤学的主要靶点。我们向 Hyra 提供 PARP1 结合口袋,要求它生成具有稳定结合的类药物候选物。Hyra 产生的候选物在结合和类药性综合评分上显著优于已获批的 PARP 抑制剂奥拉帕尼(olaparib)。该结果凸显了 Hyra 在多目标药物设计方面的潜力。这仍是一个早期的基于模拟的筛选结果,需要更严格的模拟、合成和湿实验验证。
AI for Fun
除了模型开发和科学发现,Hyra 还可以在游戏、设计和内容创作等开放领域工作。它可以通过自我对弈、自我评估和用户反馈持续改进策略和产物。与固定基准不同,这些任务很少有单一正确答案。研究智能体不能只搜索解决方案;它必须将主观目标转化为支持持续改进的反馈信号。
以下是三个对于当今编码智能体来说不同寻常但也很有趣的示例:
- 我们要求 Hyra 通过自我对弈设计和改进黑白棋(Othello)机器人。评估器运行双循环赛:新候选者与经验库中的高分机器人对弈,Elo 排名前 k 的玩家被保留,形成越来越强的对手池。Hyra 的策略从极小极大搜索进化为结合 AlphaZero 风格 PUCT 与 MCTS 的混合方法。最终机器人在 Botzone 的 730 个参赛作品中排名第三,其中大多数由北京大学计算机科学专业的学生构建。
左图:Hyra 开发的黑白棋机器人的阶梯排名。右图:Hyra 机器人执白的一局示例对局。
- 我们要求 Hyra 从单张 2D 参考图像设计物体的 3D 结构并生成可渲染的 3D 模型。基于评分标准的 VLM 评判器在轮廓、比例、结构完整性、材质和视觉相似性方面对结果评分。经过多轮探索,Hyra 持续修改其建模代码和渲染参数。最终模型比使用 Claude Code 目标模式生成的模型更接近参考图像,更符合人类审美偏好。
从单张 2D 参考图像出发,Hyra 持续改进建模代码和渲染参数,生成更完整、更匹配参考的 3D 模型。
- 我们还给了 Hyra 一段旋律,要求它创作完整的多乐器编曲。内层循环使用基于规则的评估器检查和声、和弦进行、节奏密度、音区冲突和其他属性。外层循环根据用户反馈调整评估器,逐步学习难以预先形式化的偏好。经过七轮迭代,同一段旋律从保守的、赞美诗般的四声部编曲(配器统一、通用十六分音符模式、频繁的大三和弦)进化为完整的多乐器编曲,包含减七和弦、六和弦、灵活节奏和更丰富的音色。
第 1 轮 · 初始编曲
四个声部,相似音色,规整节奏,创造出保守的赞美诗般声音。
第 4 轮 · 扩展结构
不同乐器开始承担不同角色,机械的十六分音符模式减少。
第 7 轮 · 和声色彩
减七和弦和六和弦配合更灵活的节奏,增添更丰富的色彩。
这些实验表明,研究智能体不仅适用于具有单一标量指标的问题。当反馈来自对手、视觉模型或真实用户时,Hyra 仍能将模糊目标转化为迭代搜索过程。当现有评估标准不足时,求解器和评估器可以在双层循环中共同进化。
未来之路
我们相信简单而有效的 Hyra 具有巨大潜力。本文中的演示仍处于初步阶段。接下来,我们需要定义更多具有持续改进空间的有价值任务。除了公开基准,腾讯的产品系统、真实 AI 研发管线以及科学和工业环境都可以被形式化为具有清晰反馈的可执行、可验证问题。
这将启动框架-数据-模型的进化循环:更好的框架产生更好的数据和经验,从而产生更强的模型;更强的模型反过来推动更好的框架和更多发现。未来几代 Hy 模型,甚至一些腾讯产品,将继续与 Hyra 共同进化。
如果您对 Hyra 感兴趣,无论是学术合作、实习和职业机会,还是只是想分享反馈,请填写此表单。如果这是您想要投身的工作,加入我们。
脚注
[1] Google DeepMind, "AlphaEvolve: A coding agent for scientific and algorithmic discovery", 2025.
[2] Together AI, "Discovering new mathematical bounds with AI: raising the kissing number in 11 dimensions", 2026.
[3] Andrej Karpathy, "autoresearch", 2025.
[4] Rich Sutton, "The Bitter Lesson", 2019.
[5] Recursive, "Inside Recursive's automated AI research system", 2026.
[6] Keller Jordan, "NanoGPT Speedrun", 2025.
[7] FLUX.1 Team, "SOL-ExecBench: 235 Real-World CUDA Kernels for AI Infrastructure", 2026.
[8] EinsteinArena, 2026.
[9] Erich's Packing Center, 2026.
[10] Sunspot data from WDC-SILSO, Royal Observatory of Belgium, Brussels.
[11] Jared Kaplan et al., "Scaling Laws for Neural Language Models", 2020.
[12] AdderBoard, 2026.
[13] Li et al., "Tackling the Qubit Mapping Problem for NISQ-Era Quantum Devices", 2019.
[14] Botzone Othello leaderboard.
[15] Claude Code Goal Mode, Anthropic, 2026.