混元Hy4 preview实测:AI能否真正完成复杂工作链?

1 阅读

在人工智能从“能回答”向“能做事”演进的关键阶段,腾讯于2026年8月28日发布了混元大模型的最新版本——Hy4 preview。这一版本不仅在技术参数上实现跃升(总参数达770B,激活参数49B,上下文长度扩展至1M tokens),更在产品定位上明确指向“生产力任务”的深度支持。然而,参数增长只是表象,真正的考验在于:当面对真实工作场景中冗长、模糊且易出错的任务链时,AI是否具备持续推进、自我修正并最终交付的能力?

文章配图

为验证这一点,我们设计了三项递进式测试,覆盖办公审核、前端工程与3D图形开发三大典型场景,全面评估Hy4 preview的实际表现。

文章配图

多源材料交叉验证:AI如何审一笔复杂的费用报销?

文章配图

第一项测试模拟企业财务审核场景:提供包含6笔费用申请、两版制度文件、预算台账及3封审批邮件在内的12份材料,要求模型判断每笔费用是否合规,并给出“全额通过”“核减后通过”或“退回补件”的结论。这类任务的核心难点在于信息分散、规则动态(制度有新旧版本)、证据隐含(如活动证明藏于邮件附件),且需精确计算金额。

Hy4 preview在3分27秒内输出了一份结构清晰的《费用审核报告》,采用Markdown格式,先汇总再逐项说明依据。例如,针对一笔86元的晚间交通费,申请单未附活动证明,但模型通过检索邮件发现项目负责人曾要求“会议结束后完成供应商确认再离开”,结合行程记录时间(22:28离场,会议预计22:15结束),成功构建完整证据链予以通过。在客户餐叙费用中,模型准确计算人均350元超出300元限额,主动核减150元;对软件订阅申请,则识别出所谓“审批邮件”实为“暂不批准”,果断退回补件。

值得注意的是,模型虽将一笔8月12日的申请错误归入8月15日生效的新制度,但由于该条款在新旧版本中一致,未影响最终结论。这一细节暴露出当前AI在时间线与规则版本匹配上的局限性——它能处理显性逻辑,但对隐性前提的敏感度仍有提升空间。不过整体而言,Hy4 preview展现了出色的多文档关联分析、数值计算与异常识别能力,其输出可直接用于后续审批流程,具备实际办公价值。

原生Canvas游戏开发:从零构建可运行的《深海进化论》

第二项测试挑战前端工程能力:要求仅使用HTML5 Canvas和TypeScript(禁用Phaser等引擎),在32分钟内开发一款“大鱼吃小鱼”游戏,需实现惯性移动、三种体型、吞食成长、碰撞判定、环境元素及完整UI。

Hy4 preview交付了一个30.5KB的game.ts文件及配套HTML,支持npm run build打包和npm run single生成离线单文件。游戏包含深海背景、气泡、珊瑚、光线等视觉元素,玩家控制黄色小鱼,通过绿色/红色虚线圈提示可吞食或危险目标。吞食后体型、速度、分数动态变化,死亡时显示“凶手”、存活时间等详细结算。

更关键的是,模型并未止步于代码生成。它自行设计了15项Node逻辑测试和14项Chromium端到端测试,覆盖开局、操作、吞食、死亡、重开等全流程。在自测中发现两个典型问题:一是边缘生成的鱼因边界反弹逻辑突兀,模型将其改为“仅在尝试越界时反弹”,使进场更自然;二是玩家追击猎物时因速度差形成“永远差一点”的僵局,模型未简单提速,而是引入猎物“体力衰减”机制,使追逐更具策略性。

这一过程体现了完整的工程闭环:需求拆解→模块化编码→自动化测试→问题定位→针对性修复→再次验证。尤其在无第三方依赖的前提下,能实现如此流畅的游戏体验,说明Hy4 preview已具备初级前端工程师的综合能力。

Three.js 3D竞速游戏:从白屏到可运行的《午夜港口》

第三项测试最为复杂:基于一句话需求,使用Three.js开发3D无人机竞速游戏《午夜港口》,需包含雨夜港口、集装箱隧道、AI对手、氮气加速、实时排名等要素,并确保可直接运行。

首次交付耗时1小时39分钟,模型创建了包含14个检查点、164个碰撞盒的赛道,AI无人机具备路径规划与避让逻辑,场景集成GPU雨丝、积水反射、闪电等效果。然而,项目依赖本地服务器,双击index.html因浏览器CORS限制导致白屏——这是典型的工程部署疏漏。

收到反馈后,Hy4 preview未重写代码,而是在20分钟内重构打包方式,生成0.57MB的单文件版本,彻底解决启动问题。同时,通过两套自测(Node模拟比赛 + Chrome交互测试)发现并修复三个深层Bug:AI因前视距离过长撞墙、完赛后圈数继续累加、泛光过曝导致场景发白。其中,画面过曝问题通过逐层关闭渲染效果,精准定位到UnrealBloom阈值设置不当,将参数从0.55调至0.78,恢复夜景层次。

最终版本支持倒计时起步、三圈计时、实时排名、氮气加速及碰撞减速,玩家可流畅完成整场比赛。这一案例充分展示了Hy4 preview在复杂项目中的“韧性”:即使首次交付失败,也能基于上下文快速定位问题根源,沿既有工程路径迭代优化,而非推倒重来。

从“生成答案”到“完成任务”:Hy4 preview的定位与挑战

三项测试共同揭示了一个趋势:Hy4 preview的核心优势已从单纯的文本生成,转向“任务链执行”。它能在错误发生后继续工作——无论是补充证据、修复代码还是调整部署——这种能力使其更接近“数字员工”而非“问答机器”。腾讯内部163名专家对203个工程任务的盲测结果(平均得分2.99/4,略超Kimi K3和GLM 5.3)也佐证了其在专业场景的竞争力。

然而,人工复核仍不可替代。费用审核中的制度版本误判、3D游戏的初始部署缺陷,都提醒我们:当前AI尚不能完全保证关键前提的准确性。此外,腾讯为Hy4 preview设定的高性价比路线(输入6元/百万tokens)虽降低使用门槛,但其商业回报仍需依赖WorkBuddy、CodeBuddy等产品的规模化落地。二季度AI业务对Non-IFRS利润造成105亿元净影响,意味着模型必须证明其能驱动真实生产力提升。

综上,混元Hy4 preview并非完美无缺,但它在“长程任务执行”上的进步是实质性的。当用户愿意将下一项任务继续交给它时,或许正是AI真正融入工作流的开始。