混元Hy4 preview开源:小团队能交付,但仍需人工把关
腾讯正式发布了混元 Hy4 preview 模型——总参数约 7700 亿、激活参数 490 亿,上下文长度突破百万级,重点面向 Agent、代码开发与生产力场景进行优化。相比上一代,Hy4 preview 在多步骤 Agent 协同、代码编写与复杂工程处理、任务拆解与长链路执行、指令遵循和上下文承接等方面都有明显提升。
在具体能力上,Hy4 对代码的理解、生成与修改能力加强,能处理更复杂的工程任务;在办公与生产力场景中,增强了文档处理、信息分析、办公自动化、网页生成、跨工具协作与游戏开发等能力。游戏方向上,模型能把一句话需求快速落成可玩原型,并能熟练使用游戏引擎,通过多轮交互逐步完善复杂项目;科研场景也能在理解与推理复杂问题上提供更强的支持。
值得注意的是,Hy4 在自身研发流程中也参与了全链路的自动优化:不仅在训练方法、数据策略与评估体系上提出方案并运行实验,还参与底层算子与推理基础设施的多轮优化。模型能识别推理瓶颈,围绕算子融合与通信等方向做优化,使端到端吞吐比基线提升约 31.8%,在不同上下文长度与并发设置下都保持稳定收益,初步展现出对推理基础设施开展自主优化的能力。 龙8头号玩家
Hy4 preview 已被开源并同步部署到腾讯内部与对外产品中,同时通过云端接口对外提供接入。定价继续走亲民路线:输入侧约 6 元/百万 tokens、输出侧约 18 元/百万 tokens,缓存命中计费更低。为收集用户反馈,相关产品还会开展限时免费体验活动。
我们的实测(基于 WorkBuddy)表明,Hy4 的 Agent 已经具备“把一件事做完”的能力:它能并行抓取大量网页、整合时效信息,并产出结构化的交付物。以一次为 30 人开发团队选购 AI 编程工具的调研任务为例,生成的报告整体完整、信息覆盖面广,能捕捉到像 Copilot 注册策略变化这类容易被忽略的动态政策。但在若干关键事实与成本口径上仍有遗漏或计算错误,导致最终报告未能完全达标——典型问题是漏查或误用某项年付价格,造成横向成本比较口径不一致,从而影响结论的准确性。
结论是:Hy4 preview 显著提升了小型团队借助 Agent 完成交付的能力,能在信息检索、任务拆解与多轮执行上大幅减轻人力负担,但在关键节点仍需要人工把关与核验,尤其是对事实性细节、价格与合规类信息必须进行人工复核,才能把好最后一公里。 龙8头号玩家
沃特森契合骑士锋线角色,但仍需成长
让每一次运动都成为一种享受与成就。...