商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 实测腾讯 Hy3 正式版,这次终于赶上了「AI 下半场」

实测腾讯 Hy3 正式版,这次终于赶上了「AI 下半场」

  发布于2026-08-18 阅读(0)

扫一扫,手机访问

十年磨一剑,两月一模型。这句话放在大模型圈子里,倒也挺贴切。

四月份的时候,Hy3 Preview 上线。这个被冠上「姚顺雨腾讯首秀」之称的大模型,开始能接住一部分用户的真实需求了,不过,在具体的编程实测中,和同期的几款大模型相比,差距还是肉眼可见的。

姚顺雨之前在「腾讯 AI 下半场」和汤道生对话时说过一句很实在的话:「我们先发一个 Preview 模型,主要目的之一就是希望获得真实世界的反馈,修复那些榜单里发现不了的问题。」


▲ WorkBuddy 内 Hy 3 限时免费中

两个月过去,混元 3 正式版来了。结合了用户对预览版的反馈,加上对模型稳定性和可用性的打磨,Hy3 在 Agent 和 Coding 能力上,确实有了质的变化。

我们做了一轮前端网页生成测试,大部分任务都涉及复杂的 3D 网页模拟、严格的游戏逻辑,还要调用不同的框架和库文件。结果很明显,Hy3 交付的结果比预览版整整好了一个等级。

最典型的一个例子,是「旧金山金门大桥 3D 体验」。在 WorkBuddy 里输入同样的提示词,选择 Hy3 模型,它会像 Codex 一样,先把我们的需求拆解成多个子任务,然后一步一步执行、验证,最后交付。


直接看最终效果:Hy3 设计了近距穿梭、中景环绕、高空俯瞰、自动环绕,还有电影巡游等多种视角。桥面、桥上的车、水面倒影,呈现出来的真实感,比预览版强太多了。


作为对比,当时的预览版看起来就像个中途废弃的项目,粗陋又局限。


前端能力的提升,根子是模型底层的进化。这些优化也让 Hy3 在综合的 Coding Agent 任务和办公场景中,变得更加通用。

在 WorkBuddy 里测试它的办公能力时,面对一些复杂的工作流,Hy3 的任务规划能力、长文本信息处理能力,以及多工具调用的熟练度,都比预览版有了明显强化。交付的成果,也更贴合我们的预期。

根据最新的模型发布博客,Hy3 的推理能力、STEM 复杂推理和数理能力,同样提升显著。现在,用它来完成高阶数据分析、科学研究这类硬核任务,也没问题。


▲ WorkBuddy 会将任务进行详细规划,一步步执行

目前,Hy3 可以在 WorkBuddy 和元宝里使用。WorkBuddy 是腾讯早前推出的全场景 AI 工作台,和 Codex 类似,可以直接从本地文件出发,快速处理电脑上的各种任务。

元宝也提供了 Agent 能力。使用混元模型,选择快速思考模式,输入明确要求,告诉模型最终需要什么类型的文件,元宝就会自动触发 Agent 能力。


像 PPT、Word、Excel、PDF,还有 HTML 这些文件,现在可以直接在元宝里,用 Hy3 的 Agent 能力生成。

API 定价方面,Hy3 输入 1 元/百万 tokens,输出 4 元/百万 tokens,命中缓存的价格是 0.25 元/百万 tokens。作为参照,DeepSeek V4 Pro 对应的价格是 3 元、6 元和 0.025 元。

我们做了更多测试,可视化结果说明了一个事实:Hy3 确实不一样了。

可以跟其他旗舰模型比肩的网页效果

除了开头「金门大桥」的变化,在 benchmark 表现上,Hy3 延续了预览版快速提升的势头。在经典的 SWE-bench、HLE、BrowseComp 等榜单上,Hy3 几乎是进步最显著的模型。


在完整的 Benchmark 对比中,Hy3 主要和 DeepSeek V4 Pro、GLM 5.2、Qwen 3.7 Max、GPT 5.5、Opus 4.8,以及豆包 Seed 2.1 Pro 放在一起比较。

可以看出,相比预览版,Hy3 已经更接近国内外旗舰模型的表现了,甚至在某些指标上超过了对手,整体水平来到了 GLM 5.2 附近。


我们继续测试了上一次用在预览版上的提示词——同样的词、同样的设置,Hy3 这次的表现还有哪些提升?


比如这个主题公园的场景。预览版交付的是一个能看能用、但既不美观交互也不友好的产品。而 Hy3 从启动页面就能看出,它在美术设计上是花了心思的。


点击「开始建造」,网页终于不再是那堆用烂了的 Emoji 符号——从小图标到大场景,都开始使用 AI 生成的图片。不过模型在搭配这些图片时还是有些犯难,贴到公园里,似乎并不是那么和谐。


我们在里面玩了一会儿,所有资金、评级、游客量、满意度和清洁度这些信息,背后都有一套完整的游戏逻辑在支撑。

比如一直没增加洗手间和游客服务中心,满意度就始终维持在低位;可一旦多修些路、多添点建筑,满意度就会慢慢爬上来。


同样一套提示词,预览版的效果,大家自己看吧。


还有 SVG 测试。之前那个「开着汽车的长颈鹿」动态 SVG,预览版给的是一个完全平面的 2D 动画。Hy3 不但增加了更多细节,也让整个 SVG 看起来更自然——太阳、长颈鹿、汽车、风景,都有了动画质感。


▲ Hy3 Preview 生成


▲ Hy3 生成

之前用来测试 GLM 5.2 的那几个游戏复刻任务,现在用 Hy3 基本上都能达到同一水准,有些表现甚至还更好。

比如复刻《我的世界》。虽然场景里没看到水域,但这些砖块还原的像素世界,和之前 GPT-5.5 生成的游戏已经不相上下了。


▲ Hy3 生成


▲ GLM 5.2 生成

还有《黑神话:悟空》的复刻,这是最让人惊喜的地方。之前的测试中,无论是 GLM 5.2 还是 Opus 4.8,都偏向于用 2D 或者较暗、较黑的风格来呈现网页。但 Hy3 给出的游戏,算是完成度比较高的一个。


▲ Hy3 生成


▲GLM 5.2 生成

其他游戏,像《地铁跑酷》,用 Hy3 生成的效果,对比之前测试省 Token 策略时用 GPT-5.5 生成的结果,也好上不少。可玩性和直接上线的可能性,Hy3 交付的网页都更强。


针对具体代码项目的任务,我们从 GitHub 上找了一篇经典论文的代码文件,交给 Hy3 分析,要求它找出里面的 Bug 和可优化的方向。


有趣的是,提示词里根本没要求它交付任何文档,但 Hy3 还是给出了一份详细的 Markdown 报告。里面清晰地列明了项目研究内容、已确认的 Bug、潜在问题与 Robust 风险,以及从性能和架构上给出的优化方向。


得益于 Coding Agent 能力的提升,Hy3 能快速把一个 Matlab 项目转成其他语言,或者把 Python 项目转成能在 Google Colab 上跑的 ipynb 格式,还能顺手修复它自己发现的那些 Bug。

代码之外,我们也在 WorkBuddy 里让 Hy3 完成一份深度调研报告,主题是「计算机科学与技术这个专业怎么样」,最终交付了网页报告、PPT 和 Markdown 文档。

通常我们能想到的,无非是就业前景、院校排名、薪资这些。但 Hy3 的联网搜索和推理分析能力,还给出了专业课、考研路径、算法工程方向等内容。


多文件处理能力也值得一提——Hy3 可以一次性处理多个文件,同时交付多种不同格式的结果。

根据官方数据,Hy3 在 WorkBuddy 办公场景下的任务成功率,从 72% 升到了 90%。大到超长的网页开发项目,小到各种小游戏、小程序,Hy3 现在都有了稳定的交付能力。

一番实测下来,可以很确定地说,相比 Hy3 Preview,Hy3 的进步非常明显。如果你手边正缺趁手的工具,Hy3 + WorkBuddy 现在或许是个不错的选择。


不过,就像开头说的「两个月一更新」——有些模型甚至不用两个月就会迭代。等到 GPT-5.6 全面开放、Gemini 3.5 Pro 上线,到时候的基准又成新的标杆了。

从 Preview 到正式版,Hy3 用两个月完成了一次肉眼可见的迭代。下一次,还能不能保持这个速度?这个问题,可能比这一代模型本身更值得关注。

反正一个趋势已经很明确了:越来越多的工作,我们是可以放心交给 AI 了。而大模型的选择,也变得越来越丰富。

本文转载于:https://www.163.com/dy/article/L1647DHK05118O8G.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注