商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 苹果CoreAI首批基准出炉,Qwen3 0.6B大幅领先,8B几乎追平MLX

苹果CoreAI首批基准出炉,Qwen3 0.6B大幅领先,8B几乎追平MLX

  发布于2026-06-11 阅读(0)

扫一扫,手机访问

苹果在2026年WWDC上正式推出了CoreAI引擎,接替已服役9年的CoreML框架。后者从2017年开始主导iOS/macOS上的图像分类等小型静态任务,而新登场的CoreAI把重心完全转向了端侧大模型推理——设备端本地跑大语言模型,支持更灵活的模型格式和更大的内存占用,这才是它真正的使命。

与此同时,MLX作为苹果生态里的另一套机器学习框架,主要面向研究、训练和模型微调,开发者常拿它来测试和部署本地大模型。换句话说,CoreAI和MLX虽然同属苹果体系,但分工已经明确:一个主攻端侧推理,一个偏向研究与训练。

从首批基准测试来看,CoreAI的表现呈现出“小模型强、大模型持平”的特征。在M4 Mac上运行Qwen3 0.6B模型时,CoreAI的解码速度大约是MLX的2.47倍;到了iPhone 17 Pro上,这一优势缩小到约1.6倍。所谓解码速度,就是大模型生成文本时每秒能输出多少个token(tok/s),这个数值越高,用户等待回复的时间就越短。


当模型规模提升到80亿参数(Qwen3 8B,M4 Max)后,CoreAI只比MLX快了约5%,两者基本处于同一水平。这说明随着模型变大,CoreAI的性能优势明显收窄——小模型上能拉开倍速差距,大模型上则趋于持平。

持续负载方面的情况更有意思。测试显示,iPhone 17 Pro的GPU在长时间运行大模型后会较快触发温控降频,从而削弱GPU路线的持续吞吐能力。反倒是CoreML配合苹果神经引擎(ANE)的组合,在性能保持率上实现了反超。也就是说,纯GPU路线不一定是最优解,融合神经引擎的混合方案在长时间推理场景下更稳定。


再横向对比其他厂商的方案,你会发现针对特定模型深度优化的引擎更容易胜出。谷歌的LiteRT-LM在iPhone 17 Pro上运行Gemma时,每秒能达到55.4个token,而RAM占用仅641 MB。作为对照,苹果MLX运行相同模型的内存占用高达2900 MB,是前者的4.5倍。这组数据很能说明问题:内存效率和推理速度之间的平衡,往往是端侧AI落地的关键瓶颈。


本文转载于:https://www.163.com/dy/article/KV58VQ5R0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注