实测资料分享
浏览器 AI 能快多少?先看 WebGPU 测试到底测了什么
本篇整理他人的测试资料,过程与结论来自原始来源;不代表发布者亲自完成测试。
原资料的结论
原文报告 809 个有效比较,629 胜、176 负、4 平;几何平均加速 2.57 倍。该数字属于作者测试结果。
原资料怎么测的
发布方用 Apple M4 对比两套 WebGPU 算子实现,并筛选输出一致、计时可靠的样本。

补充体验
【这次发布的对象】
@huggingface/kernels 提供独立的 WebGPU 算子。每个算子带有接口说明、正确性用例、性能样本与版本信息,供浏览器中的 AI 计算调用。
【数字来自什么条件】
作者在 Apple M4 GPU 上与指定开发版 ONNX Runtime Web 比较,从 1,756 个用例中保留输出相符且计时可靠的 809 个。报告的几何平均加速为 2.57 倍,中位数为 1.90 倍。
【怎样阅读这个结果】
原文只计 GPU 运算时间,未计入加载、编译、输入上传和输出回读。这是算子层面的比较,完整模型与不同设备的实际收益仍需要另测。Fleet 用于补充更多硬件上的证据。
@huggingface/kernels 提供独立的 WebGPU 算子。每个算子带有接口说明、正确性用例、性能样本与版本信息,供浏览器中的 AI 计算调用。
【数字来自什么条件】
作者在 Apple M4 GPU 上与指定开发版 ONNX Runtime Web 比较,从 1,756 个用例中保留输出相符且计时可靠的 809 个。报告的几何平均加速为 2.57 倍,中位数为 1.90 倍。
【怎样阅读这个结果】
原文只计 GPU 运算时间,未计入加载、编译、输入上传和输出回读。这是算子层面的比较,完整模型与不同设备的实际收益仍需要另测。Fleet 用于补充更多硬件上的证据。
限制与未验证的情况
只测试特定硬件与算子,不代表整个模型加速比例;未计网络、初始化与数据传输。平台未复跑该性能测试。
AI 辅助整理,由发布者核对后分享;请核对事实与不同观点,不代表各方已达成共识。
让想法继续往前
有了具体目标,再按需要发起合作。
讨论
交流提示换成你的工具和输入,结果是否相同?欢迎补充复现结果和不同情况。
还没有回复,欢迎展开讨论。