讲师中心 微信公众号
AI工具推荐 视频效率加速

一份CUDA源码,跑上了苹果GPU

云伟君_1537

云伟君_1537

发布时间:2026-07-24 10:47:36

|

672人浏览过

|

来源于php中文网

原创

一段原本为英伟达 cuda 架构开发的计算程序,几乎无需改动核心内核代码,便成功在配备 m3 pro 芯片的苹果设备上原生运行。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一份CUDA源码,跑上了苹果GPU

这一成果由 X 平台用户 @Abhinav 昨日公开披露。尤为引人注目的是,它并非仅限于基础向量运算(如加减乘除)的简单验证,而是在真实三维流体仿真任务中,实现了接近 10 倍的性能跃升。

一份CUDA源码,跑上了苹果GPU

支撑这项突破的关键角色之一,是名为 GPT-5.6 Sol 的人工智能模型。

整个实验基于开源科学计算框架 OpenFPM 展开。研究团队长期致力于一项被广泛视为“近乎不可能”的目标:将原本专为 CUDA/HIP GPU 编写的高性能计算代码,无缝迁移至苹果自研的 Metal GPU 架构之上。

为何如此困难?过去十余年,GPU 加速生态高度割裂——英伟达主推 CUDA,AMD 推出 HIP,苹果则构建了独立的 Metal 生态。三者如同互不相通的语言体系,彼此缺乏兼容性。一段标准 CUDA 程序,往往需经历大量重写与适配,才可能在其他平台运行。

但此次,开发者并未选择从头编写 Metal 版本,而是构建了一条跨层转换通路:原始代码先经 Clang/HIP 工具链预处理,再通过 SPIR-V 中间表示、Vulkan 抽象层及 MoltenVK 转译层,最终使 Metal GPU 能够准确识别并高效执行。

尤为关键的是,整个方案完全规避了对 Metal 原生粒子 API 的依赖。上层应用仍沿用熟悉的 CUDA/HIP 风格 kernel 启动方式,真正实现了硬件无关的抽象层设计。

在此过程中,GPT-5.6 Sol 扮演了核心调试与优化助手的角色。它协助完成了设备端内存布局的自动构建,并在约 6 小时内定位了 MoltenVK 与 SPIR-V 在特定场景下的兼容性缺陷,进而提出可行的绕过策略。

一份CUDA源码,跑上了苹果GPU

项目地址:https://www.php.cn/link/d26ae0228558cc592421572080b5e8d5

真正检验该方案可靠性的,是一组极具挑战性的测试用例——三维 SPH 大坝溃决模拟。该任务涵盖扫描与排序、单元格划分、邻域列表构建、ghost 粒子通信、归约操作及原子操作等多个高复杂度模块,任一环节失效均可能导致性能骤降或物理结果失真。

然而实测结果远超预期:在搭载 M3 Pro 的苹果设备上启用 Metal GPU 加速后,完成模拟耗时约 6 秒;若仅使用 CPU 串行计算,则需约 60 秒。换言之,仅更换计算后端,即获得近 10 倍加速比,且 GPU 利用率稳定在 100% 左右(印证了转换链路的高效性)。

更重要的是,这一加速并未以精度折损为代价。研究人员对比分析了仿真输出,确认 Metal GPU 版本与原始 CUDA 版本所得物理结果高度一致——包括关键状态变量、演化轨迹等均保持数值收敛,表明苹果 GPU 不仅能跑,更能胜任严谨的科学计算任务。

团队进一步指出:粒子数据存储空间随粒子总数 N 呈线性增长,而邻居搜索等核心操作的时间复杂度约为 O(N·k)(其中 k 为单位密度下平均邻域数)。当前展示的 10 倍提速,是单机环境下的前后端对比结果。展望未来,借助苹果 Thunderbolt 接口支持的 RDMA 技术,还可实现多机协同与动态负载均衡,推动仿真规模横向扩展。

当然,这项进展尚不足以撼动现有 GPU 产业格局。目前 Apple Silicon GPU 的一大短板,在于对双精度浮点运算的支持较弱,而气象建模、航天器仿真等高端科学计算场景严重依赖高精度浮点能力。因此,在超算级应用中,英伟达专业 GPU 依然具备不可替代的优势。

也有声音对该项目的实际价值提出质疑。一位网友评论道:“市面上明明存在更成熟的平台,非要在 Mac 上跑这类轻量仿真,意义何在?”其潜台词是:MacBook 的 GPU 再快,本质仍是消费级芯片,此举更像是技术秀而非实用突破。

对此,开发者回应坦率而务实:“最大的价值,就是有趣,以及让日常开发更顺畅。”他解释称,团队的大规模仿真始终运行于集群环境,而本次能在 Apple Silicon 上顺利执行,恰恰验证了其底层设备抽象层设计的有效性。更现实的需求来自本地开发流程——大型仿真上线前,必须通过小规模实例反复调试;若全程依赖 CPU,效率极低;而仿真结果常达数 GB,通过 SSH 传输极为缓慢,远程桌面又响应迟滞、体验不佳,本地直接运行反而是最优解。最理想之处在于:在笔记本上调试通过的同一份代码,无需任何修改,即可直接部署至 GPU 集群并自动完成规模扩展。

一份CUDA源码,跑上了苹果GPU

这项探索还揭示了一个重要趋势:一套统一的 CUDA/HIP 风格算法,已可较为透明地运行于 Apple Silicon 等异构硬件后端之上。未来,软件开发者或将摆脱单一 GPU 生态的绑定束缚。

一份CUDA源码,跑上了苹果GPU

同时,这也标志着 AI(GPT-5.6 Sol)正从“辅助编码”迈向“深度参与底层系统设计、跨平台工程调优与系统级调试”的新阶段。

苹果 GPU 此次跨越 CUDA 技术鸿沟,或许只是更大变革的起点。

参考链接:https://www.php.cn/link/b52156c8aac1434d38838ef84dfbd701

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:机器之心,36氪经授权发布。

相关文章

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

80

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

40

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

60

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

280

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

160

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn