讲师中心 微信公众号
AI工具推荐 视频效率加速

将27B模型“塞进”手机,PrismML推动AI进化从规模转向“智能密度”

千强酱_1923

千强酱_1923

发布时间:2026-07-25 16:31:19

|

333人浏览过

|

来源于php中文网

原创

ai模型的scaling law目前尚未触达瓶颈,无论在语言大模型、多模态模型,还是物理ai领域,持续增加算力与模型规模,依然能观测到性能的稳步提升。

然而,单纯依靠堆砌算力、盲目扩大模型体量的“狂奔式”Scaling路径,已逐渐失去创新活力。更重要的是,超大规模模型难以适配多样化部署场景——尤其在物理AI落地过程中,端侧设备受限于算力、功耗、体积与散热等硬性约束,无法承载动辄数十GB的模型。

由加州理工学院(Caltech)教授创立的PrismML,正探索一条与主流范式迥异的技术路线:不再执着于无限放大模型与算力,而是聚焦于提升模型的“智能密度”。

PrismML已在种子轮融资中成功募集1625万美元,投资方包括Khosla Ventures与Cerberus Ventures。据悉,加州理工学院亦参与本轮融资,并携手Google为公司提供关键算力支持。

加州理工教授正开辟一条绕开传统Scaling Law的新路径

Babak Hassibi是PrismML联合创始人兼CEO,同时担任加州理工学院电气工程、计算与数学科学教授。其余联合创始人包括Sahin Lale、Omead Pooladzandi与Reza Sadri。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

将27B模型“塞进”手机,PrismML推动AI进化从规模转向“智能密度”

PrismML的创始团队,图片来源:PrismML

Babak Hassibi长期深耕信息论、信号处理、控制理论、优化算法及机器学习。早在上世纪90年代,他便参与提出经典神经网络剪枝方法Optimal Brain Surgeon,借助二阶导数信息识别并剔除冗余参数。他还曾联合创办自动驾驶感知公司Neural Propulsion Systems并出任CTO,拥有将算法设计、专用芯片与系统级硬件深度融合的实战经验。

Sahin Lale是PrismML联合创始人兼研究联席负责人,于加州理工学院获得电气工程博士学位,研究方向涵盖动态系统建模、强化学习与自适应控制;此前亦在Neural Propulsion Systems主导核心算法研发。

Omead Pooladzandi为PrismML联合创始人兼研究联席负责人,博士毕业于UCLA,专注于二阶优化理论、数据高效训练机制及模型泛化能力提升。

Reza Sadri担任PrismML联合创始人兼战略副总裁,长期深耕数据库系统、高性能存储架构与机器学习基础设施建设。他曾创办Levyx,在Instacart领导ML基础设施团队,并在加入PrismML前于加州理工学院主导AI Bootcamp项目,主要负责系统工程整合、产品化落地与商业化推进。

尽管持续增加训练算力、模型参数量与数据规模仍可带来性能增益,但这类模型的部署却高度依赖集中式大型数据中心。

这带来一个结构性矛盾:受限于延迟敏感性、终端硬件能力及数据隐私合规要求,当前最强的AI模型被牢牢锁死在云端集群与专用服务器中;而手机、笔记本、汽车、机器人、企业私有环境等边缘与端侧场景,始终难以实现低延迟、高安全、可持续运行的本地AI体验。

PrismML所致力解决的核心命题,正是打破这一桎梏:让高性能AI模型真正“下沉”至终端设备,实现高效、安全、实时的本地推理;同时反向赋能数据中心,以更少资源支撑更强算力输出,遏制能源消耗的指数级攀升。

他们旨在构建一种全新AI范式:模型具备跨平台硬件适应能力,并在单位算力、单位能耗、单位内存占用下,释放出更高水平的智能效能。

具体而言,PrismML通过近乎无损的模型压缩技术,显著削减模型对内存带宽、计算资源与电力供给的需求,逐步降低模型能力对参数膨胀与基础设施扩张的路径依赖。

不同于业界常见的4-bit或8-bit训练后量化方案,PrismML并非仅对部分权重进行低位宽压缩,也未采用“少量高精度层+大量低位宽层”的折中策略,而是将Embedding层、Attention模块、MLP子网络及输出头等全部组件,统一重构为二值化或三值化权重结构。

在二值模型中,每个权重仅表示+1或–1两种状态,每128个权重共享一个FP16缩放因子,实际平均比特宽度约为1.125 bit;三值模型则额外引入0状态,平均比特宽度约1.71 bit,在小幅增加体积的同时,保留更多原始模型表达能力。

注:模型权重可类比为神经网络内部的“调节旋钮”。传统模型需精确记录每个旋钮的具体数值,而二值化仅保留方向(正/负),三值化再补充“关闭”状态(零),从而以极简数据近似还原原有功能。

此外,PrismML还为这些压缩权重定制了专用推理内核,支持直接读取压缩格式执行运算,无需解压回FP16,从而同步降低模型体积、内存带宽压力与推理过程中的数据搬运开销。

PrismML提出了一项全新评估维度——“智能密度”,即单位部署体积所能承载的有效智能水平。其终极目标,是在严苛的内存、功耗与空间限制下,最大化模型的实际可用能力。

Unified LLM Gateway - One API for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
Unified LLM Gateway - One API for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

将27B模型“塞进”手机,PrismML推动AI进化从规模转向“智能密度”

Bonsai 27B与同参数规模其他模型的智能密度(每GB)对比,图片来源:PrismML

2026年3月,PrismML正式发布全球首批具备商业落地能力的1-bit大语言模型——1-bit Bonsai 8B。该模型实现了端到端原生1-bit设计:从词嵌入层(embeddings)、注意力机制(Attention)、多层感知机(MLP layers)到语言建模头部(LM head),全部采用自研1-bit权重架构。

将27B模型“塞进”手机,PrismML推动AI进化从规模转向“智能密度”

可在手机本地运行的1-bit Bonsai 8B,体积较同类参数模型缩小超10倍,性能几乎无损,图片来源:PrismML

相比Llama3 8B,该模型体积缩减14倍,推理速度提升8倍,能效提升4–5倍,整体大小仅为1.15 GB,轻松适配iPhone 17 Pro等旗舰移动设备。

它同样兼容桌面平台:据PrismML实测,1-bit Bonsai 8B在搭载M4 Pro芯片的Mac上推理速度达131 tokens/秒;使用RTX 4090显卡可达368 tokens/秒;在iPhone 17 Pro Max上亦稳定输出约44 tokens/秒。

其最新发布的模型为Bonsai 27B,基于Qwen3.6 27B深度优化,是当前同等能力水准下,首款可在智能手机上流畅运行的27B级模型。

在GeForce RTX 5090上,Bonsai 27B的1-bit版本最高推理速率达163 tokens/秒,三值版本为134 tokens/秒;在配备M5 Max芯片的Mac设备上,1-bit版峰值达87 tokens/秒,三值版为58 tokens/秒。

Bonsai 27B全面支持MLX框架,在苹果全系设备(Mac、iPhone、iPad)原生运行;同时也兼容CUDA生态,可在NVIDIA GPU平台高效部署。

Bonsai 27B的关键价值在于,27B级别的参数规模使其具备处理复杂任务的能力:如多步逻辑推理、结构化工具调用、轻量级视觉理解,以及长时间跨度中保持语义连贯的“计算机操作(computer-use)”智能体闭环。

Bonsai 8B与Bonsai 27B共同催生了一种新型混合部署架构:将常规性、非敏感型任务交由本地模型即时响应,仅将最具挑战性的推理环节卸载至云端前沿模型。此举可使智能体单次任务的综合成本断崖式下降。

在应用层面,当高级模型足够轻量、快速且节能,得以常驻终端时,AI产品的想象边界将被大幅拓宽:例如全天候在线的端侧智能体、毫秒级响应的具身机器人、兼顾隐私与效率的企业级Copilot、完全离线可用的AI助手,以及专为带宽受限、功耗敏感或强合规要求场景打造的AI原生解决方案。

AI模型的下一轮跃迁,或将从“拼规模”转向“提密度”

过去数年,AI模型沿着Scaling Law持续扩张:参数更多、数据更广、算力更强。这一路径带来了能力跃升,却也将模型日益绑定于数据中心、高带宽内存、海量电力供应等重型基础设施。

当AI加速渗透至企业IT系统、服务机器人、智能汽车及消费电子终端,这条扩张之路开始遭遇现实边界的强力反制。企业亟需保障专有数据不出域,物理AI终端则必须在真实环境中完成持续感知、实时决策与自主行动——所有这些,都要求智能能力真正扎根于本地,而模型体积与能耗正迅速成为新的天花板。

这意味着,AI模型演进的下一阶段,或将从追求绝对规模,转向锤炼“智能密度”:让每一bit数据、每一GB内存、每一瓦特能耗,承载更高密度的认知能力。模型的进步逻辑,也将从简单叠加参数,转向对智能本质的压缩、蒸馏与重构。

我们或许正站在一个历史性拐点之上。过去的问题是如何获取更多智能,未来的问题则是如何把智能注入更广泛的设备与场景之中。“浓缩智能”已不止于效率优化,它或将重塑模型的发展轨迹,并重新定义AI产品的形态边界。未来的AI,将自然分布在云端、边缘端,以及二者之间的任意节点。

下一轮模型竞争的核心指标,或将取决于:谁能以更低的资源代价,把更强的智能,带入更广阔的现实世界。

本文来自微信公众号 “阿尔法公社”(ID:alphastartups),作者:发现非凡创业者的,36氪经授权发布。

热门AI工具

更多
UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

0

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

0

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Kimi K2.6学习视频
Kimi K2.6学习视频

共1课时 | 138人学习

iOS应用UI控件开发基础视频
iOS应用UI控件开发基础视频

共148课时 | 40.4万人学习

Microsoft Copilot官方手册
Microsoft Copilot官方手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn