堆代码网讯 如果你还没听过 PrismML,那你应该留意一下了。这家 AI 实验室虽然目前只融了 2225 万美元种子轮,不算什么大钱。但你看看站在它背后的人,以及它正在做的事,就值得你多看一眼
。PrismML 的押注的赛道很简单:能推理、性能强的大语言模型,不一定非得是个庞然大物。它正在把推理模型压缩到能塞进个人电脑,甚至智能手机里。有传言说它在跟苹果接触,不过 CEO Babak Hassibi 拒绝向 TechCrunch 证实这件事。

周四,PrismML 放出了 Bonsai 2 27B。这是它模型家族的最新成员,做法是把阿里巴巴那个被广泛使用的开源模型 Qwen3.8 27B 压到 5.9 GB。5.9 GB 是什么概念?一台普通 PC电脑就 装得下,配置高点的手机也妥妥没问题。内存占用比原版少了 9 到 10 倍。
这家公司是由一群加州理工学院的研究人员创立的,Hassibi 领头。他是 Caltech 教授,搞压缩技术出身。顾问名单里还有 Ion Stoica——Databricks 的联合创始人,伯克利 Sky Computing Lab 的主任。那个实验室孵出过不少东西,从 Letta 到 SGLang,都是它带出来的。投资方包括 Khosla Ventures、Cerberus Capital 和加州理工学院本身。
做 LLM 压缩的当然不止 PrismML。西班牙 Donostia 国际物理中心一位知名教授创立的 Multiverse Computing 也在做,而且融的钱比它多得多。但 Hassibi 说,PrismML 不一样的地方在于,压缩之后性能几乎没掉。Bonsai 2 在 Qwen 的综合基准测试分数上匹配了 98%。今年 3 月发布的第一代 Bonsai,这个数字是 95%。第一代模型已经被下载超过 1100 万次,更小的那些模型又贡献了 260 万次下载。
这说明它的压缩效果在一次次发布中确实在变好。能不能最终做到 100% 持平?还得看。Hassibi 自己说,压缩大概率总会带来一些影响。不过话说回来,完美的基准持平本身也有点学术。LLM 没压缩的时候也没那么准,基准测试也没完美到能代表真实任务。2% 的性能下降,放到实际使用里,未必感觉得出来。更何况模型外面那层软件——也就是它运行所处的框架——对准确性的影响也很大。
PrismML 的做法是缩小模型的“权重”。权重就是模型训练时学到并存下来的信息。通常每个权重需要 16 位,PrismML 把它简化成三种值:+1、−1 或 0,叫“三值”权重。每个权重存的值小了,整个模型占的空间自然就大幅缩水。想看更深入的技术细节,可以去翻这个项目的 Hugging Face 页面。下一步,PrismML 要把这套压缩技术用到更大的模型上。Hassibi 告诉 TechCrunch:“我们接下来希望在未来几个月内发布的模型,会到数千亿参数级别,我预计在那里保留智能会更容易。”
他补充说,模型越大,“压缩时不损失智能的空间就越大。所以总体趋势是,越大的模型,越容易做到 100%。”
Stoica 对这件事很兴奋,原因倒不复杂:先进模型终于有可能跑在用户自己的设备上。“智能就在你手边,而且是免费的,因为它跑在你已经买来的设备上。它也是私密的,因为你不用把它发到云端。”