1003 | 模型为王的时代:从SaaS外壳到本地引擎

||Download

Show notes

从SaaS变成模型外壳的商业逻辑,到苹果的隐私新规、开源AI硬件和本地推理引擎,再到开发者工具与博物馆里的计算机文化,本期快速梳理AI落地与旧技术传承的交汇点。

时间轴

  • 00:00:04 开场
  • 00:00:31 SaaS沦为模型外壳:harnais、成本与数据库并购
  • 00:06:17 AI走进设备与轨道:Muse Gadgets与太空TPU
  • 00:08:35 代理时代的隐私收紧与开发便利
  • 00:10:43 本地推理引擎:从DwarfStar到Stratego AI
  • 00:13:02 开发者工具链:Zig 0.17与Gleam写作流
  • 00:15:09 保存与回望:计算机博物馆与冯·诺依曼传奇
  • 00:18:43 收尾

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。

Transcript

茉莉: 大家好,欢迎收听本期节目,我是茉莉。

白桦: 我是白桦。今天这期有点意思,我们拿到的这批故事,表面上看很分散——有商业模式、有开源硬件、有博物馆,但它们其实都绕着同一个问题在转:当模型成为核心,人做的那些东西,外壳也好、工具也好、数据库也好,到底还剩多少分量?我们从第一篇聊起。

茉莉: 对,第一篇是 Shrivu Shankar 的一篇观点文,论点非常直白:所有 SaaS 公司最终都会变成围绕模型的「harnais」,也就是一种套在模型外面的挽具。但关键是,他认为这个 harnais 本身恰恰是核心竞争力所在,绝对不能外包出去。

白桦: 我先把这个概念掰开说一下,因为这个词挺容易误解的。「harnais」就是马身上套的那套挽具——马是引擎,挽具决定马力能不能传导到犁上。他的意思是:模型本身越来越商品化,大家都用差不多的底座,那么真正决定胜负的,是你怎么把模型「套」进具体业务里,怎么设计围绕它的工程、界面、流程。

茉莉: 这个说法其实把一个老争论重新摆上了台面。以前有个流行的悲观论调,叫「thin wrapper」,薄壳论,说那些套在 OpenAI API 外面的应用毫无护城河,模型一升级就被碾过去。Shankar 的立场刚好相反:他承认你会变成外壳,但主张外壳不是可有可无的装饰,而是整个系统里最难做、最不该交给别人的部分。

白桦: 对,而且这里有个内在张力,值得听众自己琢磨。你想,如果 harnais 是核心竞争力,那它一定得是你自己的、深度定制的;但反过来说,如果模型厂商每代都在变接口、变能力,你的定制是不是随时会被上游的一纸更新冲掉?他自己也承认这是个待观察的问题——harnais 的可防御性到底有多强,现在没人能打包票。

茉莉: 单看一篇观点文还不够,我们得看有没有现实证据支持「模型加外壳」这个模式真的跑得起来。这时候第二篇材料就非常关键了。Wagtail,就是那个做内容管理系统的开源项目,他们公布了一个数字:一个月之内,在 GLM 5.3 Flash 上用掉了二十亿个 token。

白桦: 二十亿,一个月,一个项目。而且他们的重点不是「我们用了多少」,而是「这笔钱我们完全负担得起」——成本和用量都在可控范围内,跑的是代理式的编程工作流。这在我看来是对 Shankar 那篇文最好的脚注:代理式开发在经济学上已经不是实验,是日常运营了。

茉莉: 而且注意他们选的模型。GLM 5.3 Flash,显然走的是性价比路线,不是最贵最强的那个。这本身就是一种态度:当你的外壳——你的 agent 工作流、你的任务拆解——足够好的时候,你不需要最贵的马,你需要一匹够用而且便宜的马。这跟 harnais 论完全呼应:价值正在从「哪个模型最强」转移到「谁把流程串得最好」。

白桦: 这里可以想象一下反对者会怎么说。有人会讲,Wagtail 能把成本压住,是因为编码任务特别好验证——代码能不能跑、测试过不过,一眼就能看出来,所以可以用便宜模型大批量跑。换成别的领域,比如医疗建议、法律文书,验证成本高,便宜的模型就未必划算了。所以这个二十亿 token 的案例,说服力到底能外推多远,是存疑的。

茉莉: 对,我不替它外推。但从他们的第一手报告看,至少在编码这个场景,账算得过来,而且他们选择公开这个数字,本身就是在向社区证明「这条路我们养得起」。

白桦: 那么顺着这条线往下走,就到了第三块拼图。Shankar 说模型加外壳,Wagtail 证明外壳加成本可控,接下来自然是:外壳底下垫什么?数据放哪?Supabase 收购了 Turso,这笔交易给出的答案挺清晰。

茉莉: 我们把两边交代一下。Supabase 是围绕 Postgres 做的,BaaS 那一套,数据库加认证加存储;Turso 则是做 SQLite 方向的,主打轻量、边缘部署。收购之后,双方明确说了,各自的路线不变——Postgres 还是 Postgres 的轴,SQLite 还是 SQLite 的轴。这点值得强调,不是吃掉然后阉割,而是两条技术路线并行保留。

白桦: 而交易的说法很直白:这是为「代理服务的数据库基础设施」做的布局。你想想这两年的趋势,AI agent 开始大量自己创建数据库、自己读写数据、跑完任务就丢。这种负载跟传统应用的数据库需求完全不一样——要的是开得快、扔得快、量大、单价低。SQLite 那种嵌入式模型天然适合这种用法,Postgres 那种重炮则继续服务传统后端。

茉莉: 所以这三篇放在一起,就构成了一幅新的商业分层图。底层是模型,上面是 harnais,也就是各家 SaaS 的护城河,再往上是基础设施层——数据库厂商开始专门为代理负载重新设计产品,成本控制则贯穿始终,决定这一切能不能规模化。四样东西,缺一样这个生意都不成立。

白桦: 我觉得还有一个悬而未决的点,值得留给时间检验:如果 harnais 真的是核心竞争力,那 Supabase 这种基础设施公司算不算也在造 harnais?他们收 Turso,是在给别人的 agent 铺路,还是在给自己的 agent 时代抢地基?边界越来越模糊了。

茉莉: 好,我们就把这个问题留在这。既然核心是模型,下一个自然的问题是:算力到底放在哪、离人有多近?这正好把话题引到硬件层面。

白桦: Meta 这次搞了个挺有意思的发布,叫 Muse Gadgets。做法非常务实:用 ESP32 和树莓派这些便宜的开源硬件,把他们的 Muse AI 连接到屏幕、传感器,还有各种日常物品上。而且整套东西是开源的。

茉莉: 「Gadgets」这个词起得很诚实,它不装作是革命性产品,就是一堆小玩意儿。但方向上它是很认真的:AI 不该只活在聊天框里,它得伸进物理世界——你的桌子、你的灯、你的传感器。而实现路径选了最便宜的一条,几十块钱的板子。

白桦: 这里有个值得讨论的悬念:开源硬件生态,历史上成功过——ESP32 本身就是活证据——但「AI 厂商发一套开源参考设计」能不能演化成真正的标准,还是又变成一个开源了但没人跟的孤岛?大厂发开源硬件,最后社区接不接盘,这个现在真说不准。这大概是整个发布里最值得观望的部分。

茉莉: 同一个问题的另一个极端答案来自 Google。他们的 Project Suncatcher,思路是把 TPU 放到太空里去。首颗原型卫星,是搭 SpaceX 的 Transporter-18 发射入轨的,而且地面已经确认建立了联系。

白桦: 这个想象一下就知道有多大野心:把算力搬到轨道上,用太阳能持续供电,推理在离地几百公里的地方跑。跟 Muse Gadgets 正好是光谱的两端——一个把算力塞到你家灯泡旁边,几厘米的距离;一个把它推到几百公里外的真空里。但两者回答的是同一个问题:算力放在哪、离人有多近。

茉莉: 不过我得提醒一句,Suncatcher 目前只是原型卫星入轨加确认联系,离「轨道算力」这个愿景落地还非常远,中间隔着散热、维护、带宽、成本一整片无人区。我们今天讨论的是方向,不是成果。

白桦: 而且这两条路线放在一起,还牵出一个更现实的问题——算力越往设备上靠,隐私的风险就越大。你家里到处是传感器,它们连着一个会理解你所有言行的模型。这正好接着说下一组新闻,主角还是那个最在意权限的公司。

茉莉: Apple 这边做了两件事,方向相反,放在一起看特别有意思。第一件是收紧:macOS 上对「全盘磁盘访问」的权限加了额外的控制层。理由说得很明白,就是因为自主 AI agent 的风险在上升——一个能读你整个硬盘的代理,一旦失控或被滥用,后果比以前的恶意软件严重得多。

白桦: 这个收紧的逻辑链值得展开。以前全盘访问的门槛设计,是针对「应用」这个威胁模型做的:你知道你装了 Photoshop,它要什么权限你大概有概念。但 agent 不一样,它是半自主的,它会自己决定下一步做什么,人根本来不及逐一审查。旧门槛对新威胁失效,所以只能再加一层。这个理由我觉得是站得住的。

茉莉: 第二件是放松,或者说,是给开发者松绑:他们发布了 Pass Designer 的测试版,跑在 macOS 27 上,可以实时创建和预览 Wallet 通行证,还带语义标签和验证功能。也就是说,一边把系统入口收得更紧,一边把开发者工具做得更顺。

白桦: 一紧一松,这个组合拳很有 Apple 的风格。系统权限上寸土不让,因为那是用户信任的根基;开发体验上不断加码,因为那是生态的根基。两件事不矛盾,甚至是同一战略的两面。

茉莉: 值得留下的观察点是:Apple 这次收紧,理由直接指向 AI agent。那其他平台——Windows、各种 Linux 发行版、安卓——会不会跟进类似的「代理专用权限模型」?如果 agent 真的成为主流计算方式,权限系统整个都得重新设计一遍,现在各家应该都在想这件事,但没人先交卷。

白桦: 而且 Apple 的收紧是针对云上、针对系统层面的。那如果把推理整个搬到本地、不经过云端呢?权限问题解决了吗?恰恰引出我们的下一组话题:本地跑模型的努力,现在走到了哪一步。

茉莉: 先说个人项目这一边。antirez——就是写 Redis 的那位——发布了 DwarfStar 4,一个用 C 语言写的推理引擎,能在 Metal、CUDA 和 ROCm 三种后端上本地跑模型,支持的包括 DeepSeek V4、GLM 5.x 和 Qwen3.8。

白桦: 这几个信息点都值得停一下。第一,C 语言手写推理引擎,这是很古典的工程路线,追求的是完全的掌控和极致的精简。第二,覆盖 Metal、CUDA、ROCm,等于一张代码同时喂 Apple Silicon、NVIDIA 和 AMD 三家,这个兼容面是很多商业产品都做不到的。第三,支持的模型名单说明,开源大模型已经多到值得为它们专门做本地引擎了。

茉莉: 同一周,学术圈那边也有一个高度相关的工作。CMU、MIT、NYU 和 Stanford 合作的项目叫 Ataraxos,去打了 Stratego,也就是那种所有棋子面朝下、信息不完全的棋类游戏,以 15 比 1 击败了人类最强玩家,硬件是 16 块 GPU。

白桦: 这局里最有意思的不是比分,是架构上的那个关键设计:他们用了第二个神经网络,专门负责猜测对手隐藏的棋子身份。也就是说,一个网络学怎么下,另一个网络学怎么「读心」。这种针对信息不完全博弈的专业化设计,通用模型是不做的,只有自建训练栈才会往这个方向深挖。

茉莉: 所以这两件事放在一起,我认为它们在讲同一个道理:专业化的自建推理和训练栈,能在特定任务上压制通用方案。antirez 的引擎是在推理侧做专业化,Ataraxos 是在策略侧做专业化,殊途同归。

白桦: 不过反对的声音可以预见:本地跑大模型,量化损失到底有多大?这是永远绕不开的问题。你为了塞进消费级显存,把几十 B 的模型压到低位宽,能力掉多少,压在什么任务上掉,这些问题 DwarfStar 这样的项目自己不会主动告诉你。这是目前最大的未知数。

茉莉: 而说到「自建栈」,支撑这些引擎的,其实是底下那层被反复打磨的工具链。我们就顺势聊工具。

白桦: Zig 发布了 0.17.0。这版背后是五个月的工作、206 位贡献者、925 个提交。两个重点:一个是 build system 整个重新打磨过,另一个是给 x86_64-linux 加了 ELF 的增量编译。

茉莉: 增量编译这件事对开发体验的影响,用过的人都知道——改一行代码,不用重新编译整个程序,只编译改动部分。以前这种体验基本是 IDE 内置工具链的专利,Zig 把它做进了编译器本身,对那种大型项目的迭代速度提升是实打实的。

白桦: 206 位贡献者这个数字也说明,这门语言还处在大量人力持续涌入的阶段,社区不是靠一两个人硬撑。这种规模的协作本身就是一个语言项目健康度的信号。

茉莉: 另一边是一个更小、但同样较真的故事:有开发者分享了自己用 Gleam、Org-mode 和 Pandoc 写博客的流程。在 Emacs 里用 Org-mode 写作,转出 Pandoc 做格式转换,再用 Blogatto 加上 Nix,搭成一条带静态类型的发布流水线。

白桦: 写个博客而已,至于吗?这是很多人的第一反应。但如果你顺着上一段聊的逻辑看,就会发现这是同一种性格:为了确定性,为了类型安全,愿意投入不成比例的工具建设。antirez 用 C 手写引擎,Zig 社区重写构建系统,这位用 Gleam 把博客管线做成类型化的——都是在跟「随缘」作对。

茉莉: 我觉得这也是本期一个隐含的主题:从模型到外壳到数据库到编译器,每一层都有人在拒绝将就,坚持把地基按自己的标准重铺一遍。至于这套标准是不是永远正确,那是另一回事,但这种态度本身就是技术社区最有生命力的部分。

白桦: 工具之外,还有个更长远的问题:这些东西——机器、语言、人物——最后都去哪了?聊点保存与回望的事吧。

茉莉: 先看荷兰。有篇帖子介绍了三家计算机博物馆:Helmond 的 HomeComputerMuseum、Zwolle 的 Bonami,还有一个「DEC barn」,一整个谷仓放着 Digital 的老机器。

白桦: 这三个地方各有味道。HomeComputerMuseum 主打家用电脑的完整脉络,据说可以上手玩;Bonami 收藏面很杂,从街机到各种旧电子设备;DEC barn 则是垂直深挖一个已经消失的公司——Digital Equipment 那个时代的小型机,现在活着的实物越来越少了。

茉莉: 然后故事转到一个反例,特别值得对比:日本关西的 Shimano 自行车博物馆。Shimano 是自行车零件巨头,但他们的博物馆讲的是整个自行车行业的历史,不是自家企业史,馆内不卖货,也没有自我推销的成分。

白桦: 这个对比我特别想多聊两句。企业博物馆最常见的失败模式,就是变成高级展厅,观众进门就知道自己要被营销四十分钟。Shimano 反着来,把叙事主体让给行业本身,自己的角色退到幕后。这种克制反而让企业形象更可信。你看 DEC barn 那种个人收藏,也是同理——热爱本身就是最好的策展动机,不需要附加商业目的。

茉莉: 从保存机器,自然过渡到重读人物。有人重新发掘了一篇 1973 年 Halmos 写的文章,《The Legend of von Neumann》。Halmos 是著名的数学家兼作家,他笔下那个冯·诺依曼,是上世纪最狂野的智力传奇之一。推荐的人还顺手附赠了书单:《The Man from the Future》——那本较新的冯·诺依曼传记,还有《Turing's Cathedral》,讲冯·诺依曼和普林斯顿那台早期计算机的书。

白桦: 为什么一篇五十多年前的旧文值得今天重新读?我觉得是因为冯·诺依曼恰好站在我们此刻讨论的一切的源头:存储程序计算机、博弈论、元胞自动机——今天聊的数据库、推理引擎、甚至 Ataraxos 那种博弈 AI,往上追几代,都追到他那里。重读他不是怀旧,是给今天的讨论找坐标系。

茉莉: 说到坐标系,最后我们用一个真正的长镜头收尾。天文学家把十二年望远镜观测的图像叠起来,得到了 HR 8799 系统的四颗巨行星绕轨道运行的完整影像——这四颗都比木星还重,距离我们 133 光年。

白桦: 十二年的连续观测,才够一颗行星在轨道上走出可见的一段弧。你想想:我们今天讨论的 Zig 版本五个月就发布,Wagtail 一个月烧二十亿 token,博物馆里那台 DEC 机器是半个世纪前的——而 133 光年外,有个星系的钟表以几十上百年为单位转动,人类花了十二年才看清一格。把今天和宇宙尺度的时间放在同一个画面里,很多眼前的争论会显得既重要,又不那么重要。

茉莉: 这大概就是今天所有故事最深的共同点:无论是不肯外包 harnais 的创业者、手写 C 引擎的程序员,还是守着谷仓里旧机器的收藏家,大家都在用自己的方式,跟时间打交道。今天就聊到这里。

白桦: 谢谢收听,我们下期见。