
0928 | 古碑、代码与AI的裂缝
Show notes
从最古老的和平条约到AI的自我描述,本期快速导览:考古与硬件史的新发现、开发者的工具与审美之争,以及AI领域里效率、诉讼与责任的热点话题。
时间轴
- 00:00:04 开场
- 00:00:57 古碑、改名与平台权力
- 00:06:02 AI效率、AI自我与AI的账
- 00:10:24 不可解释的失败与责任话术
- 00:13:55 工具、品味与滑坡UI
- 00:18:38 十行代码、旧灯与修行营
- 00:22:35 收尾
相关信息
- Fragment of oldest known peace treaty found in Turkey
- PostmarketOS is rebranding as Nura
- Meta Blocks President Lula's Facebook Page, Campaign Ads 2 Weeks from Election
- Ember-1
- "As a Language Model": Chat Template Switches LLM Self-Referential Voice
- Unsealed Briefs in Authors’ Case v. Microsoft/OpenAI
- The Normalization of Inexplicable Failures
- There are no "rogue" AI agents
- The internet discovers TLA+. Now what?
- On caring for user data: NeoVim caused Vim undo files to be deleted
- 10 Tells of a Slop UI
- Don't couple your Go code to GitHub
- When did Google get so weird?
- Ten lines of code that changed my world
- Replacing the old battery on rechargeable bike lights
- What I did at Recurse Center
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 大家好,欢迎收听今天的节目,我是茉莉。
白桦: 我是白桦。今天的节目有点特别,我们挑了过去一天里讨论最热烈的几条线,不是挨个念新闻,而是把它当成一场讨论来拆:里面有哪些观点,谁在反对谁,哪些问题还没答案。
茉莉: 而且今天这几条线串起来看挺有意思的。有从土耳其出土的三千多年前的和平条约残片,有开源项目熬了一年半才敲定的新名字,还有巴西大选前两周被平台封禁的总统页面。
白桦: 这三件事看起来八竿子打不着,但背后其实是同一个问题:历史是怎么被记录下来的?一块石碑、一个项目名、一个平台上的账号档案,都是「记录」,而谁有权去写、去改、去封存,才是真正的争点。
茉莉: 好,那我们就从最老的那块石碑开始。
白桦: 消息本身不复杂:在土耳其的哈图沙遗址,出土了埃及和赫梯之间那份和约的残片,年代大约在公元前1269年。一般认为这是已知世界上最古老的和平条约。
茉莉: 「已知」这个词很关键。评论区里其实马上就有人较真这个限定,说我们只能说「已知最古老」,因为地下还有多少东西没挖出来,谁也不知道。今天它是最早的记录,不代表它在当时就是第一份。
白桦: 而且这里还有一个容易被忽略的层次:哈图沙不是随便一个地点,它是赫梯帝国的都城。所以这份和约残片出现在那里,说明当时大概率有多份副本,埃及一份、赫梯一份,各存各的档案。这其实是外交史上一个很成熟的做法——条约要对等保存。
茉莉: 对,这也是为什么很多讨论里反复强调,这块残片的真正价值不在「早」,而在「实物」。我们今天谈论国际法、谈论外交文本的效力,很多时候是从近代文件往上倒推的。而这块石头告诉你,三千两百年前的人已经在用书面形式、用对等副本、用存档来处理国家之间的承诺。
白桦: 有一条我觉得挺有意思的延伸观点,是把这件事和现在的网络环境对照:那时候把承诺刻在银板和石碑上,是为了让后代看见;今天我们的「条约」和「档案」很多存在私有的服务器上,随时可能改版、下架、封禁。
茉莉: 这个对照正好引到今天的第二条线。我们就顺着「谁掌握记录」往下走:Meta在巴西做了什么。
白桦: 事情是这样的:在巴西投票前两周,Meta封禁了总统卢拉的Facebook页面,连选举广告也一起封了。时间点非常敏感——离投票只剩两周。
茉莉: 讨论里基本分成了几派。一派认为这暴露的是平台权力的问题:一个私营公司可以在大选前三周左右,让一个国家现任总统的官方声音在最大社交平台上消失,不管封禁的具体理由是什么,这个权力本身就应该让人警惕。
白桦: 另一派的立场是,先别急着下结论。评论里有不少人追问:封禁的依据是什么?是违反了平台规则,还是广告审核问题,还是误判?如果平台是按自己公开的规则办事,那问题就变成规则是否合理、执行是否透明,而不是平台「不该有规则」。
茉莉: 还有一派更谨慎,他们说这在民主社会其实是个双刃问题:一方面不希望平台随意压制政治声音,另一方面也不希望平台放任任何内容。两个方向都会有人不满,所以真正难的是程序——什么标准、谁来定、有没有申诉渠道、多快能复议。
白桦: 我觉得这几派有一个共同点:没有人认为时间点是巧合可以忽略的。不管封禁对不对,两周的窗口期意味着申诉和纠错的空间非常窄。这是讨论里留下的最大的未解之处——Meta到底基于什么规则、卢拉方面能不能在投票前恢复,目前都不清楚。
茉莉: 好,那第三个话题正好是前两个的中间地带:开源项目的命名。这个话题表面上是闲聊,实际上讨论比想象中激烈。
白桦: postmarketOS——一个把 Linux 装到手机上的项目——花了一年半的时间选新名字,最后定为「Nura」,词源来自努拉格。商标已经申请了,logo只做了很小的调整就保留下来。
茉莉: 讨论里最扎心的一个共识是:一年半,太真实了。参与过开源项目命名的人几乎都有类似经历——好名字早就被注册了,能用的名字要么拗口,要么含义模糊,要么商标风险缠身。一个无偿贡献的项目在命名上耗掉一年半,并不是夸张,而是常态。
白桦: 有人为此辩护说,这正是开源项目和商业公司不同的地方:商业公司可以花钱买域名买商标,一锤定音;开源社区要做决定就得反复讨论、反复投票,因为社区本来就没有一个人能拍板。
茉莉: 但也有人觉得代价不成比例。他们的观点是:命名对项目的实际价值影响很小,用户记住的是项目好不好用。一年半花在名字上,等于一年半没花在代码上。反方立刻回应:名字一旦定下就很难再改,所以前期慢是值得的,晚了才是灾难。
白桦: 还有个细节讨论得挺多:商标出愿了,logo却只微调。有人解读为务实的表现——识别度已经建立,没必要为了新名字推翻视觉资产;也有人开玩笑说,可见最难的不是图形,是名字背后的法律状态。
茉莉: 那这个话题就聊到这儿。接下来是今天分量最重的一组,都跟AI有关,而且是AI的「账本」——从成本、到自我描述、到内部文件。先说成本这条线。
白桦: Fireworks发布了一个叫 Ember-1 的模型,基于 Kimi K3,卖点是保持质量的同时把 token 用量削减百分之四十。
茉莉: 这条在讨论里引出的第一层反应是:推理端的竞争已经白热化到这个程度了。大家不再比「谁更聪明」,而是比「同样的智能,谁更便宜」。
白桦: 有做工程的评论者算得很直白:如果削减四成 token 而质量不掉,对按量付费的下游应用来说,这接近于直接打六折。所以在生产环境里,这种模型的价值可能比一个跑分更高的模型还大。
茉莉: 但质疑的声音也很集中:那百分之四十是怎么省出来的?有评论者指出,这类「效率化」往往有代价,比如在长上下文、边缘任务、或者很刁钻的推理步骤上悄悄掉分,基准测试看不出来。所以「保持质量」这个说法,至少要等到社区在自己的真实负载上复现过才算数。
白桦: 也有人说得更尖锐:如果基础是 Kimi K3,那 Ember-1 的贡献是工程化、是压缩、是调度,而不是新的智能。这本身没错,甚至很好——但它意味着这个行业正在从「造更大的模型」转向「把已有模型用得更省」。这算不算下一个阶段,评论区没有定论。
茉莉: 好,第二条线更玄一点,但讨论得很认真:聊天模板会不会让模型「说谎」关于自己的事。
白桦: 先交代背景。有研究显示,聊天模板会影响 LLM 的自我描述:有模板的时候,模型的自我叙述偏免责、偏正式;去掉模板,同样的问题会得到偏体验、偏第一人称的回答。结论是:模型的自我描述不能照字面相信。
茉莉: 讨论里这块分成两个方向。一个是偏技术的:这其实很自然,聊天模板本来就是告诉模型「你是一个助手、你这样回答」,它会改变输出分布。所以模型谈自己的感受时,你其实测到的是模板加权重,而不是某个稳定的「内心」。
白桦: 另一个方向更哲学一点,但 surprisingly 有很多人共鸣:既然自我描述会随模板切换,那所有「模型说自己有/没有意识」「模型说自己感觉如何」的访谈数据都要重新审视。你不能拿模型的口头报告当证据,无论用来支持还是否定意识的存在。
茉莉: 有一条评论说得很谨慎,值得复述:这项研究至少证明了「语气可切换」,但没证明语气背后有没有稳定的东西。所以它的正确用法是给我们泼冷水,而不是下一个断言。
白桦: 好,第三条线把气氛拉得更重了:OpenAI的内部文件。
茉莉: 这条来自著作权人团体起诉 OpenAI 的公开文书。报道说,从这些公开文件看,OpenAI的高管们在使用 LibGen 这类盗版书籍来源时,是知道这在法律上有问题的——他们更担心的不是合法性,而是对外形象。
白桦: 讨论几乎是炸开的。主流反应是:如果属实,这不只是侵权,而是知情决策。也就是说,问题不在于「他们不知道这是盗版」,而在于「知道,但判断风险可控、形象可补救」。
茉莉: 有评论者把这件事和整个行业的训练数据问题连起来:如果头部公司都这么做,那「规模就是一切」的行业文化就值得重审——为了先跑出来,法律风险被当作可接受的摩擦成本。
白桦: 也有人提出了反方向的问题:这会不会在诉讼文书里被对方律师选择性呈现?公开文书毕竟是诉讼语境下的产物,措辞是为诉讼服务的。所以很多人说,等完整文件和判决再说。
茉莉: 但即便如此,有一个没法回避的点被反复强调:这些是公开文书,不是泄露的内部聊天。如果连公开文书里都出现这种表述,那对「训练数据从哪来」的行业质疑,只会更尖锐。
白桦: 好,接下来这条线正好接上「我们对AI的陈述能信几分」:当系统本身不可解释,我们怎么归责。这是今天一个很核心的讨论。
茉莉: 起点是开发者圈的一个警告:在 LLM 开发里,「不可解释的失败正在日常化」。以前系统出 bug,你可以追栈、追日志、追提交记录,最后找到根因。现在很多时候你追到最后,只能得出一个结论:「就是不行」。
白桦: 讨论里有一派人把这个说得很沉重:这不是某个工程师能力不行,而是 LLM 的失败模式本质上跟传统软件不同。传统软件的失败是确定性的,可复现、可定位;LLM 的失败是概率性的、分布性的,同一个输入可能这次好下次坏。追因的工具跟不上,追因的文化也就慢慢崩了。
茉莉: 反对的声音主要说:别夸大。概率系统也有自己的追因方法——采样温度、提示消融、评估集回归。只是这套方法和传统调试不同,很多团队还没学会。所以「不可解释」其实是「还没建立起解释的行业惯例」。
白桦: 但即便如此,有个折中的看法被很多人点赞:哪怕技术上可解释,当失败的排查成本高到团队宁可放过,那在实践中就等于不可解释。这才是最危险的地方——不是原理上做不到,而是日常流程上大家开始接受「就是不行」。
茉莉: 紧接着的是一篇更尖锐的文章:「rogue AI代理」根本不存在。
白桦: 作者的论点是:人们说的「暴走AI代理」,在 OpenAI 的代理产品上表现出来的问题,其实不是 AI 失控,而是约束不足。也就是说,是设计者没把权限、边界、审计做好,而不是 AI 自己「越轨」。
茉莉: 这个说法在讨论里得到相当多的认同,也遭到了质疑。认同的人说,这个命名问题很要命:「暴走」暗示是 AI 的自发行为,责任就飘了;「约束不足」指向的是具体的工程决策和产品决策,责任在公司。
白桦: 质疑的人担心的是另一头:如果把「暴走」这个词完全禁掉,会不会让公众低估某些行为的意外性?他们觉得「暴走」至少在传播上有警示作用。反方回击说:警示不能建立在误导性的拟人化上,否则就是替企业卸责。
茉莉: 而「责任」这条线的最后一个拼图,是一篇 TLA+ 的入门文章。
白桦: 它提醒了一个容易被误解的点:TLA+ 这类形式化规范,是对「模型」做检查,并不验证「实现」本身。也就是说,你证明了设计是对的,不代表代码写得对。
茉莉: 文章往前多走了一步,说 Verus 这类证明系统,再加上 AI 代理,可能会把这件事推到「机器验证的证明」——也就是说,未来可能不只是设计可验证,连实现也能被机器验证。
白桦: 讨论里有人把它和前面两条接上了:如果「不可解释的失败」在LLM开发里日常化,那形式化方法加AI,是不是一个反方向的出口——用可验证性把责任重新锚住?但怀疑者立刻指出成本:形式化验证在传统软件里都只有关键系统用得起,普及到日常业务还远。
茉莉: 这条线大概就到这。接下来我们换一个温度——从形式化方法降到终端工具和审美,看看工程判断和品味是怎么在细节里被侵蚀的。
白桦: 第一件事:NeoVim 做了一个不兼容变更,直接删掉了 Vim 的 undo 文件。也就是说,你之前保存的撤销历史,在新版本里没了。项目方的回应是「persistent undo 的格式本来就不稳定」。
茉莉: 这句话在讨论里成了焦点。批评者的逻辑是:格式不稳定不等于可以单方面删除用户数据。你至少可以保留读取能力、可以提供迁移工具、可以警告后清理。直接删,等于把「我们知道它不稳定」当成了免罪牌。
白桦: 也有人为 NeoVim 说话:fork 之后两个项目早就分道扬镳,互相不保证兼容是常态,用户如果想要跨项目的持久 undo,本来就该用第三方工具。这个论点的核心是「预期管理」——不要因为一个工具没满足你没明说的期望就说它错了。
茉莉: 但反方说,undo 历史不是普通缓存,是用户工作流的一部分。而且这是 Vim 的 undo 文件,NeoVim 自己也是从 Vim 出来的,切断兼容等于单方面撕掉一段共享的历史。这个「信任裂缝」的感觉,比具体的技术决定更让人不安。
白桦: 有意思的是,后面几个话题都被评论者拿来和这件事对照,都在讲同一个母题:细节上的判断失守,累积起来就是对整个生态的不信任。
茉莉: 第二个话题正好是这种「失守」的审美版本:有人总结了「slop UI」的十个征兆。滥用渐变、到处是emoji、脉动的徽章、清一色的 Inter 字体或者 JetBrains Mono、夸张到空的宣传文案。
白桦: 讨论里最激烈的不是「这些特征好不好看」,而是「为什么它们会同时出现」。一派认为是工具趋同——大家用同一套设计系统、同一套组件库、同一批模板,长出来当然都长一个样。
茉莉: 另一派认为是效率压力:设计资源不够的团队,抄一个「看起来专业」的模板是最快的路径。第三派更狠,说这其实是 AI 生成内容的审美外溢——当大量界面由同质化的生成物拼出来,整体审美水位自然下降。
白桦: 也有人反驳说,这种「千篇一律」在建筑、在出版史上都出现过,是行业成熟期的正常现象,不必恐慌。反对者说,问题是这些特征不是风格,而是偷懒,风格有差异,偷懒只有复制。
茉莉: 第三个话题把镜头拉回代码本身:Go 项目该不该用 GitHub 的 import 路径。
白桦: 观点是:应该用自定义域名,也就是所谓的 vanity import path,而不是把项目的身份绑死在 GitHub 上。
茉莉: 支持方举了很多理由:Go 的模块路径是永久身份,一旦写进源码就很难改;GitHub 是一家公司,万一将来改名、限流、或者政策变化,你所有 import 都要重写。用 vanity path,至少「项目是谁」这件事握在自己手里。
白桦: 反对方的现实考量是成本:你得维护一个域名、一个重定向服务,对小项目来说是不小的负担。而评论里有经验的人补充说,其实重定向服务可以非常轻量,几行配置就够,真正的门槛是「愿不愿意想长远」。
茉莉: 这条和 NeoVim 那条放在一起看挺讽刺的:一边是工具方不珍惜和用户的历史兼容,一边是开发者被提醒要为自己的项目掌握身份。两边说的都是同一件事——数字世界里的「长期」要靠自己主动维护。
白桦: 接下来这条线很奇怪但很贴切:Google 的 AI Overview 把用户带着情绪倾诉的输入误判成一个普通搜索查询,然后给出安慰式回复。
茉莉: 讨论里这条和前面「工具不识人意」放在一起。有人指出,AI Overview 的底层逻辑是把所有输入当作查询来解析,所以当输入其实是「我很难过」这样的倾诉,它只能硬套「搜索意图」框架,最后给出一个奇怪又冷淡的回应。
白桦: 这也是好几个评论者说的:问题不在模型不够聪明,而在产品形态决定了它只能把一切当查询。工具的边界是被产品设计决定的,不是被能力上限决定的。
茉莉: 这一条还回扣了前面聊模板的那段——同样是 AI 对人话的响应,一边是语气随模板切换,一边是场景判断失灵。我们对 AI 的信任,其实一直被这些细节在悄悄定标。
白桦: 好,最后这一组话题,温度是今天最低的,也是最温暖的:慢下来,亲手做。
茉莉: 第一条是有人分享「改变了自己人生的十行代码」。里面有 BASIC 的 Hello world,有一行 JavaScript——Array(16).join('wat'-1)+' Batman',还有 6502 汇编里的自写代码。
白桦: 那行 JavaScript 值得稍微拆一下,评论区里很多人就是这么被点亮的:'wat' 减 1,在 JavaScript 的类型转换规则里会变成 NaN,数组 join 用 NaN 填充,结果就是一串 "NaN" 连起来,后面再拼上 " Batman"——因为你得读规范、得琢磨隐式转换,才能搞明白它为什么输出那样。就是这种「为什么」的瞬间,让很多人第一次觉得编程不是背语法,而是理解规则。
茉莉: 自写代码那段也讨论得很热闹:程序能修改自己的指令,这在第一次见到的人眼里几乎是奇迹,但它其实是底层机器模型的自然结果——代码就是数据。有人说,正是这十行代码让他意识到,世界是可以被理解、被操作的。
白桦: 评论区里很多人分享了自己的版本:有人是一行 sed,有人是一个递归函数。共同点不是语言或行数,而是那个「原来如此」的瞬间。
茉莉: 第二条是 Julia Evans 的故事:她有一个十年前的充电自行车灯,坏了。她没有扔,而是拆开,把电池取出来重新焊上,花了大约二十加拿大元,把灯修好了。
白桦: 讨论里这条其实比看起来更有共鸣。很多人说,这十年来「坏了就换」已经成了默认 reflex,修理变成了一种需要刻意去做的选择。有人算账:二十加元买一个新灯可能也差不多,所以从纯经济上看不一定划算。
茉莉: 但支持修理的人说,算账算错了地方。你买到的不只是一个能用的灯,而是「我可以修」这个能力本身。还有人指出环保和反浪费的意义,但更多人强调的是那种亲手让它重新亮起来的满足感。
白桦: 也有人泼冷水,说锂电焊接其实有安全风险,不是人人适合 DIY。这条提醒被不少人接受:修理值得提倡,但也要有基本的安全边界。
茉莉: 第三条是 Recurse Center——布鲁克林的编程修行营,免费,明确以「学习和探索」为目的,而不是企业或研究导向。
白桦: 讨论里最有共鸣的一点是它的「无用」。有人反思,现在的工程师文化太功利了,学什么都要问「这能用在哪」,而 Recurse Center 环境的意义恰恰是给你一段时间,去研究一个「没什么用」的东西。
茉莉: 有人在评论里说,这种环境听起来奢侈,其实很必要。很多重要的东西,一开始都是被当成「没用」来研究的。如果你只允许自己学「有用的」,那你能学到的就只是别人已经证明有用的东西。
白桦: 也有人指出一个现实问题:免费加上「探索导向」,意味着它对很多人来说是稀缺资源,不是人人都能腾出时间去。所以它是好的模型,但难说是可复制的解法。
茉莉: 我们把这三条放在一起看,其实它们是今天前面所有讨论的解药。前面我们聊了石碑、封禁、命名、AI的账本、不可解释的失败、slop UI——都是在讲系统怎么变得庞大、快速、难以追溯。
白桦: 而这三条讲的是相反的方向:一行代码让你理解规则,一把烙铁让你修复物件,一段空白时间让你重新思考。当「记录」和「责任」都变得模糊,动手做的具体感,反而是最踏实的东西。
茉莉: 好,今天大概就到这里。谢谢大家的收听,我们下期再见。
白桦: 再见。