0903 | AI模型混战与信任危机:本周科技观察

||Download

Show notes

从Uber撤离非洲、澳航A380奇迹生还说起,再到一波AI模型与评测争议、Meta与谷歌的新闻、研究圈的信任问题,以及两则科学小趣闻。

时间轴

  • 00:00:04 开场
  • 00:00:27 Uber撤出非洲多国,全球业务再收缩
  • 00:01:38 半毫米油管与全员生还:航空与大脑的'极限'故事
  • 00:03:32 模型混战:Muse Spark 1.3、Gemini 3.8 Flash与Quasar 438B
  • 00:06:26 评测与成本:同一模型,差17倍的钱
  • 00:09:55 AI的信任危机:引用失真与毒蘑菇
  • 00:12:41 自托管与开发者工具圈动向
  • 00:16:07 收尾

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 大家好,欢迎回到节目,我是茉莉。

白桦: 我是白桦。今天这一期有点像一次“体检报告”:有公司在收缩地盘,有模型在疯狂内卷,也有工具圈的老项目面临生死疑问。把这些放在一起看,其实是同一个问题,技术世界里的钱、信任和冗余,到底都去哪儿了。

茉莉: 那我们就从最“收缩”的那条新闻说起吧。Uber宣布即日退出尼日利亚和乌干达。

白桦: 而且这不是孤立事件。在此之前,Uber已经退出了科特迪瓦和坦桑尼亚。算下来,Uber在非洲就只剩四个国家了:埃及、加纳、肯尼亚和南非。

茉莉: 对,相当于整个撒哈拉以南非洲保留的据点屈指可数。这个节奏感很强,它不是退出一个市场调整一下,而是系统性的收缩。

白桦: 大家讨论的时候普遍认为,这背后就是竞争和盈利压力。非洲市场单价低、运营成本高,网约车在那些城市很难跑出一个健康的单位经济模型。巨头一算账,就选择砍掉不赚钱的地方。

茉莉: 有意思的是,这留下一个空档。Uber走了,当地的出行需求不会消失,谁去填?是本地公司,还是别的国际玩家?这一点现在还是未知数。

白桦: 对,非洲出行市场的格局接下来怎么演变,值得持续观察。我们先把这条放一放,转到一个看起来完全不相关、但内核很像的故事,澳大利亚航空32号班机。

茉莉: 2010年,澳航32号班机,A380,二号发动机爆炸。事后调查发现,原因竟然是一条油管的管壁薄了不到半毫米。半毫米,一顶帽子的厚度都不止这种差距,就这么一个制造缺陷。

白桦: 但这个故事的结尾是好的:机上469人,全部生还。这就回到了我们开头说的“冗余”这个词。一架双层巨无霸客机,一个发动机炸了还能安全落地,靠的是工程设计里的层层备份,加上机组的训练。

茉莉: 空客设计A380的时候,明显把“任何一个部件失效都不能导致灾难”当成了底线。半毫米的缺陷没能击穿这套系统。这跟Uber退出非洲正好是两面:一边是公司在做减法,一边是工程在做加法,加的那部分在最关键的时刻救了人。

白桦: 而且你知道吗,大脑里也有一个类似的“机制比表面复杂”的故事。有一项关于老化大脑的研究,样本是61个人,规模不大,但结论很有意思。

茉莉: 传统的看法是,人老了,记忆力衰退,脑子“丢东西”。但这项研究发现,老化的大脑海马体并不是单纯地遗忘,而是过度泛化地提取记忆,结果就是跨类别的记忆混淆,把不同的事情搅在一起。

白桦: 换句话说,记忆不是被删除了,而是被“模糊化”了。这和澳航那架飞机其实是一个道理:表面上看是坏消息,发动机爆炸、记忆力变差,但底层机制都比我们想象的更复杂,理解机制才能找到真正的应对办法。

茉莉: 当然要提醒一句,那个研究样本只有61人,结论还比较初步,听听方向就好。好,从大脑跳到硅基大脑,聊聊最近的模型混战。

白桦: 这周模型圈非常热闹。先说Meta,他们发布了Muse Spark 1.3,定位很明确:面向智能体和编程任务,还提供了一个max reasoning模式。Meta自己的说法是,在多个基准上和GPT 5.6 Sol、Opus 5持平。

茉莉: “持平”这两个字要打个引号,厂商自己跑的基准嘛。但定价倒是公开透明的:一百万token的上下文,输入每百万token 1.25美元,输出4.25美元。开发者simonw实际测了一下,觉得它生成SVG的质量比1.2版本好。

白桦: SVG是个很好的试金石,因为代码对不对,画出来一眼就能看出来,没有多少粉饰空间。Meta在编程和智能体这条赛道上明显是认真的。

茉莉: 谷歌这边更夸张。Gemini 3.8 Flash发布,这是六周之内第三个Flash。价格是每百万token输入0.75美元、输出3.75美元,主打代码和智能体能力的提升。同时还发了一个专门的版本,叫3.8 Flash Cyber,面向网络安全。

白桦: 六周三个Flash,这个发布节奏本身就是一个信号:谷歌在用高频迭代来压价格、抢开发者。你刚发布一个版本,我这边更快更便宜的新版本就到了。

茉莉: 欧洲这边也有动静。Multiverse Computing的Quasar 438B,在Artificial Analysis的指数上拿了43分,是目前最好的欧洲模型,跑500个token用15.3秒,支持英语和西班牙语。

白桦: 43分放在全球榜单上不算顶尖,但“欧洲最好的模型”这个头衔本身就有地缘意义。各个地区都想有自己的本土选项,不完全依赖美国那几家。

茉莉: 不过说到基准和榜单,这里有个大问题。OpenTeams就公开批评了ArtificialAnalysis那张智能-成本图,说它用对数轴掩盖了实际价差。在对数轴上,十倍的价格差距看起来只是一小段距离。

白桦: 他们还提了一个更尖锐的观点:本地模型不应该按API定价来比较,应该按电费来算。你自己机房里跑模型,成本结构完全不同,把它画在API价格的图上本身就是误导。

茉莉: 这就引出了一个更深的理论问题:这些模型里面到底是什么?McCoy等人有一项研究,结论是神经网络的向量,包括大语言模型的向量,可以被封闭形式的符号结构来近似,而且不改变模型的行为。

白桦: 这话听起来很绕,但意思很刺激:一个纯粹“看起来是黑盒神经网络”的东西,也许可以被一套明确的符号表达式替代,行为还一模一样。那模型“内里”到底是什么?是学到的规则,还是压缩的统计?这个问题现在没有定论。

茉莉: 理论归理论,落到实际使用上,有个更扎心的发现。FrontierHarness做了一个评测:用9种不同的agent harness,跑同一个Kimi K3模型。结果单任务成本从1.05美元到18.34美元,差了17倍。

白桦: 17倍!同一个模型!这说明“用什么壳”和“用什么模型”同样重要,甚至有时候更重要。你花大价钱选了个顶级模型,结果你的工具链把它用得一团糟,成本反而爆炸。

茉莉: 这和刚才OpenTeams的批评正好接上了:大家在讨论AI成本的时候,往往只盯着每百万token的单价,但真正决定你账单的,是整个系统怎么用这个模型。

白桦: 而且好例子现成就有。Fable 5.1的代理群,一次性生成了旧金山联合广场的3D世界:453栋建筑、129家店面、220个行人。成本呢?大约800万token,33美元。

茉莉: 33美元生成一个城市街区级的3D世界,这个效率确实惊人。当然,质量细节怎么样、能不能迭代修改,这些还没说清楚,但作为一次性的生成演示,很能说明智能体编排的价值。

白桦: 说到本地和浏览器端,有个让人唏嘘的项目:WebLLM,一个跑在浏览器里的WebGPU推理引擎,一万八千八百个star。但评论区有人说,这个项目已经死了,建议改用llama.cpp的WebGPU支持,或者走ONNX路线。

茉莉: star数和项目活力完全是两回事。这种评论也很典型:一个项目可能代码还在,但维护停了、社区散了,后来者就该绕道。至于llama.cpp那条路是不是真的更好,评论里也没有给出特别硬的对比,这算是留给听众自己去试的开放问题。

白桦: 从技术圈再往外一圈,就是政策和商业的摩擦了。纽约市长Mamdani宣布,禁止小学和初中课堂使用AI。

茉莉: 支持者的理由很直接:学生应该先学会独立思考,在基础能力还没建立的时候就让AI代劳,等于跳过了思考训练。反对的声音当然也存在,但至少在讨论里,“先学会想,再学会用工具”这个逻辑是有很多人认同的。

白桦: 商业侧的大新闻是,谷歌赢了广告技术反垄断案,免遭拆分。不过这个裁决在讨论区争议不小,有人指出主审法官Brinkema是克林顿任命的,然后质疑裁决是不是下得太宽松了。

茉莉: 这里要公平地说:质疑法官的任命背景是一种态度表达,不代表裁决本身有问题。真正有实质意义的问题是,反垄断执法对大型平台的约束力到底还有多少,这个争论远远没有结束。

白桦: 还有一家公司这周有点狼狈:Mistral在Team层默认开启了用用户prompt做训练,而且中央管理里那个开关没了。用户投诉之后,他们才修正了文档。

茉莉: 注意这里的关键细节:是“文档修正”,而不是功能回滚的说法。对企业用户来说,默认打开训练是个隐私敏感问题,管理员失去控制开关更是雪上加霜。这类事情一旦发生,企业客户的信任要很久才能补回来。

白桦: 好,前面聊了模型好不好用、贵不贵,接下来这组新闻更狠:这些模型说的东西,到底能不能信?

茉莉: 先说一个审计。Haus Research检查了Perplexity的引用:1826条引用里,34.7%的页面打不开,或者页面上根本不含所引用的那个数字。如果按“主张”来算,失败率是14.4%。

白桦: 三分之一多的引用链接要么死了、要么对不上,这个数字已经很扎眼了。但更扎眼的在后面:有三个网站,2023年底才创建,批量生成了215128页“best software”类的内容,专门做给AI看的。而Perplexity的引用里,59.8%来自Tranco排名10万名之外的网站。

茉莉: 把这两个数据放在一起,画面就完整了:一批人批量生产低质量内容,专门喂给AI搜索;AI搜索又大量引用那些排名靠后的长尾页面。整个引用链条的质量控制,可能比我们以为的糟糕得多。

白桦: 而可靠性问题在某些场景下直接关系到人命。有一项研究用FungiTastic数据集,34万条观测、2800个物种,测试了GPT-5.6-Sol等4个大模型识别毒蘑菇的能力。结论是:错误的危险率高得可怕。

茉莉: “高得可怕”不是夸张修辞。你去野外采蘑菇,问AI这个能不能吃,它一本正经地给你一个错误答案,后果可能是中毒。这个研究等于给所有想拿AI做高风险判断的人敲了警钟:生成流畅不等于判断正确。

白桦: 行业也不是完全躺平,自救的动作有两条。第一条,Anthropic上线了基于C2PA的内容凭证检测工具,可以查一个文件有没有经过Claude处理。

茉莉: 但这个工具有个重要的边界要讲清楚:没有凭证,不代表内容就不是AI生成的。凭证只能证明“经过处理”,不能反证“没被AI碰过”。这是个单向的证据链,别把它当成AI检测器用。

白桦: 第二条来自安全圈。AISLE在curl里发现了6个CVE漏洞。有意思的是,此前Codex和Mythos这两个AI工具报告的都是零个。好在这6个全部是低危,并且已经在curl 8.22.0里修复了。

茉莉: 这个对比很微妙。一方面说明AI安全审计还远远不能替代人类研究者的深挖;另一方面也别过度解读——AI没找到不代表AI没用,可能只是任务定义和深度不同。但至少这一次,人类研究员赢了这个回合。

白桦: 从信任危机抽身出来,我们去开发者工具圈转一圈,那里的主题是:谁来养活这些我们每天依赖的东西。

茉莉: 先说个好消息。Immich,一个自托管的Google Photos替代品,用Docker就能部署,手机自动备份、多用户同步都支持。讨论区的反馈相当好,不少人是真实部署过之后来分享体验的,说用起来很舒服。

白桦: 对很多在意照片隐私的人来说,“自己的硬盘、自己的服务器、自动备份”就是终极答案。当然门槛还在:你得有一台服务器,得会一点Docker,这不是给普通用户准备的。

茉莉: 但自托管生态之外,依赖社区的项目日子未必都好过。SteamDB被Nexus Mods的母公司收购了,讨论区里两个担忧:一是担心功能以后被塞进付费墙,二是有人质疑这批数据到底有多大价值。

白桦: SteamDB那种数据,说白了是爬来的、聚合的,收购方图什么,社区看不透,所以才焦虑。这也呼应了我们前面说的:免费工具的存续,永远取决于背后有没有人愿意付钱。

茉莉: 说到付钱,LWN宣布了:2026年9月15日起,订阅费涨大约20%,这是2022年以来的第一次涨价。理由也很坦诚,订户增长已经停滞了。

白桦: LWN是Linux圈内深度报道的标杆,涨价20%听起来不多,但“订户增长停滞”这个理由说明了整个独立技术媒体的天花板:核心读者稳定,但扩张不动。这种项目的命运和SteamDB恰好相反,一个被收购,一个靠自己涨价续命。

茉莉: 再往技术深处走一步,有个很“程序员的浪漫”的更新。Bridson在2007年发表的那个泊松盘采样算法,就一页纸,到今天已经有近千次引用。而作者本人最近提出了一个新优化,叫“父点锥形剔除”,用来减少迭代次数。

白桦: 十几年前的算法,作者还在打磨它,这本身就是个很动人的故事。一页纸的论文能有这么长的生命力,说明好算法的标准就是简单、正确、可改进。

茉莉: 硬件这边有个值得安卓安全圈注意的消息,来自GrapheneOS:Pixel 11保留了最小化的MTE硬件支持,但因为性能退化,缓存加速被移除了,结果是在固件层面直接把MTE停用了。

白桦: MTE是内存标签扩展,对内存安全很有价值,GrapheneOS一直是它的坚定支持者。连他们都选择在固件里关掉它,说明这已经不是理念之争,而是性能代价大到没法接受。这对硬件安全特性的普及是个不小的打击。

茉莉: 最后我们去一次宇宙的角落。最大的暗物质探测器LZ,观测到了一个异常事件。

白桦: 但要非常克制地表述:只是一个事件,现在谈“发现”为时过早。研究团队正在收集更多数据,看看这个信号是真实的物理现象,还是背景噪音或者统计涨落。

茉莉: 这也是科学传播里最容易被扭曲的地方。“暗物质探测器看到异常事件”传着传着就变成“发现暗物质了”。实际上单个事件什么也说明不了,需要的是后续数据的统计显著性。

白桦: 好,今天从Uber撤离非洲讲到暗物质的一个光点,跨度确实大,但有一条暗线贯穿始终:不管是巨头收缩、模型内卷、引用失真还是固件妥协,都是系统在真实约束下做出的取舍。

茉莉: 而理解这些取舍背后的机制,澳航那半毫米油管告诉我们,往往比记住表面的“坏消息”重要得多。感谢大家收听,我们下期再见。

白桦: 再见。