1008 | 从开源大模型到机器人训练:本期值得关注的 AI 新品

||Download

Show notes

本期节目按主题梳理一批新工具与新模型:从欧洲的万亿参数开源大模型和 Google 的新图像模型讲起,再到把任务真正交给 Agent 的办公与生活应用、帮你谈生意谈offer的对话型 Agent,然后是注重隐私的开源与本地化产品,最后聊开发者协作平台以及机器人和照护场景里的具身智能。

时间轴

  • 00:00:04 开场
  • 00:01:01 更强的新一代模型与生成工具
  • 00:04:55 Agent 真正动手:办公与日常任务自动化
  • 00:09:04 Agent 替你谈判、面试和做生意
  • 00:12:20 让 Agent 世界看见你:AI 可见性与获客
  • 00:14:51 隐私优先:开源与本地化的新一批产品
  • 00:17:26 开发者的新工作区与掌控面板
  • 00:19:43 从视频到机器人,再到照护
  • 00:21:12 收尾

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。

Transcript

茉莉: 大家好,欢迎收听这一期的节目,我是茉莉。

白桦: 我是白桦。今天我们做一期比较像日报的节目,把过去二十四小时里冒出来的一批新产品和新模型放到一起,聊聊它们各自想解决什么问题,凭什么说自己不一样,以及哪些说法听起来还需要打个问号。

茉莉: 对,先说清楚一点:我们不会照着排名念一遍。这期我们挑的重点,是那些用户问题讲得清楚、方案有明显区分度、能力描述具体、价格和可得性也说得明白的产品。创方自己写的介绍,我们都当成「他们这么声称」来处理,而不是已经验证过的结果。

白桦: 而且这些故事背后其实有一条共同线索:模型能力在往上冲,Agent 从「会聊天」变成「动手干活」,而整个世界也得学会适应一个 Agent 到处跑的环境。我们就从能力竞赛的顶端开始聊。

茉莉: 好,那先说 Mistral Large 4。这是一个一万亿参数的混合专家模型,但每次推理只激活四百九十亿参数,上下文窗口做到了一百万 token。官方的说法是它是欧洲乃至美国最强的开放权重模型之一,权重计划在十月底放出。

白桦: 这几个数字值得拆开讲。一万亿参数说明它的知识容量上限很高,但 MoE 架构意味着你不用每次都跑满全部参数,激活四百九十亿就是为了让推理成本可控。一百万上下文则是直接冲着「整本书、整个代码库塞进去」这种用法去的。

茉莉: 开放权重这件事在现在的市场环境里意义重大。闭源模型你只能通过 API 用,而开放权重意味着企业可以自己部署、自己微调、自己控制数据流向。对欧洲的公司来说,这还多了一层意义:不用把数据交给美国的云。

白桦: 不过茉莉,我想泼一点冷水。这些数字都是官方宣称,「最强之一」这种表述弹性很大,真正用起来延迟多少、每次调用花多少钱、在哪些地区能合法部署,这些都还没落地。特别是推理成本,MoE 不是免费的,路由和访存的开销都要看实测。

茉莉: 对,而且开放权重不等于随便用,许可证细节、可商用范围,都是等权重真的放出来之后才能确认的事。所以我们的态度是:方向上很有分量,但数字和承诺都得等验证。

白桦: 同样在能力竞赛里的还有 Google 的图像模型 Nano Banana 2.1。这一代的更新点很具体:支持蒙版编辑,也就是你圈一块区域只改那块;一致性比上一代更好,意思是同一角色或同一风格在多张图之间不容易漂移;输出分辨率从一千到四千像素;还加了 Search Grounding,让生成过程可以参考搜索到的真实信息。

茉莉: 一致性这个东西听着抽象,其实是图像生成从玩具走向生产工具的关键。你要是做过连环插画或者产品图,就知道角色每张图长得不一样有多崩溃。蒙版编辑则是把控制权交还给用户,不是重掷骰子,而是「我就要改这里」。

白桦: Search Grounding 这一点也有意思,它暗示图像生成不只是从模型脑子里凭空想,还能借助外部信息。不过老规矩,这些都是发布介绍的说法,真实效果要靠用户上手验证。

茉莉: 能力竞赛还有第三条线,是视频。Manus 的 2.0 视频编辑器,宣称 AI 可以做完整条视频:自己查资料、挑镜头、配音乐、做代码图表,全套流程下来,最后把「终剪」这一步交还给用户。

白桦: 这个分工设计我觉得很聪明。AI 负责从零到八成的工作量,最费时间的部分是素材组织和初剪,而最需要人味儿的最后百分之二十,保留给人。这和很多「一键全自动」的产品思路不一样,它承认了最后一步人不可替代。

茉莉: 但反过来讲,「终剪交还给人」也意味着你还是要看得懂剪辑才能收尾,对于完全不会剪的人,这八成的初稿好不好用、改起来方不方便,是关键问题。还有一点没说清楚的是成本和时长限制,一条十分钟的视频要花多少额度,发布信息里没有具体承诺。

白桦: 所以这三个产品合起来看:Mistral 冲的是语言能力上限,Nano Banana 冲的是图像可控性,Manus 冲的是把整条生产流水线自动化。能力确实在往上走,但「开放权重」和「可控性」这两个关键词,恰好是它们共同强调的,说明行业也意识到了光有能力不够。

茉莉: 对,接下来我们就顺着「可控性」聊第二组产品,这些 Agent 开始真的动手干活了。第一个叫 Wabi,它的口号很大,自称是「agentic 时代的操作系统」。具体来说,它做的是群组任务:旅行规划、账单分摊这类事情,它自己跑完全程。

白桦: 「OS」这个词用得很大胆。传统操作系统管的是文件和程序,Wabi 想管的是人和人之间的事务。这个定位如果成立,那它就不只是一个 App,而是你群组生活的执行层。

茉莉: 不过口号归口号,群组任务有个天然的难点:它不是一个人的事。旅行订错了账单分错了,涉及的不只是你,还有你的朋友。出错成本比单人助手高得多,这也是为什么「谁批准、谁负责」这类问题在这一代 Agent 产品里反复出现。

白桦: 说到审批,Velozity 的设计就更明确了。它是一个多人 AI 办公室,Agent 共享整个团队的上下文,也就是大家都知道项目背景和团队讨论,而且支持「自带 AI」,你可以接入自己选的模型。关键点是:Agent 的动作需要人批准。

茉莉: 「共享团队上下文」是双刃剑。好处是 Agent 不用每次从零了解背景,回答和执行都更准;风险是权限问题,Agent 能看到的东西变多,出错和越权的影响也变大。Velozity 用人工审批来兜底,这是目前最稳妥但也最「慢」的做法。

白桦: 而且我们注意到,审批机制和信任机制还都挺粗糙的。下一步真正分胜负的,可能是长期记忆和细粒度权限:Agent 记住多少、能看到多少、哪些动作免审批、哪些必须停下来问人。这些机制目前没有一家做得让人放心。

茉莉: IrisGo 给了一个很有意思的补充视角,它的功能叫 Watch & Learn,你把一项任务操作录一遍,它就学下来,变成可复用的工作流。而且强调数据在本地处理。

白桦: 这个思路本质上是「演示即编程」。传统自动化要么写脚本要么拖流程图,门槛不低;录一遍就能复用,是把门槛降到了几乎为零。对不会编程的运营、行政人员特别友好。

茉莉: 本地处理数据这一点也很关键,因为录屏内容里很可能有客户信息、内部系统截图,这些数据要是不出本地,企业才敢用。

白桦: Figma Agent 则把「动手」推到了设计领域,它不是给你生成一张图,而是直接在画布上操作真实的组件和文件,支持批量编辑,还能通过斜杠命令调用各种技能。这和「给你看个效果图再自己照着做」是本质区别。

茉莉: 对,以前 AI 设计工具输出的是「结果」,Figma Agent 操作的是「工程」。设计师的文件是一堆有结构的组件,直接在真实工程上改,改完就是能交付的稿子,不存在「AI 画的图再人工重做一遍」的问题。

白桦: 这一话题还有三个小配角值得提一句,它们都体现了同一个方向。Cinch 是一个原生的苹果提醒事项客户端,覆盖 iOS、macOS、watchOS 和 visionOS,零遥测,只走 iCloud,但它专门做了一个 CLI 给 LLM Agent 调用。

茉莉: 这个设计很微妙:它是给 Agent 留的「手动挡」。Agent 想帮你管理任务,可以通过命令行接口操作你的提醒事项,但整个过程发生在你自己的数据和设备范围内。

白桦: Thalia 也是类似的角色,它是 Meta 的 Muse Code CLI 的免费 Mac 客户端,SwiftUI 原生写的,强制计划模式、命令要审批、快照可回看、有检查点,同样没有遥测。

茉莉: 它解决的是「命令行 Agent 裸奔」的问题。让 CLI Agent 直接跑命令很危险,Thalia 把「先出计划、人批准、可回滚」这套流程套在上面。我们把它归到「开发者工具」那边再细讲。

白桦: 好,那我们就顺势进入第三组:Agent 不仅干活,还要替你谈判、面试、做生意。这组产品里,最扎眼的可能是 Ana,它是 Vertice 公司做的软件采购谈判 Agent,训练数据来自七百五十亿美元的软件支出、三万二千家供应商、两百多万个价格点,官方说平均能省百分之十八,而且它发出的每一封邮件都需要人工批准。

茉莉: 软件采购是个信息极不对称的市场,买方很难知道自己的价格是不是偏高。Ana 的价值就是把这些历史交易数据变成谈判筹码。百分之十八这个数字听起来很可观,但这是训练数据上的平均值,具体到你的合同能省多少,没人能保证。

白桦: 而且「发邮件前需人工批准」这个设计特别值得注意。谈判是高风险场景,一句话说错可能影响供应商关系,所以这家公司选择让 AI 出方案、人来拍板。这和我们在上一组看到的审批机制是同一个逻辑。

茉莉: 做生意这条线的另一端是销售。Supademo 推出了 AI 演示 Agent,买家随时可以和能讲解产品演示的 Agent 互动,一天二十四小时不打烊,价格是每十五分钟零点九九美元。

白桦: 按时长计费这个定价很有意思,它把「演示」变成了一个可以按需购买的服务。传统上产品演示需要约销售会议,现在买家自己半夜想看就看。不过这也意味着销售职能在被 Agent 分流,销售团队的活儿会变。

茉莉: 中间环节也在被自动化。GenPage 3.0 干的事是:为每一条广告、每一个关键词、每一个账户生成对应的落地页,然后自动做 A 到 Z 的测试。传统做法是设计师做几版页面挑一个,现在是「一人一页」的粒度。

白桦: 这个粒度差异很关键。转化率的提升往往就来自这种微调,同样的广告文案,落地页上的标题和配图跟关键词完全呼应,效果会差很多。人工做这个成本太高,AI 生成加自动测试才把它变得可行。

茉莉: 但也要问一句:落地页数量爆炸之后,品牌一致性谁来管?每一页都是 AI 生成的,风格和措辞可能各自漂移,这对品牌方是新的风险。

白桦: 这组里最有争议的是 ParakeetAI 2.0。它有一个来自真实面试的题库,可以和 AI 做模拟面试练习,这个没问题。但它还有一个功能是在真实面试进行中实时给你答案。

茉莉: 这就是我们要直说的伦理问题了。模拟面试是练习工具,完全正当;实时提示答案,本质上是面试作弊,对其他认真准备的候选人很不公平,而且一旦被招聘方发现,后果由用户自己承担。

白桦: 我们不替任何人下结论,但这个产品的边界值得每个听众多想一想。同一批技术,用在练习里是赋能,用在考核里是作弊,工具本身没有把这条线画清楚,画线的是使用者和监管。

茉莉: 顺着这个话说下去,如果 Agent 能替你面试、谈判、销售,那反过来,你的产品在 Agent 眼里是什么样子,就变成了新的生意。这就是我们下一组要聊的:AI 可见性。

白桦: 有个产品名字得先纠正一下,很多人可能会记错:它叫 Proofsource,不是 Proofstart。它做的事情是每天在四家 AI 引擎上测量你的产品被提到的次数,然后让 Agent 提出修复建议、发布、再审查效果。

茉莉: 这有点像 SEO,但对象变成了 AI。以前用户在 Google 搜关键词,你做关键词优化;现在用户问 ChatGPT 或其他 AI「哪个工具适合我」,AI 回答里有没有你、怎么说你,直接决定了你有没有机会。

白桦: 有一个直观的例子能说明这个问题的现状:有人追踪了 ChatGPT 的插件目录,里面有五千多个插件和一百九十二次搜索数据,结果发现前十名搜索结果里,四分之三的名字或标语里就直接包含搜索词。

茉莉: 这个数据很有意思,它说明在 AI 的世界里,「名字里有用户搜的词」就已经占了巨大便宜。这是一种粗糙但有效的可见性策略,和当年 SEO 里堆关键词的时代有点像。

白桦: 当然我们也要小心,这类数据是从一个目录的搜索记录里来的,不代表所有 AI 引用的规律,但方向是对的:AI 怎么「想起来」你,开始变成一门学问。

茉莉: Proofsource 的做法是把它变成一个日常运营环节:每天测、出修复建议、让 Agent 执行、再复查。这就把「AI 可见性」从一个模糊概念变成了有流程的工作。

白桦: Ownfeed 从获客的另一端切入。你把产品 URL 粘贴进去,它生成的 Feed 里只展示那些「真正需要你产品的人」发的帖子。价格上是试 Day 一美元,而且明确不做自动回复。

茉莉: 「不做自动回复」这一条我特别想强调。现在的社交平台上,AI 自动评论已经泛滥到让人反感,Ownfeed 反着来:AI 帮你筛出该看的人,但回复你自己写。

白桦: 这两个产品合起来看,指向同一个判断:生成式搜索和 Agent 正在改变获客入口,品牌以后会像做 SEO 一样专门做「AI 可见性优化」。现在入场的产品还很少,这个领域刚开头。

茉莉: 从「让 AI 看见你」转到下一个话题很自然:既然这么多人担心 AI 拿走自己的数据,那就有另一批产品干脆把「数据不出去」当成核心卖点。

白桦: 第一个叫 Redlamp,是 Apple Silicon 上的原生开源 RAW 照片编辑器,Swift 和 Metal 写的,MPL-2.0 许可证,完全免费,而且能融进现有的 Lightroom 工作流。

茉莉: 这里几个关键词都戳中了摄影师的痛点。RAW 编辑对性能要求高,原生跑 Apple Silicon 的 Metal 图形管线意味着速度快、不发热;开源意味着你能看代码、社区能审查;免费在 Lightroom 订阅费涨个不停的背景下尤其有吸引力。

白桦: 「融入 Lightroom 流程」是个聪明的定位,它不要求你搬家,而是当你需要更强的 RAW 处理时插进来用一步,降低了切换成本。

茉莉: 类似的隐私主张还出现在一个你可能想不到的场景:家庭签到。Knuff 是一款家庭互相报平安的 App,用「Bubble」模型来组织签到,而且数据全部留在德国,不用美国云。

白桦: 家庭签到这个场景对隐私特别敏感,因为涉及老人和孩子的位置、状态信息。放在欧洲的数据中心,至少在合规层面上让用户安心一些。

茉莉: 更彻底的是 Rool,它在芬兰运营一个私有 AI 服务,用自己的模型,明确承诺不用你的数据做训练,还有免费档位。这等于是把「你的对话不会变成训练材料」写进产品承诺里。

白桦: 这个承诺在现在特别戳人,因为很多免费 AI 产品的商业模式就是拿你的数据改进模型。Rool 相当于把这个默认设置翻了过来。

茉莉: 还有 Temp Mail,就是那个免注册的一次性邮箱,这轮新增了几个功能:安卓上的私密转发别名、验证码一键复制、支持自有域名,界面支持二十九种语言。

白桦: 一次性邮箱的用途很明确:注册不想给真实邮箱的服务,隔离垃圾邮件。新加的自有域名是个升级,说明它开始服务那些想要「自己域名下的别名邮箱」的重度隐私用户。

茉莉: 这一整组产品的共同主线很清楚:「数据不出口、不训练」从技术细节变成了营销卖点。但我们也得问:免费模式能不能持续?服务器和模型都要钱,隐私承诺和商业可持续之间的张力,是这批产品都要面对的问题。合规边界怎么划,也是悬而未决的。

白桦: 说到这里,开发者的处境其实和普通用户不太一样。开发者不怕工具多,怕的是看不清。所以第六组产品,主题是让开发者在 Agent 时代有看得见的面板。

茉莉: Databench 是一个开源的多人工作区,Apache 2.0 许可证,核心是反应式 Notebook,Agent 可以和团队并肩工作,而且所有结果可追溯。

白桦: 「反应式」的意思是 Notebook 里的数据变化会自动传播到相关部分,这在多人协作加 Agent 的场景里很重要,因为一个 Agent 改了数据,别人看到的应该是最新状态,不是过期的快照。

茉莉: 「可追溯」则是解决另一个老问题:以前团队里 Agent 跑了什么、谁改了什么,事后说不清。Databench 把过程记录下来,出问题能回查。

白桦: Kitbar 走的是另一个方向:它把各种开发服务的状态塞进系统状态栏。支持的名单挺长:Vercel、Cloudflare、GitHub、GitLab、Stripe、Polar,还有 Claude Code 和 Codex 这类编码 Agent。不用注册账号,一次性买断。

茉莉: 状态栏听起来是小工具,但它解决的是真实的注意力问题。开发者现在同时盯着部署状态、CI、支付、多个 AI Agent 的进度,来回切网页很烦,一眼可见的状态栏把这些信息压到了一个角落。

白桦: 买断制加不要账号,也符合开发者群体的口味,不用再添一个订阅。

茉莉: 而 Thalia,我们前面提过一嘴,在这里就完整地说:它是 Meta 的 Muse Code CLI 的 Mac 客户端,免费,SwiftUI 原生。四个功能:强制计划模式、命令执行要审批、快照可审查、检查点可以回退,并且零遥测。

白桦: 这四个功能合起来,就是把一个危险的命令行 Agent 变成可控的。Claude Code 这类工具的爆发让很多人开始用 CLI Agent,但裸跑命令确实吓人,Thalia 这类「安全壳」的价值就在这里。

茉莉: 所以这三个东西的共同点是透明和可控。Agent 能力越强,开发者越需要仪表盘和刹车,这两个需求是同步增长的。

白桦: 最后这一组,我们把视野拉到物理世界。Pegasus 1.6 解决的是机器人训练数据的老大难问题:它能把第一视角的视频,包括人戴设备拍的和遥操作录下的,自动转成带标签、带时间戳的机器人训练数据,完全不用人工标注。

茉莉: 机器人领域一直被数据瓶颈卡着,因为真实世界的数据没法像互联网文本那样随便爬。人工标注一段操作视频又贵又慢。如果 Pegasus 的自动化标注真的可靠,那就相当于给机器人学习打开了数据水龙头。当然,「不用人工标注」是官方说法,标注质量到底够不够训练用,还需要实践检验。

白桦: 而 Rhem 把 AI 推进了一个我们平时不太聊的场景:老年照护。它是放在桌上的机器人,能监测生命体征、观察对话模式、提醒吃药和约会,它带的 AI Agent 还能真的打电话去预约。

茉莉: 打电话预约这个能力把事情推到了现实世界里:不是在 App 里点按钮,而是像人一样拿起话筒办成一件事。这对独居老人是实打实的帮助。

白桦: 但这个场景的门槛也不在技术。老年人信不信得过一台机器人、生命体征数据归谁管、出了健康问题责任怎么算,这些是比模型能力更难的问题。监管在这个领域必然要跟上来。

茉莉: 好了,我们从最强模型聊到照片编辑器,从 AI 办公室聊到给老人打桌电话,一天之内的产品密度确实惊人。

白桦: 收个尾的话,我想留三个问题给听众:一,开放权重和可控性声明,最终要靠实测和第三方验证;二,Agent 时代审批和信任机制还都很粗糙,谁能先做好谁就赢;三,隐私正在变成卖点,但免费和隐私能不能长期共存,还没有答案。

茉莉: 这期就到这里,感谢收听,我们下期再见。

白桦: 下期见。