0801 | 谷歌DeepMind发布机器人AI大脑;MiniMax开源多模态视频模型

||Download

Show notes

本期节目盘点了 ProductHunt 上九款 AI 新品。Google DeepMind 发布 Gemini Robotics 2,为机器人赋予环境理解与自适应推理能力;MiniMax 开源 H3 多模态模型,支持 2K 视频与原生立体声生成;Halo 在设备端实时检测视频通话中的深度伪造人脸,回应了 2500 万美元的诈骗案例。企业工具方面,DepthData 统一审计 AI 工具支出,Screencap 将屏幕工作流转化为训练数据,Poth Labs 用关系网络模型推理客户知识,TraceLLM 监控生产环境 LLM 应用,Cleanlist AI 通过补全瀑布流自动生成 B2B 线索,Customer.io 夏季更新加入地理围栏与实时通知。贯穿全场的主线是 AI 正从屏幕后走向物理世界和实时交互。

时间轴

  • 00:00:00 开场
  • 00:00:47 Google DeepMind 推出 Gemini Robotics 2 智能机器人
  • 00:01:57 MiniMax 发布开源多模态视频生成模型 H3
  • 00:03:05 Halo 实时检测视频通话中的深度伪造人脸
  • 00:04:03 DepthData 帮企业统一审计 AI 工具支出与使用
  • 00:05:02 Screencap 将屏幕操作转化为 AI 训练数据
  • 00:06:12 Poth 用关系网络模型重新定义客户知识管理
  • 00:06:52 TraceLLM 提供 LLM 应用的可观测性监控
  • 00:07:22 Customer.io 夏季发布:新增地理围栏与实时通知
  • 00:07:45 Cleanlist AI 一站式 B2B 线索生成与 CRM 同步

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 欢迎收听 Bri 播客家族的 ProductHunt 产品分享,我是茉莉。

白桦: 我是白桦。今天我们来聊聊最近 ProductHunt 上几款有意思的新产品。

茉莉: 先快速过一遍:谷歌 DeepMind 发布了 Gemini Robotics 2,说是要给下一代机器人装上 AI 大脑;MiniMax 开源了 H3 多模态模型,能直接生成带原生立体声的 2K 视频。

白桦: 还有 Scam AI 联合创始人 Neo 推出的 Halo,能在视频通话里实时检测深度伪造人脸;另外 DepthData 帮企业搞清楚到底在 AI 工具上花了多少钱,还有 Screencap 把团队真实工作流程变成训练数据。好,咱们一个一个来细聊。

茉莉: Google DeepMind 刚刚发布了 Gemini Robotics 2,它被定位为下一代机器人的 AI 大脑。

白桦: AI 大脑这个说法很形象。它的核心目标就是让机器人不仅仅是机械地执行指令,而是能够真正理解环境、进行推理,然后在物理世界里采取行动。

茉莉: 对,底层驱动它的是 Gemini 这个先进模型。官方强调了三个关键能力:全身智能、灵巧操控,还有自适应推理。这三个加在一起,意味着机器人可以处理复杂的物理任务。

白桦: 而且它不挑硬件形态,可以适配不同形状、不同尺寸的机器人。更值得注意的是多机器人协作能力已经被列入能力范围了。

茉莉: 社区的反馈也很有意思。有人说这代表了把 AI 智能带入物理世界的下一阶段。关键进展不在于机器人能简单地动起来,而在于它们能理解环境、推理任务,并且像一个智能体一样去适应变化。

白桦: 这就是所谓物理 AI 的演进方向。以前我们谈论机器人更多是运动控制,现在重心转向了认知和决策,这是一个根本性的转变。

茉莉: 再来看看 MiniMax 推出的 H3,这是一个开源的多模态模型,能统一生成 2K 视频,而且自带原生立体声。

白桦: 2K 加立体声这个组合还是很有竞争力的。H3 把文本、图像和音频输入都统一到一个模型里来处理了。

茉莉: 它在几个方向上表现突出:准确的文字渲染、视觉包装,还有复杂指令遵循。这几个能力特别适合商业内容创作。

白桦: 社区用户的反馈更具体,说 H3 特别擅长把混合参考素材转化成接近成品的动态作品。你可以在一个请求里混入文本、图像、视频和音频,然后指定你想借鉴的参考特征。

茉莉: 这些参考特征包括角色、镜头运动、声音或者整体视觉风格。生成的结果在排版、运动、节奏和声音上是协同运作的,不是各自为战。

白桦: 应用场景也很明确:产品视频、动态海报、音乐视觉和电商营销。目前这个模型的 API 已经上线了,开发者可以直接调用。

茉莉: 接下来这个产品直接回应了一个真实发生的安全事件。Scam AI 的联合创始人 Neo 发布了 Halo,一个实时深度伪造检测模型,完全在设备端运行。

白桦: 它引用的案例非常震撼:2024 年,工程公司 Arup 的一名财务员工参加了一场视频会议,会上有深度伪造的 CFO 和多名同事。这名员工在察觉之前已经转出了 2500 万美元。

茉莉: 这就是 Halo 要解决的问题。它可以在 Zoom、Teams 或者 Google Meet 这类视频通话中实时标记出合成人脸,让你不用再猜测对方是不是真人。

白桦: 产品定位很清晰,就是面向招聘验证和大额转账确认这种高风险场景。而且检测全程都在用户自己的设备上完成,不需要把数据上传到云端。

茉莉: 这一点在隐私和延迟上都有优势。你不用依赖第三方服务器来做判断,设备端直接给出结果。

茉莉: 最后一个产品 DepthData,定位是企业 AI 支出的可信系统记录工具,由产品设计师 Ali 创建。

白桦: Ali 的观察很切中痛点:企业往往同时买了 ChatGPT、Claude、Copilot 等四五种 AI 工具,但财务和 IT 团队回答不了几个最基本的问题——我们到底花了多少钱?谁在用?哪些席位是闲置的?

茉莉: DepthData 做的事情就是把所有 AI 工具连接到一个可审计的视图里,集中展示支出和采用状况。

白桦: 它的差异化特点值得注意。每一个数字都标注了验证方式,而且明确表示不读取提示内容。它还会清楚展示每个供应商 API 能暴露什么、不能暴露什么——这种透明度在企业工具里并不多见。

茉莉: 这样企业获得的是一个可以信赖的系统记录,而不是一个黑箱数字。对于现在这个企业 AI 工具遍地开花的阶段,这种可见性变得越来越重要了。

茉莉: 第一款工具名叫 Screencap,是一个开源的 macOS 应用,它的核心思路很有意思——把团队的真实工作流程直接变成 AI 训练数据。

白桦: 具体怎么做呢?它通过录制屏幕操作、点击、键盘输入和窗口上下文,把实际的工作过程结构化地记录下来,变成一个可以用于自动化和 AI 训练的数据集。

茉莉: 而且 Screencap 在隐私这块做得比较靠前——录制时就开始强制执行用户同意和隐私保护,大部分敏感应用在写入任何内容之前就会被屏蔽。

白桦: 对,所有记录在离开本机之前都会被清除和审核。产品目前提供个人免费试用,也支持团队试点。

茉莉: 社区讨论里提到一个很实际的痛点:团队知识流失。有些流程只存在于个别成员的脑子里,一旦人员变动或者项目快速迭代,那些隐性知识就丢了。

白桦: 嗯,结果就是,想做一件之前做过的事,可能要花好几个小时重新摸索。Screencap 想解决的就是这个问题——把那些看不见的工作流程固化下来。

茉莉: 下一个产品叫 Poth Labs,它看待客户知识的方式不太一样——不是把信息当成一堆文件,而是当成一个关系网络。

白桦: 也就是说,在回答问题之前,它会先构建一个动态的客户模型,然后跨所有已知信息进行推理。

茉莉: 这就能回答那种没法从单一来源直接得到答案的问题,比如"高价值客户流失的驱动因素是什么",或者"客户为什么采用或放弃某个功能"。

白桦: 而且它每次结论都基于证据。如果现有信息不够回答,系统会启动自适应问卷调查,去收集那些缺失的数据,而不是硬给一个不确定的答案。

茉莉: 再来看 TraceLLM,这是一个面向生产环境 AI 应用的观测平台。

白桦: 它可以监控提示执行、令牌消耗、延迟、跨度、错误和模型调用,然后通过 OpenTelemetry——也就是 OTLP——导出追踪数据。

茉莉: 目标是帮助团队在影响用户之前就识别出瓶颈。它由 Jyotishmoy 构建,针对的痛点是 AI 应用上线之后很难排查故障、定位问题提示、搞清楚延迟到底卡在哪一环。

白桦: 最后来看 Customer.io 的夏季更新。这次更新带来了几个新能力:地理围栏、实时通知、灵活的短信供应商选择、通知收件箱,还有改进后的 WhatsApp 管理和 AI 功能。

茉莉: 官方在评论里提到,平台已经从最早的邮件工具发展成了完整的客户互动平台,目前支持超过九千个品牌,年经常性收入突破一亿美元。

茉莉: 今天先来看一款叫 Cleanlist AI 的工具,它做的事很直接——用自然语言帮你挖掘潜在客户。

白桦: 对,就是你告诉它你想要什么样的客户,它给你返回一个经过验证、信息补全的线索列表,而且可以直接同步到 CRM 里。

茉莉: 创始人 Levon 说过一个挺有意思的观察:传统上要建这样一份客户名单,得在好几个工具之间来回切换,很碎片化。

白桦: Cleanlist 的思路就是把这件事整合起来。它背后接入了 15 家数据供应商,组成一个补全瀑布流。

茉莉: 补全瀑布流这个说法值得展开一下——意思是一条线索进来之后,如果第一家供应商的数据不全,就自动流向第二家、第三家,层层补全,直到信息完整。

白桦: 除此之外,它还加了 AI 研究列,可以在列表里自动补充研究信息,最后再一键同步到 CRM,省掉了手动搬运的环节。

茉莉: 所以整体来看,Cleanlist AI 就是把拓客输入变成可用的线索列表,用补全瀑布流、AI 研究列和 CRM 同步这三步,把原本要跨多个工具做的事收在一个入口里。

茉莉: 好,今天从谷歌DeepMind的Gemini Robotics 2,到实时深度伪造检测工具Halo,再到开源视频模型MiniMax H3,信息量确实不小。

白桦: 嗯,而且有一个线索贯穿始终——AI正在从屏幕后面走出来,进入物理世界和实时交互。Gemini Robotics 2要让机器人真正理解环境并动手操作,Halo则是在视频通话那一刻就告诉你对面那张脸是不是真的。

茉莉: 对,还有Screencap这种工具,把团队真实的工作流录下来变成训练数据——这其实在回答一个更根本的问题:AI要怎么学,才能真的帮上忙?

白桦: Poth Labs和Cleanlist AI也是这个思路,一个把客户知识建成关系网络来推理,一个用十五家数据供应商的补全瀑布流自动整理线索。不再是搜文档,而是让AI理解上下文。

茉莉: Customer.io的夏季更新也值得关注——年经常性收入突破一亿美元,从邮件工具长成了完整的客户互动平台。加上DepthData帮企业看清AI花了多少钱、谁在用,这个生态正在快速成熟。

白桦: TraceLLM则盯着生产环境,把提示、延迟、错误全链路监控起来,在用户受影响之前先发现问题。这些基础设施层的工具,往往是产业落地的晴雨表。

茉莉: 好,这就是本期节目的全部内容。感谢收听,我们下期再见。