0907 | AI 工具快讯:从视频代理到域名盯梢

||Download

Show notes

本期节目横扫多个 AI 工具与模型发布:从谷歌 Gemini 的"代理式"视频理解省下 88% token,到 fal 把 MiniMax H3 训练到质量与速度双冠,再到让编码代理更省钱的运行时 Kit、Slack 里的 AI 员工 Tadata。然后看两类"补充层"产品:AI Toolbox 帮你管理四大 AI 聊天记录,DocsAlot 给 AI 时代的文档加一道人工把关,Notify.domains 则在域名世界盯梢机会。

时间轴

  • 00:00:04 开场
  • 00:00:30 更聪明的视频:Gemini 代理式理解与 fal 的 H3 Max
  • 00:06:31 代理运行时:Kit 的一个工具哲学与 Tadata 的 Slack 员工
  • 00:13:41 别丢聊天记录:AI Toolbox 3.0 的跨平台管理
  • 00:17:12 文档的最后一关:DocsAlot 的可视化编辑与人工发布闸门
  • 00:20:09 盯住域名机会:Notify.domains 的 24 小时哨兵
  • 00:23:17 收尾

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 大家好,欢迎收听今天的节目,我是茉莉。

白桦: 我是白桦。今天我们聊的几件事,表面上看是一个 Product Hunt 的每日精选,但它们其实有一条共同线索:都在已有的平台上加一层,让原本散乱的东西变得可控——不管是视频生成的速度、编码代理的效率、四个 AI 聊天记录的管理,还是文档发布和域名抢注的时机。

茉莉: 对,而且今天每个产品我们都会尽量讲清楚:它到底给谁用、解决了什么真实问题、有什么证据支撑,以及哪些地方还是未知数。我们先从最大牌的一个说起——Google 的 Gemini 推出了一种新的视频处理方式,叫 agentic video understanding,代理式视频理解。

白桦: 这个东西有意思的地方在于,它不是一个新产品,而是一个模式开关。现在 Gemini 的 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 这几个模型里,你可以把处理方式设成 agentic,然后用的是标准定价,不加钱。

茉莉: 那它到底跟以前有什么不一样?传统做法是模型按固定帧率扫描视频,一段五分钟的视频,不管内容是说话还是打斗场面,都一样地一帧一帧看过去。代理式模式是模型自己决定看什么、以什么速度看、通过哪种模态看——是看画面帧,还是听音频,还是读转录文本。它通过一个内部的代理循环,只去取它需要的片段。

白桦: 官方给的数字是:最多省 88% 的 token,成本最多降 66%,准确率最多提升 7%。而且长视频上收益最大。他们给的典型场景包括跨几个小时视频的针尖大海捞针式搜索、亚秒级的时刻检索用于自动剪辑、用可变帧率做异常检测,还有对重复出现的动作或物体做准确计数。

茉莉: 这里我要提醒一句,这些数字是 Google 自己的评测结果,我们按官方声明来报道,但它是产品方的说法,不是独立验证。不过有一个逻辑是站得住的:如果你不再均匀扫描,而是模型自己挑选要看的部分,那省 token 和提准确率可以同时发生,因为省下来的预算花在了真正相关的地方。

白桦: 对,这就是后面要反复出现的主题——模型和系统的共同设计。你自己决定看哪里,和你旁边有个聪明的推理系统帮你省算力,是同一个问题的两面。Google 的公告里提到这是 DeepMind 团队做的,产品经理 Rohan Doshi 和研究总监 Mario Lučić 署名,目前通过 Gemini API 在 AI Studio 和 Gemini Enterprise Agent Platform 上线。

茉莉: 未知的地方呢?比如极端场景——评论里其实很少有人深挖,只有一个用户提到对省 token 和速度的数字感兴趣。所以像多机位复杂镜头、非常密集的动作序列,模型自己挑帧会不会漏掉关键瞬间,这个公告里没有展开,我们就老实说不知道。

白桦: 好的视频理解是看懂,而视频生成是另一头。fal 发布了 H3 Max,这正好和 Gemini 那个形成对照——一个在管"怎么高效地看",一个在解决"怎么又快又好地生成"。

茉莉: H3 Max 是 fal 在开源权重模型 MiniMax H3 的基础上后训练出来的版本。他们的核心主张是打破生成视频领域那个老生常谈的取舍:要质量就得慢,要速度就得接受更差的输出。 fal 的做法是两头同时下手——他们的研究团队用新数据做后训练,重点在提示遵循和视觉质量;推理团队同时把服务栈重做了一遍,训练和推理全部跑在 NVIDIA GB200 NVL72 系统上,让模型还在开发的时候,训练和推理的决策就能互相影响。

白桦: 数字方面:他们声称一个 5 秒的视频大约 3 秒生成,吞吐量是官方 MiniMax H3 端点的 35 倍,平均比同质量的其他模型快 15 倍。评测方面,他们用人工偏好、Bayesian Elo 评分,对 12 个主流视频模型做了对比,包括 Gemini Omni Flash、Wan 3.0、Seedance 2.5、Kling 3 和 Veo 3.1。他们声称在整体质量、提示理解、美学三个维度都排第一,并且赢得了对每个对手的大多数直接对比。

茉莉: 这里同样要打上"厂商声明"的标签。不过有一点值得注意:他们的评测方法是独立评三个维度,而不是合成一个总分,这个方法论本身说得通,因为总分确实容易掩盖单维度的弱点。而且他们提到两个独立基准,Artificial Analysis 和 Design Arena,也把他们排第一。Design Arena 的说法是"以超过 50 倍的速度提供 MiniMax H3 的质量,建立了新的速度-偏好帕累托前沿"。这不是我们替他们背书,但确实是官方引用的第三方数据。

白桦: fal 还强调了一个工程细节:有些让模型变快的办法——降精度、砍采样步数、近似昂贵的运算——会伤质量。他们的规则是,任何优化必须让模型在内部质量评测中仍然保持位置,否则就不采用。

茉莉: 未知数呢?评论区有个用户说得挺实在:3 秒生成 5 秒视频,如果质量撑不住就白搭。他说大多数"快"的视频模型在超过两三倍实时的速度后,运动连贯性会明显变差,他打算在 image-to-video 端点上试一个有实际镜头运动的场景,因为那通常是速度技巧露馅的地方。所以 H3 Max 在真实运镜下的表现,目前是个公开问题,等用户实测。

白桦: 而且官方博客的结尾有个观点我觉得可以带进下一个话题:随着视频生成走向交互式和高产量生产环境,"模型不只是要在演示里好,要能在生产里被依赖"——生成质量是一半,另一半是执行效率。效率这个主题,接下来这个产品把它推到了一个更极致的地方。

茉莉: 说完看视频和生成视频,我们聊聊让 AI 干活这件事本身。Speakeasy 发布了一个叫 Kit 的东西,定位是编码代理运行时。它的哲学非常大胆:给模型一个工具,就一个。

白桦: 对,大部分代理框架会给模型一堆工具,每次调用都要一次模型往返。Kit 反过来,只暴露一个叫 compose 的工具。模型的参数是一段用他们自家语言 Runlet 写的短程序。在一次往返里,这个程序可以读文件、跑测试、应用编辑、重试失败的命令、把工作委托给子代理,还能返回结构化数据。

茉莉: 他们给的对比数字是:在规模对齐的生产任务中,Kit 每手写一行的输入 token 和活跃时间大约是 Codex CLI 或 Claude Code 的一半。逻辑也是通的——往返次数越少,重复携带的上下文就越少,每次请求完成的活就越多。但这是 Speakeasy 自己的对比,有他们发的基准链接,我们按声明处理。

白桦: compose 程序里可以调用 shell、edit、subagent、prompt、fork、工具搜索、auth、skill、a2a、docs 这些原语。独立的调用会并发跑,可以用数据依赖或 after 块控制顺序,还能用 boundary retry 和 fail 在程序里处理错误。子代理是可复用的值——可以继续、分叉、检查、关闭,还能要求输出符合某个 JSON schema。

茉莉: 开放性方面,Kit 支持 ACP v1 和 v2——Agent Client Protocol,走 stdio、HTTP/SSE 和 WebSocket——还有 A2A v1 双向支持,另外兼容 MCP、Agent Skills 和 Agent Plugin 包。ACP 的意义在于把代理客户端和代理运行时分开,所以 Kit 能在兼容的编辑器里工作,还能把 Claude Code、Codex、Cursor 甚至 Kit 自己当作子代理的执行层,不需要定制集成。

白桦: 工程细节上,它是个静态二进制,终端客户端、ACP 服务器、A2A 端点、子代理编排器全在一个文件里,安装就是一行 curl 加 kit init。会话方面,它把每条追加式的 JSONL 转录在接收前先同步到磁盘,上下文到 80% 时自动压缩,可以从 tui、prompt 或任何 ACP 客户端恢复会话,还带崩溃安全锁,对符合条件的 OpenAI 订阅故障最长重试 24 小时。模型方面支持 ChatGPT 订阅的原生 OAuth,也支持 OpenRouter 和 Speakeasy 自己的 AI Control Plane,会话中可以用斜杠命令换模型。

茉莉: 但有一个必须大声说出来的限制,而且 Kit 自己也明说了:它没有权限框架、没有沙盒、没有网页界面。一个 --root 选项设定工作目录,完事。官方原文是"Kit 是一个运行时,不是安全边界,请在你信任的安全边界内运行 Kit"。这对个人开发者没问题,但如果你想在公司环境里部署,安全这层完全是你自己的责任。

白桦: 评论区也提了两个好问题。一个是关于 ACP 解耦的:子代理的输出合并回主会话时,有没有验证步骤,还是子代理产出什么就原样通过,好像顶层代理自己写的一样?这个在源材料里没有得到回答。另一个是用户说静态二进制这点打动了他,"每个 Speakeasy 的东西都是零配置就能跑",打算把它换成日常主力——这是一位用户的表态,不是普遍结论。

茉莉: 从开发者桌面挪到团队协作的地方。Tadata 想做的是 Slack 里的"AI 员工",他们的口号是"读得懂氛围的 AI 员工"。你不需要学怎么搭 agent,你像对待同事一样分派任务:告诉它你要什么,给反馈,让它自己想办法。

白桦: 具体来说,Tadata 连接你的工具——官网列了 HubSpot、Attio、Notion、Linear、GitHub、Google Sheets、Gmail、Hunter.io、Google Calendar、Monday.com,还有任何 MCP 或 API——同时也能够到难reach的外部信息源,比如公司网站、招聘页、LinkedIn、Google Maps、职位板、财报和评价。今天它最主打销售场景。创始人 Tori 给的例子是找线索:她描述想要什么样的人,Tadata 就跨内部工具和外部来源去研究,结果不对就回一句怎么改,不用选数据供应商、不用接线、不用搭研究代理。

茉莉: 它还有一层"观察者"的行为:它会注意你反复做的事情,主动提出可以接手,但先征求同意才自动化,而且只看得到你连接的工具。官网描述了一天的工作流:早上 7:45 在 Slack 里给你今日会议简报和变化提示;工作中它学习你的偏好;会后把跟进邮件、CRM 字段、下一步都草拟好,等你批准才发出去。

白桦: 预置的代理场景包括外联个性化——给每条消息加一段研究好的开场——还有暖引荐查找、通话准备、LinkedIn 监听、新决策者发现、会议参会名单。另外他们强调"模型无关":你的自动化、偏好、例外和制度配方都存在 Tadata 里,可以导出、版本化、换模型时带走,不用重建。他们的定位是坐在你的工作和前沿模型之间,没有动力把你锁在某一家供应商。

茉莉: 团队背景也有点分量:他们之前做了 FastAPI-MCP,12K GitHub 星、7000 万以上下载量。Tori 原话说,给代理工具和有一个你能真正依赖的 AI 队友是两回事,所以做了 Tadata。

白桦: 但评论区的质疑值得认真对待。有人问得非常尖锐:分派研究线索的任务很吸引人,但失败模式是什么?如果 Tadata 研究一个线索时自信地搞错了——过期数据、错误的公司、幻觉出来的细节——它会主动标记自己的不确定性吗?还是这就是一条普通的 Slack 消息,被提问的人当成事实?这个问题在源材料里没有答案。

茉莉: 另一位天天泡在 Slack 里的用户问的是"读氛围"的深度:频道里一半是决策一半是噪音,它怎么处理?需要被@还是后台一直听?还有"学习你的公司"在用了一周和用了一个月之后差别有多大?这些也都是公开问题。社区里还出现了和 Claude Tags、其他竞品的对比提问,以及一个关于差异化的直接问题——这个品类确实在升温,Tadata 给出的差异化就是模型无关和配方可迁移,但长期怎么拉开距离,还是进行时。

白桦: 说到"在已有平台上加一层",最贴切的可能还是下面这个。你用 ChatGPT、Claude、Gemini、Grok 吗?如果是,你大概率丢过聊天记录。

茉莉: AI Toolbox 3.0 是一个浏览器扩展,一次安装覆盖这四家。功能包括:侧边栏里的文件夹和子文件夹、跨全部四个平台同时全文搜索、提示词库——打两个斜杠就能插入保存的提示词,还能把提示词串成多步链——批量导出成 Markdown、PDF、JSON,或者把整个文件夹打成 ZIP。在 Claude 上还有个 Artifact Vault,把所有生成的工件和文件集中起来浏览下载。还有一条实时的上下文余量条,长对话快到上限时会提醒你,支持一键交接到一个新聊天。甚至可以跨平台继续对话:在 Claude 开的聊天,按一个键,它会总结然后带进 ChatGPT 的新会话里。

白桦: 隐私方面他们强调本地优先:搜索和导出完全在你的浏览器里完成,对话永远不会发到他们的服务器。商业化方面,创始人 Adi 的介绍很坦白:两个创始人、自举、没有融资,两年前以 32 美元起步——一台便宜的虚拟机加 Chrome 开发者费用。现在 40,000 以上用户、150 多个国家、Chrome 商店 4.5 星、五位数月经常性收入,基础设施成本每月 45 美元。他说几乎每个功能都来自用户请求,支持收件箱就是他们的路线图。这是他们第三次在 Product Hunt 上发布。

茉莉: 这些同样是创始人自述。有意思的是评论里既有老用户的高度评价,也有非常具体的技术质疑,这两类我们都值得摆出来。一位用户说用了一年,是他工作流里最好的补充之一,"没有它我没法工作";另一位用 Claude 用了一个月,说导出 JSON 对复盘长期对话里未解决的问题很有帮助——但他同时说搜索有时不稳定,找不到他知道存在于对话里的内容,上下文余量条"充其量是个猜测"。他最后还是写了"总体强烈推荐",但缺点说得明白。

白桦: 更技术性的两条质疑我认为特别值得复述。第一条:本地优先的搜索意味着索引存在 IndexedDB 里,而 Chrome 在存储压力下会静默驱逐这些数据,不会通知任何人。两年的历史加文件夹树,恰恰是那种会悄悄消失、然后看起来像扩展出了 bug 的东西。提问者问他们有没有调用 navigator.storage.persist()、有没有在界面上显示配额,并且建议这个问题的优先级应该排在文件夹前面,因为"丢失整个组织结构比丢失一条聊天更伤"。

茉莉: 第二条更宽泛:ChatGPT、Claude、Gemini 的 DOM 结构经常改版,当其中一家更新界面时,扩展会静默失效直到推补丁,还是抓取本身设计得有韧性?这个问题同样没有在源材料里得到回答。所以 AI Toolbox 的画像很清楚:一个真实解决了痛点、有可观用户基础的产品,但它的本地优先架构在浏览器存储和平台改版面前有结构性风险,答案都还欠着。

白桦: 同样是"帮你保管东西"的思路,但对象从聊天记录换成了文档。DocsAlot 发布了视觉编辑器,创始人 Faizan 的出发点很有意思:现在软件的一切都在为代理重构,他们也在做——DocsAlot 通过 CLI 和 MCP 给代理访问文档的能力,AI 可以帮助创建和更新内容——但他们撞上了一个朴素的真理:文档变成公开内容之前,仍然需要一个人做最终决定。

茉莉: 所以他们的核心设计是两个。第一个是视觉和 Markdown 源码同体:一页可以在视觉模式和源码模式之间来回切换,同时保留 frontmatter、表格、代码、链接和结构。创始人说技术难点不在浏览器里放个文本框,而在不破坏底层 Markdown 的前提下做视觉编辑。

白桦: 第二个是把编辑和发布分开。改动先待在工作草稿里,人主动保存一个版本,可以回到更早的版本,并且选择确切的时机让这个版本变成公开站点。导航也当作真实的站点数据来处理,所以移动页面和分组会同步更新发布文档用的同一个结构。AI 助手是工作在文档工作区里的,不是另一个聊天框——你可以要求它改进一段解释、更新相关页面,然后逐页检查它动了哪些地方。

茉莉: 评论区立刻把矛头对准了"人工把关"的有效性,这段对话值得完整讲。一位评论者承认人工审批闸门能抓住格式问题,但他认为它挡不住真正昂贵的失败:一个代理写的代码示例,读起来完美,但跑不通。没有人会拒绝一份看起来对的 diff。既然已经有 CLI,他想要的审查是机械化的:编译代码片段、把提到的每个端点对照 OpenAPI 规范校验,然后只把不合格的页面交给人类看。他的原话很狠:"审批 40 页散文是表演,审批被标出来的那 3 页才不是。"

白桦: 这个批评我觉得对任何"AI 起草、人类把关"的工作流都适用。另一位评论者从另一个方向问:如果代理通过 CLI/MCP 提了一个文档更新,人工大幅修改或拒绝了大部分内容,代理下次会看到改了什么、为什么改,还是从零开始重试、完全不记得纠正?这问的其实是反馈回路,源材料里也没有答案。社区里也有正面的声音:有人说终于有了一个单一事实来源,托管文档、llms.txt、skill.md 和 MCP 全部出自同一处,不用维护一堆独立的层;也有人担心视觉模式迟早会弄乱 frontmatter 或代码块,问他们自己的文档吃了多久的狗粮。

茉莉: 从文档的发布闸门,我们走到今天的最后一个故事,也是"在正确的时刻拿到正确信号"这个主题最纯粹的形式。Notify.domains 是一个域名监控服务,盯着你想要的任何一个域名,查 WHOIS、RDAP、拍卖、市场、网站信号,每个域名每天查 20 次以上,覆盖全部 IANA 顶级域。当有变化时,你收到的不是原始数据,而是一句人话加明确的下一步。

白桦: 他们官网举的例子很具体:"你的域名变了,这是我们看到的""域名进入拍卖,现在去出价""pending delete 开始了,这是你的 backorder 清单""市场挂价降了 35%"。价格是每年 24 美元,7 天免费试用,不需要信用卡。

茉莉: 创始人 Michael Cyger 的背景给了这个产品可信度:他在域名行业干了 15 年,创立了 DomainSherpa,做了 DNAcademy,GoDaddy 收购后担任教育总监。他在发布帖里讲了那个"内幕游戏":过期域名并不会直接掉下来变成谁都能注册——那是个迷思。注册商会悄悄把到期的名字送到他们的拍卖合作伙伴那里,在公众看到之前。每个注册商有自己的协议和时间表,有的去 GoDaddy Auctions,有的去 NameJet,有的去难以追踪的小网络。没有总表,没有统一时刻,错过正确的地方和时间,你想要的名字可能就永远没了。

白桦: 他还讲了 gTLD 和 ccTLD 的下降规则和时间线各不相同,Notify 会追踪阶段,告诉你该在哪里下 backorder。用户的实际用法也证明了这个工具比想象中宽:有人用它盯一个心仪了十多年的域名——不再被使用、不出售、原主人不回消息——知道有东西 24 小时替他看着就踏实;还有一位运营十几个小发送域名的用户反过来问:我担心的不是 acquiring,是我自己的域名悄悄过期或 DNS 被改,Notify 能不能也监控已拥有的域名?这个问题的答案在源材料里没有出现,虽然他们的解决方案页面确实列了品牌保护这类方向。

茉莉: 社区里最尖锐的问题来自对抢注这个赛道的理解: harder 的问题不是检测,而是警报响起来之后的那场竞赛。如果域名好到值得你盯,其他域商和抢注服务也在盯同样的信号。警报触发之后,还真的有行动窗口吗,还是最终取决于谁的注册商 API 接得更快?这个问题没有得到回答。另一位用户则问能不能按关键词或行业搜索而不是指定具体域名,Michael 也没有在这份材料里回复。评论区里也有人说最大的坑他自己踩过——几年前看着一个 .com 过期,完全不知道 drop-catchers 早就排好队了,页面下线他才注意到。

白桦: 好,我们把今天的线索收一下。从 Gemini 的代理式视频理解,到 fal 的 H3 Max,共同点是模型和推理系统共同设计,把质量和速度从取舍变成可以同时优化的问题;Kit 把这个效率哲学推到编码代理上,用一个工具换掉几十次往返;Tadata 把"分派给 AI"带进 Slack,但要不要信任它的产出还是开放问题。

茉莉: 后三个故事——AI Toolbox、DocsAlot、Notify.domains——讲的是同一件事的不同侧面:AI 时代你的资产越来越分散在别人的平台上,聊天记录、文档、域名,谁能给你可靠的管理层和关键时刻的信号,谁就创造了价值。但每个也都欠着答案:存储驱逐、机械校验、警报之后的竞赛。

白桦: 提醒一句,今天所有性能数字和评测结果都来自各产品方的自述或他们引用的基准,社区评论只代表发言者个人的经验,我们不做任何背书。感谢收听,我们下次见。

茉莉: 下次见,拜拜。