0822 | Vercel fx开源代理、Base Compute Local本地AI、Plow Latch及Google Antigravity扩展

||Download

Show notes

本期节目盘点了多款最新的 AI 开发工具与本地应用。从在 Mac 上完全本地运行、免云端免账户的 Local,到让 AI 代理在 Mac 上受限运行、数据留本机的 Plow Latch,再到自动构建工作记录、需审批后才行动的 ShogunAI,以及 Windows 原生的屏幕感知桌面 AI Project SKY。此外还介绍了屏幕 OCR 工具 PixelRead、Vercel 开源的六兆字节编码代理 fx、把代理编程带进四大编辑器的 Google Antigravity 扩展、沙箱化且不碰真实凭据的 Slack 智能体 OneCLI、面向 AI 智能体的记忆层 Actx0,以及按性能阈值自动路由到最便宜模型的 Router by Ramp。多款产品都强调本地处理、隐私与数据可控,但不少宣称仍属开发者或社区自述,尚待独立验证。

时间轴

  • 00:00:00 开场
  • 00:00:54 Local:在 Mac 上完全本地运行的 AI
  • 00:03:09 Plow Latch:让 AI 代理安全操作 Mac
  • 00:04:43 ShogunAI:自动构建工作状态的个人代理
  • 00:06:33 Project SKY:Windows 原生屏幕感知桌面 AI
  • 00:07:45 PixelRead:把屏幕任意区域变成可复制文本
  • 00:09:19 fx:Vercel 的六兆字节开源编码代理
  • 00:10:43 Antigravity:代理编程进入四大编辑器
  • 00:12:16 OneCLI:不碰真实凭据的 Slack 智能体
  • 00:13:49 Actx0:智能体与会话之间的记忆层
  • 00:15:10 Router by Ramp:按性能阈值路由到最便宜模型

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 欢迎收听 Bri 电台的《ProductHunt 产品分享》,我是茉莉。今天这期要聊的,是最近在 Product Hunt 上冒出来的一批新工具,从 AI 编码代理,到跑在你自己电脑上的本地模型,种类挺全。

白桦: 我是白桦。我注意到这一期里,本地和原生是个明显的方向,比如有一款 macOS 应用,让 AI 完全在你自己电脑上运行,不用云、不用账户,按 token 零成本;还有一款用 Zig 写的开源编码代理,原生二进制文件只有六兆左右,主打小巧开放。

茉莉: 对,另外还有面向 Mac 和 Windows 的桌面端 AI 工具,像个人 AI 代理、本地陪伴应用,还有屏幕文本捕捉工具,覆盖了不少使用场景。

白桦: 那就话不多说,一起看看这批新品到底怎么用。

白桦: 这期简报先看 Base Compute 推出的 macOS 应用 Local,让 AI 完全在用户自己的 Mac 上本地跑,不用云、不用账户、按 token 零成本。开发者解释,本地 AI 本来就解决隐私问题而且免费,但过去安装配置太麻烦,所以做了零摩擦设置,自动针对硬件调优并推荐真正能跑起来的模型。他们还自述在同样硬件上聊天、编码和会议记录速度最高可达其他本地应用自带推理引擎的五点四倍,依据是首次启动时为芯片编译的 BaseRT 引擎;但这是开发者自述,有人想验证,因为那位评论者在 M3 Pro 上试过宣称自优化的方案,最后还是得手动配模型,而默认上下文窗口和覆盖设置的问题也没得到答复。功能还包括本地文件聊天、PDF 摘要、项目文件夹里读取编辑跑代码、设备端会议转写并标注发言人、可见可编辑的记忆,以及统计 token 数和云端 API 等价成本的页面。Office Mode 让办公室性能最强的机器跑大模型,其他笔记本连接使用;模型目录里有 Qwen、Llama、Gemma、Mistral、Phi、DeepSeek、Whisper,也可以自带 API 接 OpenAI、Anthropic、OpenRouter,或把推理路由到指定国家的云服务商。

茉莉: 硬件门槛也清楚:支持任何 Apple 硅芯片 Mac,内存决定能跑多大,八到十六 GB 对应 Air 和基础款 Pro,二十四 GB 是 Pro 芯片机型,三十二到一百二十八 GB 在 Max 芯片、Mac Studio 上体验最好。macOS 版已上线,Windows 和 Linux 即将推出;下载应用和模型后即可完全离线运行,不收集数据、无账户、无遥测,隐私模式开启时云端模型关闭。不过有位 2020 年 Intel MacBook Air 用户问兼容性,另一个评论者问不同硬件上的测试结果和最低配置要求,这两项都没回复;还有评论者认为,在价格与性能之间找到更聪明的平衡才是值得解决的问题。

白桦: 接下来这款 Mac 工具叫 Plow Latch。开发方说它让 AI 代理在 Mac 上获得受限的真实控制权,数据保留在本机,兼容你已有的 AI,包括 Claude.ai 和 Codex,可以让 AI 驱动浏览器和命令行,也能百分百本地运行;安全上有个对抗性大语言模型守门,防止代理失控时泄露数据。为了证明,开发方直接开放了自己一台 Mac,说用户只要在 Product Hunt 留评论,就能到 Twitch 直播上实时驱动它演示,评论区涌进大量实际操作请求——订披萨、Chipotle、珍珠奶茶、沙拉,还有人要生成复古八位机风格的本地 HTML 页面;开发方引导大家去看直播里的下单执行,但现有内容没有验证这些请求是否真完成。

茉莉: 更有意思的是,有位评论者报了具体的边界问题:同一台机器跑多个代理会话、共享同一个浏览器,当一个会话正在完成 OAuth 流程时,另一个会话的例行页面读取从 localhost 回调页拿到了那个单次有效的授权码。他强调这不是恶意攻击或提示注入,而是两个行为正常的代理共享同一环境权限、彼此没有边界,所以问 Latch 到底按会话还是按代理身份做权限隔离。这个问题,加上另一位评论者问的手机端类似功能、并提到 Apple 过去对这类应用有过保护,都没看到明确答复。

白桦: 第三款是 ShogunAI,面向 macOS 的个人 AI 代理,官方定位叫“运行在你电脑上的个人 AGI”。开发者澄清,这不是指人类级智能,而是对工作具有通用性、不困在单一任务里,一个代理覆盖全天、掌握你的工作状态并据此行动,目标用户是创始人、产品与工程人员和顾问。机制上,它在你工作时自动构建并保存工作状态,记录人、项目、承诺和未完成事项,全部留在本机;读取自动,但任何发给别人的内容都要经你批准。能力包括光标旁的内联草稿、会议纪要转录后生成摘要与承诺、双向实时翻译只留文本、跨邮件聊天文档日历的单一搜索召回,以及每日简报;可逆操作自动运行,任何离开 Mac 的操作暂停等批准,可以用已付费的助手套餐或自带 API key,每个动作都留有记录。

茉莉: 开发者还把工作状态通过 MCP 提供给其他代理。跟 Hermes 对比时他说,Hermes 从自身会话里学习,而 ShogunAI 持有的是“当天本身的状态”,两者互补,让 Hermes 指向 ShogunAI 就不再追问;他的核心判断是模型已足够聪明,缺的是你的上下文和记忆,还引用了 Garry Tan 和 Sam Altman 的说法支撑。不过这些全是官方和贡献者自述,产品还没正式发布,目前只有免费早期访问候补名单开放,测试版说“很快”推出,页面还宣称赢得了一场由 Transpose 主办的 YC RFS Hackathon 二零二六年度赛事;内测刚起步,实际效果和稳定性都未知。

白桦: 最后一款叫 Project SKY,面向 Windows 的原生桌面 AI 陪伴工具。按开发者描述,它不像浏览器里的聊天机器人困在标签页里,而是直接作为操作系统层运行,有屏幕空间感知、语音对话和跨会话长期记忆,支持圆形框选式屏幕分析、自动化桌面工作流和语音驱动的任务管理,还能在不打断专注的情况下跨应用理解你当前在做什么。

茉莉: 开发者在社区解释动机:以前他编码、设计或研究时调用 AI,得切换窗口、截图、复制粘贴,再从头解释一遍上下文,反复打断心流,所以想搭一座 AI 和操作系统之间的桥,让 SKY 实时看到屏幕、以零延迟语音自然对话,并保留不需要重复提示的持久记忆。开发过程是从标准聊天部件逐步演化成集成式操作系统层,圈选屏幕的选择方式和原生桌面编排都围绕“圈选内容、自然说话、让 SKY 处理”加进去。需要说明,这些都只是开发者自述的产品宣称,还没有经过验证。

白桦: PixelRead 是 Product Hunt 上的一款 Mac 屏幕 OCR 工具。按 Command 加 Shift 加 2,拖选图像、视频、PDF、网页或应用里的任意区域,就能把像素文本变成可编辑内容,然后复制、在设备上翻译、用系统语音朗读,或交给 Apple Intelligence 总结、重写、提取关键细节和提问。开发者说,他做这个是因为屏幕文字常困在截图、视频和 PDF 里,现有 OCR 工具通常只做到复制,他希望一个快捷键就完成翻译、朗读、提取和问答。

茉莉: 它的亮点是处理全部留在本地——OCR 用 Apple Vision,翻译用 Apple 的本地框架,AI 处理也不发送到服务器。有社区用户说,这正是打动他的点,他不用系统内置截图转文字工具,一半原因就是担心屏幕内容被送到网上。他最想用的场景是把贴进 Slack 的错误截图和堆栈跟踪提取成可搜索文字,不过他也疑问:提取关键细节能否像处理普通文本那样干净地处理杂乱的等宽终端输出,他说那常是 OCR 工具的失效点。

白桦: PixelRead 免费,需要 macOS 15.2 或更高版本,但翻译和 Apple Intelligence 功能要 macOS 26 加受支持的硬件。产品页显示它免费、版本 1.1.2、体积 3.3 兆字节,之前 1.1.0 版本移除了试用和锁屏,让应用全面免费。

茉莉: Vercel 推出了开源的编码代理 fx,用 Zig 编写,以约六兆字节的原生二进制发布,官方定位是小巧、开放、原生。设计上刻意保持小体积,让更多空间留给模型,所以启动几乎瞬时,内存和上下文开销都低。它支持本地或云端模型,可通过 skills、插件和 MCP 扩展,也能嵌入到自己的代理基础设施里。

白桦: 有社区评论者觉得它更像 Unix 工具而不是终端里的完整 IDE——系统提示和工具面都很小,减少了上下文窗口被代理框架本身占用的部分。他认为它仍然非常早期和实验性,但可嵌入的设计让同时运行很多轻量级编码代理这个想法特别有意思。另一位评论者同样对把更多空间留给模型这个思路感兴趣,还期待开发者用它构建的东西。

茉莉: 官方页面也写得很直白:版本 0.0.4、约六点三九兆字节、标注实验性,提示用户自担风险,并说会频繁更改。安装命令是把 curl 拉取的脚本交给 bash 运行。官方演示还把完整 fx 命令行界面用 Zig 工具链编译成 WebAssembly 来运行,网络请求则委托给浏览器处理。

白桦: 2026 年 8 月 20 日,Google 发布了 Antigravity IDE 扩展,把代理编程平台带进 Visual Studio Code、Visual Studio、JetBrains 和 Zed。开发者不离开编辑器,就能保留代理对话和共享上下文,查看内联差异、检查计划、调试代码、交接多步任务。它定位为轻量集成,而不是把编辑器改造成多代理中枢——端到端的多代理协调仍由 Antigravity 2.0 独立应用承担,扩展负责在真实编辑器里查看代码路径、审阅差异和单步调试。

茉莉: 安装上,Visual Studio Code 走 Marketplace;Visual Studio 走扩展管理器,目前是预览;JetBrains 支持 IntelliJ 系全家,从 2026.2.1 起可以在 IDE 内一键安装,Zed 同样一键。个人开发者可用 Google 账号登录任意 Antigravity 方案,包括免费档;企业团队用 Gemini Enterprise 或 Google Cloud 项目凭据,其中 JetBrains 和 Zed 的企业支持目前也是预览。

白桦: 产品页说明,会话遵循 Google Cloud 服务条款,数据不会用于训练基础模型,并遵守组织的 IAM 策略和 VPC Service Controls。Product Hunt 讨论里,有人评价 Google 在编码产品上的历史表现并不均衡,但认为在用户已有的编辑器里提供能力是务实的做法——当然,这只是观点,不是已验证的结果。

茉莉: OneCLI 定位是团队的 AI 智能体工具。每名员工在 Slack 和网页端拥有自己沙箱化、受策略控制的智能体,可连接 GitHub、Gmail、Notion、Dropbox 或 CRM。核心设计是智能体本身不持有真实密码或密钥,只看到占位符;OneCLI 网关在请求获批后,在网络层按请求注入真实凭据。发邮件、删工单这类敏感操作会先请求人工批准,团队还能规定智能体绝对不能碰哪些操作,网站称异常高频率的重复行为会被减缓或暂停。

白桦: 部署支持自托管或托管服务,并提供无需绑定银行卡的免费层。联合创始人 Jonathan 说项目完全开源、获得 Y Combinator 支持,下载量超过三十五万次;他之前在后来被 HPE 收购的 Axis Security 构建零信任网络访问产品,另一位联合创始人 Guy 是后来被 Aqua Security 收购的 Argon 的首位员工。社区里也有人问,能否更方便地管理智能体的访问权限,去简化智能体向人工请示的流程。

茉莉: 不过得说清楚:这些能力、下载量还有客户背景,全部来自团队自述,还没有第三方独立验证。网站上那些演示场景——自动核对一千二百零四笔 Stripe 收款、对超过五百美元的退款停下来等审批——都只是演示描述。实际的安全性和效果,目前仍是未知数。

茉莉: Actx0 是面向 AI 智能体的记忆基础设施。制作者说,团队花了好几个月构建它,因为智能体会在会话结束后把一切忘光,开发者不得不反复把旧数据硬塞回提示词里,还得承担高昂的 token 成本。Actx0 会提取重要信息、以毫秒级速度回传,并且跨会话、跨智能体、跨应用持续工作,开发者自己不用维护矢量存储,目标群体是看重延迟、成本和控制的团队。需要说明的是,这些都只是制作者自己的说法,还没有经过独立验证,而且这只是庞大路线图的第 1 天,仍在快速迭代;付费计划即将推出,目前可以免费使用。

白桦: 社区里有评论者印证了矢量存储维护确实最耗时,不过他追问:租户隔离到底是在存储层强制实施,比如每个客户独立的命名空间或密钥,还是要用户自己在标签和查询里处理?这个问题没人回应,跨客户记忆泄漏的担忧仍然是开放的。还有人问能不能兼容 OpenClaw,也没看到答复。

茉莉: 另外还有评论者称赞 SDK 直观、支持多框架,同时追问云端基础设施是不是完全托管的,这个同样没有回应。

茉莉: Router.com 是 Ramp 推出的面向开发者和工程团队的 LLM 推理路由服务。它用一个统一的 API 端点,把每个请求动态路由到满足性能阈值的最低成本模型,目的是减少多模型 API 集成的混乱、降低推理账单。发布方说,随着团队扩展多智能体系统和复杂工作流,推理账单会膨胀,开发者常要花大量精力应付多个 API 集成、速率限制和回退策略。

白桦: 据发布介绍,通过单一 API 密钥就能访问 OpenAI、Anthropic、SpaceXAI 和开源模型,不用重写代码库;声称平均能帮团队省下百分之四十的推理支出,还与 Ramp 的财务引擎集成,把 token 用量映射回团队和预算。零成本路由层会持续到 2026 年,附带 26 美元的模型积分。不过这些能力和节省数字,都来自发布方和社区描述,并不是独立验证的结果。

茉莉: 有评论者直接问它和 OpenRouter、Cortecs 有什么不同。另一位评论者说 LLM 成本很容易失控,而且自己常常纠结该选哪个模型,所以自动路由和成本可见性对他很有吸引力。

茉莉: 今天聊到两款挺对立的工具:一边是 Vercel 只有六兆字节、用 Zig 写的小型开源编码代理,另一边是 Local,让 AI 完全在 Mac 上本地跑、不要云端也不要账户。

白桦: 一个刻意做小,把资源留给模型;一个想让你自己的机器自调优。两款都还很早期,值得继续关注。谢谢收听,咱们下期见。