
0812 | 今日AI工程工具盘点:Octomind与Bullet双发布、agent-manager与bb开源编排、AMP值守生产、Kubit分析代理行为
Show notes
本期围绕 AI 代理时代的开发者与效率工具展开。编码代理方面,Octomind 把代理放到云端实现跨设备会话持久化,Bullet 则主打比 Claude Code 快 30-60% 的速度并自动选择模型;agent-manager 用 tmux 管理所有 CLI 编码代理,bb 是可用一句话改界面的 IDE 编排平台。AMP 值守生产环境自动开修复 PR,Gitar 在 CI 里直接应用修复。Kubit 把代理追踪与用户行为放进同一分析平台。Mac 小工具方面,Switchy 一键在多台 Mac 间切换外设,ScreenMark 用 iPhone 遥控现场批注。Gotcha 是本地开源的安卓 AI 副驾驶,能直接操作手机。自动化安全上,Tines 3B 靠凭据代理做企业级审计,BetterClaw 用分级信任模型从实习生权限起步。最后还有给管理者的本地人事笔记 Continuum,以及对比股权授予的 Equitybee Benchmark。节目反复提醒:这些性能数字、客户证言大多出自制作者自述,缺乏独立验证。
时间轴
- 00:00:00 开场
- 00:00:57 编码代理提速之争:Bullet 与 Octomind
- 00:03:07 一个界面跑多代理:agent-manager 与 bb
- 00:06:03 从事故到 CI 的自动修复:AMP 与 Gitar
- 00:07:59 洞察 AI 代理用户行为:Kubit 产品分析
- 00:10:16 一套键盘鼠标切换多台 Mac:Switchy
- 00:12:01 iPhone 遥控现场批注:ScreenMark
- 00:14:13 本地开源安卓副驾驶:Gotcha
- 00:16:13 从零成本实习生到可审计企业自动化:BetterClaw 与 Tines 3B
- 00:18:45 管理者的本地私人人事笔记:Continuum
- 00:20:30 对比你的股权授予:Equitybee Benchmark
相关信息
- Octomind Cloud and Hub - Bri Product Hunt
- Bullet - Bri Product Hunt
- agent-manager - Bri Product Hunt
- bb - Bri Product Hunt
- AMP by CanyonTechs AI - Bri Product Hunt
- Gitar - Bri Product Hunt
- Product Analytics for Agents and Users - Bri Product Hunt
- Switchy for Mac - Bri Product Hunt
- ScreenMark - Bri Product Hunt
- Gotcha - Bri Product Hunt
- BetterClaw - Bri Product Hunt
- Tines 3B - Bri Product Hunt
- Continuum - Bri Product Hunt
- Equitybee Benchmark - Bri Product Hunt
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
林岚: 大家好,欢迎收听 Bri 的 ProductHunt 产品分享,我是林岚。今天这一期,我们把目光投向几款正在改变开发者工作方式的 AI 工具。
陈序: 我是陈序。今天的话题很集中——AI 编码代理怎么才能真正落地,怎么安全地接入真实世界。
林岚: 没错。有代理消失在笔记本合盖时的云端方案,也有把多个代理放进一个界面的编排工具,还有守在生产一线和代码合并关口的工程助手。
陈序: 另外还有几款面向普通用户的产品:帮你在多台 Mac 间切换配件的菜单栏应用、现场演示时的屏幕批注工具,以及自称世界首个安卓 AI 副驾驶的开源助手。
林岚: 更不用说,还有想知道自己期权值多少钱的初创员工、想 1:1 里看清下属的管理者——好,那我们就一起进入今天的分享。
林岚: 今天有两个编码代理发布,恰好解决两个相反的问题。先看 Octomind Cloud and Hub,它面向那些合上笔记本、代理就跟着断线死亡的开发者。做法是把代理放到云端运行,会话能在不同设备之间接着往下走;而且一次登录,不需要你配置任何 API 密钥。创建者说内置了二十一个模型,其中 glm-5.2 在真实的 PR 基准上解出了二十四道题里的二十五道题里的二十四道,领先 Claude Code 和 Codex,运行时是一个 Apache 2.0 协议、单一 Rust 二进制的程序。
陈序: 定价是一台小机器、三个模型的免费层起步,之后首月十美元,每月二十美元,按秒计费。社区里已经有人认可它的会话持久性;创建者还说他们用中途杀死浏览器的方式验证过,不会丢一个字节。不过要留意,性能数字都是他们自己说的,公司是自筹资金、按订阅买硬件,扩容能力可能会受限。这更像一个解决‘代理要长跑’的方案。
林岚: 而另一个 Bullet 正好相反,它解决的是‘代理太慢’——定位是比 Claude Code 和 Codex 快三十到六十个百分点的编码代理。它会自动帮你选模型和推理级别,并行执行独立的工具调用,用定向的代码搜索代替扫描整个仓库嵌入。它兼容你现有的 Claude Code 或 Codex 订阅、API 密钥,也能用设备端模型,而且免费。
陈序: 创建者声称在 SWE-bench 这个标准上做到了 95.8%,排在前三,平均每个任务一百一十九秒。社区里已经有 CTO 和 CEO 说团队内部只用 Bullet;也有人担心烧 token,毕竟 Claude Code 一个月两百美元、自己已经花了三到四千美元,但关于 token 有没有真的节省,没等到量化答复。速度数字同样是自我报告,token 的真实影响还没定。一个管持久,一个管速度,共同点都是宣称比 Claude Code 和 Codex 强,但都得拿到真实工作负载里去验证。
林岚: 这两个开源编排工具,路线正好相反——都是让你在一个界面里同时跑多个编码代理,但一个面向键盘重度用户,一个鼓励你用自然语言改界面。agent-manager 针对的是习惯 tmux 和键盘的终端用户,它把 Claude Code、Codex、OpenCode、Gemini CLI、Grok 和 Pi 全部放进一个 tmux 列表里,每个会话带实时状态。比如在某一行可以直接回答被卡住的代理,不用先 attach 进去;在组那一行一句话就能启动新代理;还能看整个文件的 diff,你留下的行内评论会作为一条审查提示回给代理。
陈序: 还有几个比较妙的地方:按一下键分叉出命名兄弟会话,或者在那个代理旁边固定一个普通 shell,让代理进入全新的 git 工作区。这些会话就是普通 tmux 会话,退出管理器之后代理照样在跑,你自己的 tmux 配置不受影响;一个 Go 二进制、Apache 2.0 协议,支持 macOS、Linux 和 Windows 的 WSL2。Claude Code 的状态来自它自己的 hook 事件而不是猜的面板,六种状态从 working、waiting,到 finished、errored、idle 和 dead。社区里有人说这是他用过最快的编码代理工作流,一切都按一个键到位,审查模式成了他保持打开的主要原因;也有人反映官网链接打不开。发布方自己承认,没有成本追踪,滚轮能滚但其它全靠键盘,箭头键进出面板的导航还是 beta。
林岚: bb 则自称‘会自己构建的 IDE’,是个类似 Codex 应用的编排图形界面,但支持 Claude Code、Codex、OpenCode、Cursor 这些兼容 ACP 的代理,用的是你已有的订阅、由各提供方计费。真正的差异点在于,几乎任何界面元素都能用一条提示词去改变——创建者举例说,你要求一个任务追踪器,它就会生成一个侧边栏面板、一个 bb tasks 命令,以及一条教所有代理使用它的 skill。GitHub 集成、代理记忆、定时任务、远程访问这些自身功能都在同一个插件系统里。
陈序: 它是 MIT 协议、开源、本地优先、免费,macOS 一键下载,Windows 走 WSL,Linux 和远程机器也能用。社区反馈是‘用起来感觉很好’,自定义检出和暂存区设置很顺畅,但也有人希望 web 通知有更标准化的路径;还有用户问能不能集成 Lovable、有没有 Linux 构建计划,现有材料里都没有明确答复。一个把所有控制权锁在键盘上,一个把整个界面交给你用一句话去改,确实是完全不同的两条路。
林岚: 另外两个 AI 工程工具,恰好对应软件生命周期的两端——一个值守生产环境,一个守住代码合并的关口。AMP 是个自治缓解平台:它持续盯着生产的日志,自动理解故障并生成修复,同时自动创建 Jira 或 GitLab 的工单,最后把修复做成 PR 交给你复核。创建者说它不需要提示词、全天候运行,修复准确率超过百分之八十;目前认证支持 Java、Python、TypeScript、Node.js 和 Rust,其他语言还在认证中。
陈序: 它不用安装、也不直接访问生产环境,默认是人在环上把关,促销码能让你在发布窗口期内免费用任意月度套餐三个月。Gitar 这边已经加入了 Sonar,它不把代码审查停在‘提出问题’这一步——它审 PR、诊断 CI 失败、直接应用修复,然后在同一条流水线里重新验证;还能自动重试不稳定的测试,直接在 GitHub 或 GitLab 里操作。网站自称来自打造 Uber 开发栈的团队,提供十四天免费试用,开源项目可以申请免费使用。创建者 André 的说法是,低端 AI 代码审查市场已经饱和,高端审查仍是蓝海。
林岚: 页面上的客户证言也值得对照着看:OpenMetadata 的联合创始人说它抓到了评审可能漏掉的真实 bug 和漏洞;SoFi 的移动工程总监说缩短了移动 CI 的合并时间;Alturist 的工程经理说它服务了一百三十多名工程师、一千一百多个仓库。但这些基本都是创建者自述或挑选出来的评价——那个百分之八十的修复率、没有无效评论这些说法都缺乏独立验证;AMP 的准确率口径是什么,Gitar 并入 Sonar 之后路线会怎么变,都还是开放问题。
林岚: 最后是 Kubit,面向 AI 代理和用户行为的产品分析平台,做给那些在构建 AI 功能的产品工程师、数据分析师。创始人兼 CEO Alex 在 Product Hunt 上讲清了痛点:现有的可观测性工具只能告诉你代理做了什么,传统分析只能告诉你用户有没有离开,两边互不连通;团队往往要开六个标签页,手动把原始的 JSON 追踪和点击流事件配对起来,才能猜问题出在哪。Kubit 的核心差异,是把代理追踪和用户行为放进同一个平台。
陈序: 它的做法是把 P95 延迟、token 用量、模型成本这些技术指标,和日活、留存、LTV 这些业务指标关联起来看。你可以定位到是某个幻觉、还是某次失败的工具调用,打断了转化漏斗的哪一步;可以追踪重新提示、愤怒点击、意图和情感;还能构建同时覆盖后端代理交互和前端用户行为的跨域用户群组。官方说能从数十亿行数据里提取行为洞察。集成上,自称几分钟就能接入现有 OTel 基础设施或 CDP,也支持自带数据仓库,PII 和敏感数据不离开仓库,SDK 可选,还有针对 Sentry 和 Embrace 的桥接。
林岚: 它还有个无头分析的方向,面向开发者 AI 工具,通过 MCP 和自定义 skills 把行为洞察直接喂给 Claude Code 这类编码代理。官网展示的客户证词来自 Miro、Vix、GameChanger、Serko 的分析师,有的说以前要写很复杂的 SQL 而且性能受限,有的说现在一两分钟就能得到答案;社区里也有人印证,构建 AI 功能的团队普遍知道代理做了什么、用户有没有走,却说不出原因。
陈序: 但要留神,功能、性能和客户评价都出自制作者和官网,还没有独立验证;发布信息也没披露定价。可以后续关注它的免费试用、MCP 集成有多深,以及自带数据仓库模式下的真实查询表现。一句话总结就是——工具在把‘代理做了什么’和‘用户为什么要走’接起来,而这一块目前还没有谁做得够好。
林岚: 先看一款解决外设切换痛点的菜单栏小工具,Switchy,专为 Mac 设计。痛点很实在:你可能有工作机和私人机两台 MacBook,共用一套 Magic Keyboard、Trackpad 或 Mouse,以前要手动断开重连,或者干脆插线,苹果自己也没给这些高价外设做快速切换。Switchy 的做法是让多台 Mac 装在同一本地网络里,自动发现彼此,你点一下,就能把这套键盘或触控板从一台机器交到另一台,不用进系统设置,也不用重新配对。制作者说,他就是因为工作和私人 Mac 之间切得不方便,同事又为每台电脑另买触控板浪费钱,才做的这东西,自己每天靠它一键切换全部外设。
陈序: 价格上也挺透明。免费三天全功能试用,之后一次性买断 12.99 美元,没有订阅;一份许可证最多同时覆盖五台 Mac,占满名额也能随时停用一台腾出位置。要求 macOS 14 以上,键盘、带指纹的键盘、触控板、鼠标都支持,也能用 brew 一条命令装。需要注意,每台参与切换的 Mac 都得装上它,这不是只装一边就能用的。隐私上它说自己完全本地,切换数据不出设备,只有许可证验证和更新检查会联网,没有分析也没有账户。不过这些特性和所谓无缝交接,都是开发者自述,还看不到独立验证,社区里也只有零星反馈——有人问快捷键能不能配置,还有人感慨苹果不为自家的高价外设内置类似功能有点疯狂。真正长期用下来的体验,还需要观望。
陈序: 另一款叫 ScreenMark,也是 macOS 菜单栏应用,面向老师、演示者和开发者,解决的是现场演示时的批注需求。它能在任意应用上画线、画箭头、标注文字,跟着光标实时缩放,还能冻结画面、做白板模式、用模糊和聚光遮住敏感区域,甚至可以把系统音频和麦克风混录成视频,批注直接烧进画面里。最特别的是配套有一款免费的 iPhone 应用,把手机变成遥控器,不用回到键盘前,站在原地就能远程触发高亮、手电筒、绘图和缩放。开发者自己说,这正是他对 Mac 上现有批注工具的抱怨——你想离开键盘走到屏幕前,还能继续标注、放大、画图,而手机遥控是他自己用得最多的功能。
林岚: 定价上,免费版给你核心的批注工具;要录制、实时缩放、光标高亮和自定义快捷键的话,就得升到 Pro。Pro 是一次性买断 29.99 美元,也有月付和年付档,年付相比按月省约六成六,新订阅还带七天试用,这些都由苹果应用商店管理。它要求 macOS 15 系统,苹果自家的芯片和老款 Intel 芯片都支持。开发者强调它本地优先,不需要账户,也不上传内容;录屏权限只在缩放、冻结、截取和录制时用,麦克风权限只在真的录麦克风时才用。
陈序: 不过这个产品的证据目前很有限。能看到的社区反馈,是一位评论者说配套的遥控应用让这工具变得很实用——那是个人的使用感受,不是验证结论。开发者现在公开向老师和远程演示者征求反馈,也就是说真实演示场景下好不好用,还是个待观察的信号。如果你经常站着讲课、又不想被键盘栓住,这种需求倒是真的存在,但要不要掏钱,恐怕还得等更多实战口碑。
林岚: 接下来这个叫 Gotcha,是今天可能争议最大的一款。它自称是全世界第一个 Android AI 副驾驶,免费、开源,跑在设备本地,口号就是你说话、它行动。创始成员的核心观点是,现有的移动 AI 助手不过是美化了的文本框,你问完问题,还得自己打开日历、自己跑脚本、自己调智能家居;而 Gotcha 是一整套循环,计划、执行、观察、适应。它借助安卓的辅助功能去点击、填表、滚动,在安卓上直接运行 bash、Python 这类脚本,还原生接进 Home Assistant 智能家居、Notion、联系人和短信。官方给你举的例子很直观:对着手机说告诉妈妈我迟到了,它就直接调出联系人发短信过去;说开手电筒并把音量调到 30%,它就同时干这两件事。
陈序: 模型这块它是自带思路,可以用本地的开源模型,也可以接云端的大模型;语音和唤醒词也都本地处理。但真正的关键是安全设计。它分监控和操作员两种模式:监控模式有四十多个只读工具,不能发消息、不能改设置、不能删文件;操作员模式才放开全部一百多个工具,而且要过四个权限层级,最高一层是直接对系统根目录操作,在没越狱的设备上会严格失败关闭。运行的时候有个光环颜色告诉你它是在前台看屏幕,还是后台处理,另加追加式的操作日志。制作者罗列了这些能力,口气不小,但和今天前两款一样,最强、最强大这类说法都出自制造者之口,没有独立验证;能看得到的,是一位评论者说它比普通 AI 聊天应用有用得多,那也只是个人感受。一个能直接操作你手机的 AI,习惯上说谨慎一点也不为过。
林岚: 今天最后这个话题,把前面那层意思说透了:AI 生成的自动化,到底怎么安全地接进真实世界。两款产品都在解决这个,但路线完全不同。Tines 3B 面向团队和企业,定位是给 AI 代理、应用和自动化一个安全的环境。它的产品负责人用一个词形容现在的痛点,就是野代码——用 AI 快速建起来,没人治理、没人监控,还常常把 API 密钥硬编码在明文文件里。它的核心机制是凭据代理:AI 永远看不到凭据本身,运行时由代码之外的代理注入,代码隔离运行,交付内容可审计、可监控。公司说自己有八年的智能工作流经验,服务过 Reddit、Coinbase 这些客户。今天先放出的是免费探索版,三个实时工作流,用户、空间和连接器不限量。社区里已经有人在追问很关键的问题:凭据代理有没有细粒度访问控制,AI 自动重跑写操作的时候,有没有干跑路径,避免重复执行副作用。
陈序: 另一款 BetterClaw 则走个人和小团队的轻量路线,是无代码的定时 AI 代理,号称六十秒就能部署好,不用自己架服务器,支持几十种常用服务的授权登录。它可以自带模型密钥,用自己的钥匙就能做到真正零成本。它的信任模型特别有意思:代理从一开始的实习生级别起步,每次动手前先申请许可,用久了表现好再往上升。密钥加密存放,而且几分钟后就从记忆里清掉。有位用户实测,用免费的模型密钥搭了个邮件分拣代理,大约九十秒成型,已经稳定跑了十一天。也有人指出开放的疑问:升级条件能不能自定义,怎么验证它真的改了数据而不是只信联动服务的回执;还有评论者警告,逐条人工审批在量大的时候会退化成机械点击。
林岚: 所以这两家其实是殊途同归:都不默认给 AI 全量权限。Tines 用企业级的审计和凭据隔离,守护的是团队流程;BetterClaw 用分级信任加自带密钥,降低的是个人上手门槛。不过要记住,所有这些社区反馈都只是个人体验,是声称,不是已验证的结果。把权限和验证的边界想清楚了,再让 AI 替你行动,这才是今天这些工具真正教我们的事。
林岚: 先说 Continuum,这其实是给管理者的一款本地 Mac 应用。思路很简单:与其凭印象管人,不如为每位直接下属正式写下你心里对 TA 的判断,也就是一条条“信念”,然后在每次 1 对 1 的时候记下观察、打上标签,让对人的判断随时间积累成有迹可循的记录,而不是停留在感觉里。
陈序: 它的核心机制听起来也设计得挺克制。每条信念都带一个置信度,从还不确定到相当有把握分成几档,同时标一个状态,是正在关注、已经解决,还是干脆废弃了。写 1 对 1 时还能标记信号的类型和方向,是上升、下降还是平稳,这些信号会去推动相关的信念,也会自然随时间衰减,让近期观察比旧观察更管用。
林岚: 关键是,它明确不做评分、不做报告,也不向上级上报。所有数据只存在你本地那台 Mac 上,没有云、没有账号、不联网,更不接 HR 或绩效系统。还有个 Focus 视图,专门提示你现在该重点关注哪些人。定价上,免费版够管 3 个人;Pro 可以按月、按年,或者一次性买断,发布这一周还有折扣。
陈序: 现在只是第 1 版,开发者也在公开征询反馈,比如信念和信号的模型是不是贴合真实的管理思路,大家会配置哪些信号类型,衰减强度设成多少合适。社区里也有人肯定了这种本地和隐私优先的设计,觉得衰减的想法刚好。不过要先说明,这些多是开发者自己的描述和个别评价,不是经过验证的结论。
林岚: 另一个是 Equitybee 新出的免费工具,面向美国初创企业的员工,让你可以按部门、职级和公司阶段,对比自己的股权授予放在市场里大概是什么位置。两位联合创始人说,公司长期以来都是用薪酬基准去设计股权 offer 的,可员工评估手里的 offer 时反而没有同样的市场背景,这个工具就是补上这块空白。
陈序: 它专门做给员工自己查询,不面向 HR。官方说数据来自九千多份经过核实的初创企业期权授予,覆盖两千五百多家美国公司。选定几个条件后,能看到你的授出在一群可比公司里排在第 25 百分位、中位数还是第 75 百分位,以及授予的平均公允价值。
林岚: 它也有事前的自我声明:这些基准只提供基于自己数据集的市场背景,仅供参考,数据没有经过独立验证,也不是用来预测期权未来价值的。这点值得注意。
陈序: 更有意思的是用户的提问本身。有人问会不会增加行业、公司估值这些维度;有人问大家更多是在评估 offer 时用,还是决定要不要行权时才用;还有位创业者想反着查——输入你未来 18 个月的招聘计划,看需要准备多大的期权池。这些开放问题目前都还没答复。
林岚: 所以这东西的定位很清楚:给员工一个自行查询的市场坐标,帮你在评估 offer 或谈薪酬时有据可依。但它的边界同样清楚——数据未经独立验证,也不预测期权值多少钱。它更像是给判断提供背景,而不是替你做判断。
林岚: 今天的话题都围绕一件事:AI 工具正在从“替你打字”走向“替你把事情做成”。从云端续接会话的编码代理,到把多个代理放进一个界面统一编排,再到替你看生产日志、自动生成修复的平台,AI 已经从辅助角色渐渐变成真正的执行者。
陈序: 有产品在补上代理的安全闭环,比如为 AI 生成的自动化提供安全运行环境,也有工具盯着代码合并关口,在问题落地前拦住它。就连分析领域也在变化,从只看得见“代理做了什么”到真正理解用户行为背后的原因。
林岚: 另一条线很亮眼:开发者们开始认真做硬件的切换体验和现场的演示工具,还有像 Gotcha 这样自称世界首个 Android AI 副驾驶的开源设备端助手——你说话,它行动,而且完全免费。股权对比工具也是新的角度,让员工能看清自己手里的授予处在什么位置。
陈序: 今天的共同信号很清晰:AI 不再被当成一个功能,而成了一条条完整的工作流。无论是让代理活在云端,还是把多个代理放进同一个界面,真正的价值都不是模型本身,而是它如何安全、可控地融入工作与生活。感谢收听,我们下期见。