
0810 | AI简报:Argos浏览器代理、Soup CLI低显存微调、Grok Imagine 2.0与DuckDisk
Show notes
本集盘点多个新品,并重点聚焦 ScrapeOps 的 Proxy Tester——一个针对具体目标网址横向测评二十多家代理供应商真实成功率、延迟、可靠性与成本的平台,能识别并剔除被反爬拦截的假阳性结果,让开发者在付费前用真实数据决策。其余产品包括:跑在浏览器、可用已登录账户代办任务的 AI 代理 Argos;让 4GB 显存笔记本 GPU 微调 8B 模型并强调正确性验证的 Soup CLI;主打更锐利文字渲染与区域编辑的 Grok Imagine 2.0;开源免费的 macOS 存储分析工具 DuckDisk;按日历和显示器变化自动排好窗口的 Workflo;让团队与 AI 代理跨平台协作的开源中枢 AgentConnect;针对拔头发等身体聚焦重复行为的游戏化工具 SoloUno;以及拍照语音快速记录宏量营养的 Macrobite。节目逐一拆解各产品亮点、社区反馈与仍未解决的开放问题,并提醒部分宣称与用户反馈尚未经独立验证。
时间轴
- 00:00:00 开场
- 00:00:42 Argos:浏览器 AI 代理
- 00:02:12 Soup CLI:笔记本 GPU 微调大模型
- 00:04:06 Grok Imagine 2.0 图像生成器
- 00:05:33 DuckDisk:macOS 存储分析
- 00:07:24 Workflo:自动整理 Mac 窗口
- 00:09:38 AgentConnect:团队与 AI 协作中心
- 00:11:43 SoloUno:行为习惯自我管理
- 00:13:28 Macrobite:宏量营养记录
- 00:15:06 Proxy Tester:代理基准测试
相关信息
- Argos - Bri Product Hunt
- Soup CLI - Bri Product Hunt
- Grok Imagine 2.0 - Bri Product Hunt
- DuckDisk - Bri Product Hunt
- Workflo - Bri Product Hunt
- AgentConnect - Bri Product Hunt
- SoloUno - Bri Product Hunt
- Macrobite - Bri Product Hunt
- Proxy Tester by ScrapeOps - Bri Product Hunt
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
林岚: 欢迎收听 Bri——ProductHunt 产品分享。我是林岚。
陈序: 我是陈序。今天的推送里有一批有意思的新工具,从快得惊人的代理式浏览器操作,到在笔记本电脑上微调大模型的轻量方案,还有图像生成、Mac 存储分析和更多。
林岚: 我们会聊到一个能替你在浏览器里真正点击和填表的 AI 代理,一个在显存较小的笔记本上跑大模型微调的办法,还有 Grok 新一代的图像生成器,以及好几款面向 Mac 和日常效率的小工具。
陈序: 那就一起往下听,看看今天有哪些值得试的新产品。
林岚: 先讲 Argos,这是一个跑在浏览器里的 AI 代理。制造者在 Product Hunt 上的介绍是,现在的 AI 工具大多只给答案,复制、填表、点按钮这些还是得你自己动手;Argos 不一样,它直接用你已登录的账户,在浏览器里替你点击、输入、填表单,把真实任务做完。使用方式也很灵活,你可以侧边栏提问,也可以从 Telegram 或 WhatsApp 发指令,还能实时观看它操作,或者放后台跑,完成后把结果返回给你。
陈序: 它声称原生支持 Gmail、Docs、Sheets,也接 GitHub、Slack、Notion 这些常用服务,数据留在设备上,破坏性操作会先确认,免费开始。不过有几个不确定点值得留意。一个就是它现在是旧项目 Lyto 改名字、重新定位过来的,商店列表里有些地方还显示旧名,改名还没完全走完。
林岚: 更关键的是社区里一个很尖锐的质疑。那个用户问的是:很多浏览器代理常见的失败模式,是它报告点击成功了,但动作实际没落地——比如页面上的元素迟加载,把页面挪动了——那 Argos 到底怎么验证点击和填表真的生效了,而不是只信任事件触发了?这个问题目前还没看到制造者回应,动作验证机制算是个开放问题,加上品牌过渡还没结束,这算它目前最明显的两个不确定点。
陈序: 第二个是 Soup CLI,一个开发者的命令行工具,主打场景是在只有 4 GB 显存的笔记本 GPU 上微调 8B 级别的大模型。它的思路挺有意思:LoRA 训练时基础模型是冻结的,只读不写,所以根本不用一直待在 GPU 上,只需要在矩阵运算前赶到就行。模型住在系统内存里,一层层流式送进 GPU,这样峰值显存就从一整个模型降到了一层的规模。
林岚: 开发者自己公布的自测数据是,在 4 GB 显存的 RTX 3050 笔记本上跑 Llama 3.1 8B,训练速度达到每秒约 120 个 token,峰值占用 3.3 GB 多一点。工具宣称一个 YAML 配一条命令就行,支持多种训练方法,还带评估、门控和导出,Apache 2.0 开源。但开发者说难点其实不在速度,而在证明它是对的——流式训练会静默失败,切断了反向传播路径之后损失还是会下降,因为上层还在继续学,表面看不出问题。
陈序: 所以他每次发布都把流式运行和常驻运行的结果做严格比对。他提到上周有人借给他 8 块 H100 用了三天,还真在已发布代码里发现一个 bug——超过一定层大小后梯度会静默出错,但损失曲线看起来正常,他连同复现程序一起公开了。社区里有人很认可这种把测错的数据也发出来的做法,觉得这种正确性验证比优化本身更稀缺。但也有个问题还没被回答:logits 严格一致的验证,是只针对全精度模型,还是也适用于已经 4-bit 量化的基础模型。而且这一切测量和描述都是开发者自述,还没被独立验证。
林岚: 接着说 Grok Imagine 2.0,Grok 新一版的 AI 图像生成器。官方把它定位成带分割编辑能力的下一代图像生成器,宣称的升级包括指令遵循能力明显提升、文字渲染和排版更锐利、复杂版面布局更连贯,还通过一个叫魔杖的工具做精确的区域编辑。但这些都属于官方宣称,不是独立验证的结果,而且我们访问产品官网时只看到一个验证页面,没能拿到更多规格、定价和可用性信息。
陈序: Product Hunt 社区里的评论是相当不一致的个体反馈,没有统一共识。有人说改进很好、渲染更锐利精细,觉得近几次更新确实有提升;也有人直说它不如其他模型强大、不够接近超写实,但作为 X 套件的补充还不错;还有人觉得现在好用的图像模型太多,选不过来,反而更希望 AI 视频工具也能进步。
林岚: 最具体的一条评论是针对魔杖工具的两个开放问题。那用户说,产品图和广告图场景里,常见的失败是编辑某一区域会连带微妙地改变其他地方——文字变形、版面漂移。所以他问的是:2.0 到底能不能保持未编辑区域的像素稳定,还是只是以遮罩为引导做整图重新生成?另外还想知道分割编辑有没有开放 API,还是只限应用内用。现有材料里没有这些问题的答案。
陈序: 最后是 DuckDisk,一个免费、开源的 macOS 存储分析工具,已经拿到 Apple 公证并上了 Mac App Store。它不走常见的彩色磁盘地图那套,而是用表格优先的树状视图,下钻时同时看目录大小、分配空间、占父目录的百分比、文件数,还有文件类型合计。同一界面能扫描本地磁盘、OneDrive、Google Drive 和 SSH 路径,云扫描只读元数据、不下载文件内容,还支持增量刷新。
林岚: 它清理也是分阶段供你审查的:云端项目移进对应的回收站,本地和 SSH 的永久删除要额外确认,而且它不会永久删除云项目。权限方面,OneDrive 只请求拿回权限以便移进回收站,Google Drive 因为 Google 不给更窄的元数据权限,所以请求的是完整范围,凭据都存在系统钥匙串里。两个版本配得也挺细:直装版额外支持 Google Drive、用系统 SSH 配置;沙盒的商店版支持本地盘、OneDrive 和 SSH。
陈序: 开发者做它的初衷是,大多数 macOS 磁盘清理器只给漂亮的地图,却答不出哪个文件夹占了多少、分配了多少、里面多少文件、什么类型占主导。社区里有人指出,区分分配空间和文件大小这个细节是多数工具漏掉的,对抓稀疏文件很有用。但有个未答复的问题:它会不会主动标记像 Xcode 和 Flutter 那样的常见开发目录,还是纯按大小排序、你还是得自己知道要找什么。开发者这边正在征集同时管 Mac、云账号和远程服务器用户的反馈,问问下一步想加哪些功能。
林岚: 先说 Workflo,一个刚在 Product Hunt 上线的 macOS 菜单栏工具,定位很直接:在你开口之前,先把工作区准备好。它的逻辑是跟着日历、时钟和显示器变化走,比如快开会了、该专注了、或者拔插了显示器,它就自动把窗口打开并排好,切换显示器时大概一秒内恢复你之前的布局。创始人的出发点,其实是每天开会、专注、插拔显示器之后都要手动重建窗口布局这点小损耗。
陈序: 有意思的是它的对比点——其他工具只是让整理变快,但还是得等人去按一下,Workflo 是主动触发。而且触发前有个可取消的倒计时,用户能不能决,主动权还留在你手里。隐私上也刻意做了区分:它只申请辅助功能权限,不申请屏幕录制,所以从结构上就读不到屏幕内容。官方说不收集、不记录、不传输设备数据,没有账号、没有云端,设置存在本地,日历权限也是在你真的加日历触发器时才问。
林岚: 能力上包括按显示器记忆每一套布局、把某个场景一起开齐应用或隐藏不需要的窗口、一键隐藏全部窗口再一键恢复,还有忽略或始终恢复窗口大小的规则。定价是一次性买断,发布周有折扣,支持原生 Swift 写的。不过要留意,网页上引用的那些用户反馈都是作者自己列出来的“自我报告”,比如有人自称站会前两分钟窗口会自动排好,这类没有独立验证。
陈序: 社区里最具体的追问来自一位做浏览器自动化的用户。他同时开着好几个 Chrome 配置文件,得先搞清楚哪个窗口登录了正确的账号,然后他问 Workflo 能不能把特定浏览器配置文件的窗口固定到指定位置,还是说它只处理布局、不识别窗口身份。这算是目前最值得跟进的边界问题了。作者也在帖子里收集“最让你头疼的上下文切换”,说会送几个免费许可证给最能塑造路线图的反馈者。
陈序: 下一个是 AgentConnect,今天在 Product Hunt 发布,一个开源、可自托管的平台,让团队在 Slack、Telegram、Discord 和 GitHub 这些地方跟 AI 代理一起协作。它同时支持 Claude Code、Codex、Grok Build、DeepSeek、Pi 以及任何兼容 ACP 标准的运行时,可以为每个代理配置角色、模型、工作区、记忆、工具、技能和权限。工作可以从对话、PR、issue、webhook 或定时任务启动,代理之间可以互相调用,团队在一个控制台里查看被允许看到的工作。
林岚: 它抓的痛点挺具体:多数人各自在终端里跑 Claude Code 或 Codex,代理承担了报错分诊、PR 审查这些活之后,有点像真队友了,但别人看不到这些会话,也没法接管或复用上下文。现有的方案要么是只有个人、没有团队模型的工具,要么要求你迁到一个全新的聊天应用里,要么绑死单一供应商。所以它们选了开源、供应商中立、完全自托管,号称“代理跑在你们机器上,我们永远看不到你们的代码或消息”。
陈序: 社区里有人点出,可见性和审批是真正的痛点——如果控制台真能显示每个代理被允许看到什么,就解决大问题了。也有人认可“运行时无关”这点,能混用 DeepSeek 和 Claude Code,降低押注单一模型供应商的风险。不过还有几个没解决的开问题:代理会不会互相回复、聊得收不了尾;各平台的 OAuth 接入是否繁琐;还有当两个会话互相不知道彼此存在时,控制台会不会拦下第二个代理对已认领任务的重复操作,还是只能靠团队自己发现。需要说明的是,这个页面属于产品演示,这些能力还没经过实际验证。
林岚: 再来看 SoloUno,一款针对“身体聚焦重复行为”的自我管理工具,覆盖拔头发、抠皮肤和咬指甲这类习惯。创始人自己就是多年受拔毛癖困扰的人,他之前靠戒瘾应用成功戒了烟,本想照搬同样的思路,结果发现拔毛癖这类问题按诊断标准很难“一刀切”地戒断,而那些围绕“再也不做”这个目标设计的应用,会让每一次失误都像一次失败。所以 SoloUno 反其道而行,改成主打每日小胜。
陈序: 具体来说,早上检查无习惯连续记录、每一小时不发作就能拿一个奖励、随时记录习惯行为、做诱因分析,冲动来的当下还能启动一段短时正念引导来接纳这个冲动,晚上九点做总结。设计上它声称受习惯逆转训练、认知行为疗法和接纳承诺疗法启发,主打“不羞耻、稳步进步”,也可以当作治疗之外的自助补充。提供两周免费试用。
林岚: 社区讨论基本以个人自述为主,有人称帮自己好几个月不咬指甲,有人说戒掉了三十多年的习惯,还有人说觉察提升之后从控制做到了完全停止。有评论者提到拔头发时“不会感到挫败或失败,只是继续旅程”,也有人说欣赏“不求完美、只求每日小进步”的做法——因为全有或全无的连续记录,恰恰是这类习惯应用常见的一个失败点。当然这些数字都是未经独立验证的自我报告。还有个没澄清的开放问题:那个冲动接纳会话,是在冲动当下引导你做,还是事后记录反思?每日的“小胜”到底算觉察记录,还是更具体的行为?
陈序: 最后一个产品是 Macrobite,一款主打“快速且准确”的宏量营养素记录应用。你拍一张餐食照片,几秒内就能得到热量、蛋白质、碳水化合物和脂肪的分解;第一次识别不准,可以直接快速编辑修正,不用翻庞大的食物数据库。除了拍照,它还支持语音记录、条码扫描,以及保存常吃的餐食一键复用。每日摄入量可以直接显示在 iPhone 小组件和 Apple Watch 上,不用打开 App。
林岚: 它面向的是那些曾经用又放弃过记录工具的人。团队顾问在帖子里说,多数追踪器要么照片记录不错、但靠繁琐菜单修正错误,要么手动录入准确却太慢,两边都很难支撑“每天达标蛋白质目标”这件事。Macrobite 想用“拍照即时拆分加快速修正”来消除这个摩擦。顾问还说特别想知道人们放弃旧工具的原因,来验证这个产品是不是真的解决痛点。
陈序: 规划里的功能还包括根据剩余的宏量目标生成个性化餐食和产品推荐,能直接通过 Instacart 下单,但还没上线,开发者说这次发布只是开始。需要留意的是,目前能看到的证据都来自产品方和顾问,没有独立的用户体验,也还没公布定价。首次识别的准确率、语音和条码对复杂餐食的覆盖范围,还有那头 Instacart 集成到底能不能用,都还是待验证的问题。对想记录每餐的人,可以盯一下这些后续会不会有真正用过的用户反馈。
林岚: 今天重点聊的是 ScrapeOps 在 Product Hunt 上发布的 Proxy Tester,一个大白话叫代理基准测试的平台。简单说,它面向开发者、抓取团队、数据供应商,还有做 SaaS 和 AI 的厂商,专门用来横向对比 Oxylabs、BrightData、NetNut 这些二十多家代理供应商的表现,覆盖住宅、数据中心、移动代理这些配置。你只要提交一个目标网址,它就会针对这个具体网站来测各家供应商的真实成功率、延迟、可靠性和成本,最后生成一份按你这个用例排名的报告,而不是照抄厂商自己的宣传数据。
陈序: 据官方介绍,这份报告是免费的,不用信用卡,测完通过邮件发给你。而且它特别处理了一个很常见的问题:所谓测试通过,到底是真的返回了有效页面,还是被反爬系统拦住了只给你看一个封禁页。平台会去校验这个,把这种假阳性对成功率和价格的影响也算进统计里。成功率就是返回有效响应、没被封禁或弹验证码的请求占比;成本按每百万页的抓取量来计算。
林岚: 为什么会有这个工具呢?发布方 ScrapeOps 的 Ian 在评论区解释,过去老被开发者问同一个问题——某个网站到底该用哪家代理。但其实不存在通用答案,同一家供应商在不同目标网站上的表现可能差很多。很多团队只能先买额度、手动测试、翻日志比对,折腾好几天才有个结论。Proxy Tester 就是让开发者在掏钱之前,先用自己真实的目标网址来做数据决策。
陈序: 评论区也有人提供了跟官方说法一致的亲身经历。有位评论者说,自己见过同一套配置在某零售网站上表现很好,在另一个网站却被完全拦死,所以按实际目标网址来测,才是正确的衡量单位。还有人指出,Cloudflare 这类反爬系统让多网站的数据采集很有挑战,与其照着通用排名选代理,不如针对具体目标来测更实用。
林岚: 当然,评论区也留了几个还没回答的开放问题。比如它测的是单次抓取,还是持续多请求的会话?因为某些反爬系统会把会话绑定到 IP 上,轮换住宅代理可能单个 GET 请求没问题,但流程走到第三步就挂了。另外,目标网站的防火墙规则频繁更新,六周前看着靠谱的排名现在可能已经失效,报告有没有带时间戳、会不会定期重跑?还有那个价值分,是成功率、延迟、成本按等权算,还是能按具体用例调整?这些问题如果能补上答案,这个工具的价值边界会更清楚。
陈序: 好,今天这一期的内容就到这里了。从 Argos 帮你在浏览器里真正完成任务,到在 4 GB 显存笔记本上微调大模型,再到 Grok 的新一代图像生成器,还有 ArcOS 上的存储分析工具和各类效率小软件,内容还挺丰富的。
林岚: 喜欢的话可以到 Product Hunt 上看看这些发布项目,找到实用的就动手试试。我们下期再见。