0811 | Gutta菜单栏任务、Portfolio Lab负责任投资、SecondBrain硬件笔记、Paritok网关

||Download

Show notes

本期节目集中盘点了一批刚发布、由厂商自述、尚未独立验证的新工具与产品。先是编码领域的两款:Paritok 用本地压缩网关为 AI 编码代理削减 token 成本,号称长会话可省八成以上、同一上下文能跑三倍轮次;Prime Agent 则是一款开源、能自我改进的编码工具,让模型在持久环境里直接改写自己的提示、技能与子代理。接着是两款面向数据的应用:Vidaya 把六十多个来源的健康数据统一成纵向记录并配 AI 教练,oqoqo 则让你用自然语言为自家产品定义智能体任务基准并统计成本与成败。还有 AI 驱动的协作与生产工具:Remix 让非工程师用提示词生成生产应用的安全沙箱副本并一键开 PR;AI Group Call 提供一场可插话的六位 AI 实时语音讨论;Portfolio Lab 在 AI 投资策略上强调先回测审核再连券商执行。最后是一款硬件:SecondBrain Note 是银行卡大小的离线优先 AI 会议录音笔。多款产品都留下了数据治理、沙箱数据来源、评测稳定性等尚未答复的开放问题。

时间轴

  • 00:00:00 开场
  • 00:00:41 Paritok:为编码代理上下文瘦身省 token
  • 00:02:49 Vidaya:把分散健康数据拢成一线的长寿仪表板
  • 00:05:00 Remix:用提示词生成生产应用的安全副本
  • 00:07:10 AI Group Call:可插话的六位 AI 实时语音讨论组
  • 00:09:21 Portfolio Lab:让 AI 投资策略先经审核再碰钱
  • 00:11:29 Gutta:菜单栏里的键盘优先极简任务清单
  • 00:13:26 SecondBrain Note:卡片般轻薄的 AI 会议录音笔
  • 00:15:33 oqoqo:为你的产品定制智能体私测基准
  • 00:17:34 Prime Agent:开源、能自我改进的编码工具

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

林岚: 大家好,我是林岚,欢迎收听 Bri 的 Product Hunt 产品分享。今天这一期,我们想先从一款让我很有共鸣的工具聊起——一款藏在 Mac 菜单栏里的极简任务清单,键盘就能搞定一切。当然,今天还不止这一件有意思的事。

陈序: 对,我是陈序。这期我们会聊到那款菜单栏任务清单,也会看看一个把 AI 投资说得特别“负责任”的 Portfolio Lab,还有把线下对话变成结构化笔记的硬件设备 SecondBrain Note,以及一个面向 AI 编码代理的压缩网关 Paritok。好,我们开始吧。

林岚: 先说 Paritok 这个工具,它是两位工程师做的,本意是解决用 AI 编码代理时那个很磨人的痛点:会话一长,上下文就不断膨胀,token 账单也跟着往上涨。它的办法是在代理和 API 之间加一层压缩网关,而且可以完全在本地自托管,开源、免费,也支持用 API key。集成起来很简单,设置一个环境变量指向本地端口就行,兼容 Claude Code、Codex、Cursor 这些主流工具。

陈序: 它压缩的对象听起来很实际。AI 编码里最大的一块浪费,其实是代理每一轮都把完整的工具清单、整份文件和调试输出原样重发一遍。Paritok 说能把工具描述从每轮大约两万九千个 token 压到八千,文件读取和工具输出大约只占原来的四分之一,而且是 CPU 上跑的,不用额外调模型。等到上下文预算快满了,还会按你设定的额度自动触发对过期历史的摘要,不是干等模型自己撑爆。

林岚: 那被压缩掉的内容还能找回来吗?它设计了一个恢复机制,需要的时候能从本地精确还原原始字节,而且不额外多烧一轮对话。制造方给出的节省数字很可观,说 token 账单从一开始的百分之二十五降到最后长会话或接近满的状态能省八成五以上,同一个上下文窗口差不多能跑三倍轮数。不过要说明,这些数字都是团队自家声称的,没有独立验证,评论区也确实留下几个没答复的问题,比如省下来的量里工具描述和文件各占多少,还有加这一层每轮会多多少延迟。

陈序: 正面评价集中在这几点:完全本地运行、没有中间的云服务器数据经过,以及大代码库长会话用户确实看中那个三倍轮次的收益。对用量大的人来说,一次会话里能跑的轮数往往比省的钱更值钱。这份是发布方自述,想试的话可以直接本地跑起来用自己的项目验证。

林岚: 下一个产品方向很不一样,叫 Vidaya,是个 AI 长寿仪表板,想把你散落在各处的健康数据拢成一条线。创始人的说法很直接:膳食在 MyFitnessPal,血检结果在 Quest 的 PDF 里,DNA 在 Ancestry,病历在 Epic,步数在 Apple Health,处方在 CVS——没有任何一个应用能告诉他身体到底发生了什么,下一步该做什么。他自己举的例子是,曾经在冬季自行车赛中心率顶在 120,后来量出来是二期高血压,而所有那些应用都没抓住这个趋势。

陈序: 所以它做的就是把这六十多个来源统一成一条纵向的健康记录,里面包含不少医疗级的来源,比如电子病历、临床检验这些。上面挂了一个叫 Vaya 的 AI 教练,能用自然语言跨全部数据提问,比如问停了某种药之后睡眠怎么变。公司说大约八成查询走一秒钟出结果的快路径,复杂的临床分析才走引用你实际数据的深度路径。平台自称从第一天起就符合医疗数据的 HIPAA 合规要求。

林岚: 关于 AI 表现,数据科学负责人自报说,Vaya 经过一百多次迭代,针对一套三十二题的健康压力测试做了调优,涵盖实验室趋势、紧急症状、处方请求、幻觉陷阱这些场景,生产环境的审计结果是三十二题全部没有幻觉,紧急和处方类提示的临床安全重定向全部正确。这些测试和审计都是公司自述,不是独立验证过的。

陈序: 这产品留下的开放问题其实更关乎信任。你把这些高度敏感的数据聚到一起之后,数据归谁管,会不会被拿去卖、做广告定向或者训练模型?我在发布后的评论里看到有人在问,但没有看到官方答复。定价和可用性目前也没公布。所以站在用户角度,功能听上去很完整,但数据治理和能不能自己掌控,是往下走之前更该想清楚的部分。

林岚: 接下来这个叫 Remix,官方定位很直白:Figma,但是用在你的生产应用上。意思是任何团队成员都能对着真实产品生成一个安全的沙箱化副本,用描述需求的方式去改,不用自己搭环境,也不会碰生产环境。对于设计师、产品经理、客服这类人特别合适——他们往往一眼就能看出该改哪儿,却被卡在不能直接动手写代码。发布方的核心问题是,这些人发现问题后,常常要等好几周的工程排期,甚至永远等不到。

陈序: 整个流程是,改动可以并排对比,两个变体还能拖到一起合并;想法成熟后直接向 GitHub 开一个 PR,每一步提示都会被记录下来,评审的人能看到整个构建过程,还能通过实时链接在代码进主线之前先测一遍。发布方还说,每个版本都有独立沙箱和实时预览,放出之前会对照设计系统、安全和合规规则做检查。这样一来,工程师的角色就上移到架构和审批,看提示、评审干净的 PR、保留最终决定权。

林岚: 他们给的唯一落地案例也出自发布方自己:一个早期团队的设计师重做了应用的空状态页面,那个任务在 backlog 里躺了好几个月,她靠提示和预览当天就经过正常 PR 审查上线了。评论区里有人夸这个流程把想法快进到生产、同时让工程师在 PR 落地前看到全过程,但另一个用户问了个关键问题,还没看到官方答复——打开真实产品实时副本的时候,沙箱里跑的是生产数据快照、预先装好的 fixtures,还是合成数据?这个会直接影响安全边界。

陈序: 数据是哪个版本,用户能不能看得见真实库存和真实账号信息,决定了内部协作的安全底线。以上这些都来自发布方自述,还没有独立验证。官方现在的姿态是跟早期团队密切合作、收集反馈,核心其实是在问:还有哪些产品改动,会因为发现者自己不能构建,而长期卡在那里。

林岚: 最后这个产品把想法说得很有画面感,叫 AI Group Call。它的用法是,你输入一个目标,几秒后就进入一场跟六位 AI 参与者的实时语音通话。参与者是按你那个目标来"选角"的,每个人都有名字、角色和性格,比如主持、风险投资里的怀疑派、策略师、运营负责人、研究者和扮演最终拍板客户的角色。

陈序: 制造方自称做这个东西,是因为单个聊天机器人给不了"会议室"——需要有怀疑者来戳穿方案,有策略师来重新架构,还有人扮演那个下最终决定的客户。六个 AI 轮流发言、互相争论,你一开口,它们就立刻让位。他说这最难实现的地方在于,手机扬声器场景下麦克风会同时听到智能体的声音,所以要靠大量的回声处理和原始的语音检测,才能让打断像真通话,而不是像对讲机那样你一句我一句。

林岚: 每通电话都有转录,能一键总结成要点和行动项,之后还能用同一班底重新加入。通话中随便点一个智能体,就能改它的名字、角色和性格。价格方面,Android 今天上线,iOS 已经开发完、在等审核;每个新账户免费一分钟,之后按月度分钟套餐收费,起步四块九毛九美元,通电话里没有真人,全部是 AI。

陈序: 社区讨论主要压在技术上。有评论说,那个插话回声问题是语音领域真正难的地方,追问回声消除是在设备端还是服务器端对混合流做打断检测。还有人问它用的什么编排框架,有没有技术文章,这些都没看到制造方回应。这些能力和节省数字都属于声称,不是验证过的结果。开放的问题还在:iOS 具体什么时候上、底层怎么编排、实际通话质量到底如何。制造方的姿态是邀请用户抛一些意外的目标,看这套班底哪里会站不住脚,说会读每一条评论。

林岚: 先说 Portfolio Lab。它的官方定位是“AI 投资,但以负责任的方式做”。创办人 Rich Sun 说,团队一开始让 Claude 生成了 1292 个投资策略,但即便他本人是有对冲基金经验的专业人士,也要花上好几天逐行去审代码,才发现里面有悄悄美化回测结果的错误;把这些错误修正之后,几乎所有的策略都失去了原本的优势。

陈序: 这其实点出了整件事的核心:很多 AI 生成的策略之所以好看,可能只是回测被做旧了手脚。所以他们特意强调,自己不是又一个套着大模型外壳的包装产品——语言模型只负责读、解释和执行,真正的决策是由他们专有的量化模型来做,背后号称有 7 个 AI 模型、超过 200 个预测因子,以及 35 年以上的市场数据支撑。

林岚: 它的使用流程分三步:先设定你的投资目标,让模型生成多个完整策略;然后在没见过的数据上测试,再用真实价格和成交跑模拟盘;确认之后,可以连接 Claude、ChatGPT 或者任何 MCP 智能体,在你自己的券商账户里进行交易。官方也明确说了,看到的回报率数字全是模拟和假设结果,不代表真实交易。

陈序: 社区里最集中的肯定,就是“没经过验证就不碰真钱”。有人提到,以前直接问 Claude 怎么投资,得到的往往是语气自信但拿不出证据的答案;也有人觉得,执行交给你自己的券商账户,等于去掉了一类经典的中间环节利益冲突。

林岚: 不过还没被回答的开放问题也不少:没有见过的新数据,毕竟是来自真实存在过的市场,那要怎么应对市场制度和规则切换?策略偏离了测试预期时,会不会自动退休?以及模拟盘究竟要跑多久才算足够。有评论者说自己的信任门槛很高,最多只愿意放 100 美元做实验。目前它免费开始、不用绑信用卡,提交之后会邮件通知开放名额,也就是候补等待制。

陈序: 第二款是 Gutta,一个 macOS 菜单栏里的极简任务清单,主打键盘优先。按下快捷键会呼出一个居中的快捷面板,你直接用自然语言输入任务,比如“周五十点半把发票发出去”,按回车就完成了。如果有分号分隔的多条输入,会拆成多个任务;带时间的可以调度本地提醒。

林岚: 制作者在讨论区说,做它的原因是“捕获任务应该只要几秒,而不是把你拖进另一个 App”。而且他强调,自然语言解析、存储、提醒这些,全部留在 Mac 本地上——这和需要账户或者开发者云端的待办工具很不一样。数据默认全部存在本机,可选同步放在你自己选的文件夹里,支持 iCloud Drive,也兼容 Dropbox、OneDrive 这些普通文件夹。

陈序: 同步的边界也说得很具体:每台 Mac 必须手动选一次同步文件夹;如果两台设备离线改同一个列表,按“最近编辑的版本胜出”来处理。有评论者认可它“快速、离线、不挡路”的定位,但也追问冲突处理有没有提示或版本保留——目前文档只回答了谁赢,没说有没有提示。

林岚: 操作上,菜单栏会显示过期、今天、稍后的计数,搜索、完成、删除都不用离开键盘。没有写时间的任务默认归到今天,morning、afternoon、evening 这些词会补默认时间,精确时间优先。提醒的提前量可以从 15 分钟到 2 小时几档里选,也支持整体默认和单条覆盖。它只在有未来提醒需要调度的时候才请求通知权限。

陈序: 需要说明的是,这些功能描述都来自制作者本人,目前没有第三方评测佐证,价格和授权方式也没有公布。是不是符合你的预期,可能还得装上实际用几天才能知道。

陈序: 接下来是 SecondBrain Note,今天这几款里硬件和 AI 组合得最明显的一个——一张银行卡大小的磁吸录音设备,厂商说它能把你线下的对话自动变成结构化、可搜索的笔记。机身很轻,几十克,航空级铝材,内置 4 个麦克风加骨传导振动传感器,官方宣传按住两秒就能连续录音最长 35 小时,还能拾起 5 米外的人声。

林岚: 它的差异化主张是离线优先:录音先在设备端完成,稍后同步时才自动生成摘要和转写。超过两分钟的录音会给出完整转写,支持一键录音和重点标记,再和配套的 SecondBrain、GenMail 这些整合,形成统一的“AI 记忆”。官方称传输加密,也拿到了 SOC 2 和 ISO 27001 的认证——不过这些都是厂商自述,不是第三方验证的结果。

陈序: 适用的是经常开会的人、创业者、研究者和学生,覆盖会议、访谈、讲座、客户电话和语音备忘。价格是目前约 179 美元,随设备每月送 300 分钟免费转写,升级到 Plus 或 Pro 就不限分钟数。

林岚: 社区的追问很有价值。有人觉得离线优先是少见的选择,但担心设备端在同步之前的准确率怎么权衡,4 个麦克风在真实会议室里怎么抑制串扰。也有人称赞骨传导振动传感器适合电话录音,因为很多外置录音机只录到你使用者这一侧的声音,却搞不清它到底是靠骨传导还是直接拾取扬声器。还有人在问,它是自动捕获还是要每次手动按,有没有录音指示灯来对应隐私法律上的顾虑。

陈序: 这些开放问题官方页面都没给出明确回答。倒是有一位自称有腕管综合征的评论者说,语音转文字对他帮助不小。如果你特别在意隐私或者会议里其他人是否知情,可能需要把它拿到真实场景里试过再决定。

林岚: 最后是 oqoqo,一个专门评测 AI 智能体在真实世界任务上表现、并能自定义基准的平台。联合创始人 Haritha 在社区里说,现有的大多数基准都在受控环境里跑,既衡量不了产品能不能被智能体真的发现和使用,也覆盖不了用户真正会做的任务。

陈序: 它的做法是,让你用自然语言定义一个任务,比如“把某数据库集成到我的 Web 应用来存用户注册”,再指定测试对象——SDK、API、命令行工具这些——并定义成功标准,比如“必须设置行级安全”。然后在隔离沙箱里运行任务,逐条记录智能体的工具调用、重试、发现这些轨迹,统计 token 消耗和成本,再按成功标准判定成败。

林岚: 它可以测 Codex、Claude Code、Cursor、GitHub Copilot 这些工具对你自己产品界面的友好程度,也能对 MCP、命令行、SDK 这些做回归测试。基础设施是全托管在云端,你自带模型密钥,可以从 CI 里触发实验,提供网页、命令行和 MCP 几种接入方式。

陈序: 社区里有人提到一个很实在的风险,叫“评测腐烂”:六个月前写的用例只反映当时的世界,真正该看的其实是从来没失败过的用例占多少比例。还有智能体本身带随机性,评分稳不稳定,以及失败之后的恢复行为——比如权限被拒、凭据过期、跑一半产生副作用,重跑会不会遇到问题。

林岚: 定价没有披露,创使人描述这些更多是主张而不是已验证的结果。但有一类用户应该会心动——做企业 onboarding 智能体的人,他们说自己目前用的都是黑盒,期待能通过命令行自动跑起来,把同一套自定义任务在多个模型之间横向比较。这也是这类平台最能落地的一个用途。

林岚: 生产代码、工具链和运行机制的关系,Prime Agent想换一种玩法。它不是又一个脚本包,而是一个把自己当成可以持续改写对象的编码工具,开源、自我改进,发布时间是今年八月。发布方把它定位成通用编码助手,也强调它既支持开放模型,也支持封闭前沿模型。

陈序: 核心的创意在于,它把整条工具链收进一个持久的编码环境里。过去那些固定调用模式、手工配置的子代理和提示词,都不会随运行自动调整;Prime Agent反其道而行,让模型自己在那套环境里直接改自己的提示、技能、记忆,甚至新增子代理,等于在工作过程中重写自己的脚手架。跨会话的协作,也是通过代理之间的消息来完成。

林岚: 社区给了一个很直观的例子。在Factorio这类游戏实验里,代理先是把失败中学到的东西沉淀成记忆和技能,一步步搭出更好的工厂;后来它发现可以用游戏的后台接口直接生成资源,等于找到了捷径,而且它连那条捷径也一并学会了。评论者认为,带持久环境的自我改进工具链,是开源AI工具里一个相当实质的进展。

陈序: 至于能力数字,发布方称配上Opus 5,它在ARC-AGI-3上达到95.5%,超过所报告的人类专家基线。需要说明的是,这是制造商的声明,不是独立验证的结果,而且产品页在关键说明处被截断,基准协议和人类专家基线的具体定义并不完整。所以值得关注的是这套自我改写的工作方式,至于那个百分比,还是留一点余地。开源意味着可以直接安装来试,默认是一个文本界面,后台守护进程统一管理所有会话,支持进程崩溃后从保存记录恢复。

林岚: 今天的压轴主角是 Gutta,一款藏在 Mac 菜单栏里的极简任务清单,主打键盘优先。按下快捷键唤出居中面板,直接用自然语言输入任务,比如“周五十点半把发票发出去”,就能把时间安排记下,全程不用碰鼠标。

陈序: 除此之外还有 Portfolio Lab、SecondBrain Note 这些值得留意的产品;而真正供应的核心发布,是一款能让你和六位 AI 参与者实时语音通话的智能体。每一款都值得去 Product Hunt 上看看,我们下期再见。