
0719 | GPT-5.6 攻克凸优化30年难题:低悬果实被快速摘走
Show notes
本期节目聚焦 AI 如何加速摘取"低悬的果实":GPT-5.6 用精准提示攻克了凸优化领域一个开放三十年的难题,而 Stack Overflow 问答量自 2017 年持续下滑、2023 年断崖式下跌则直观展现了 AI 对传统知识平台的冲击。监管层面,欧盟禁止销毁未售出服装的法规已正式生效,纽约则开始讨论房东用 AI 图像宣传房产的边界。此外还涉及 Codex 限额重置疑云、Kimi K3 搅动模型经济学、Google DeepMind 生物韧性方案的争议,以及 Claude 原生控制 Mac 与容器方案之间的安全取舍。
时间轴
- 00:00:00 开场
- 00:00:12 GPT-5.6 提示攻克三十年凸优化难题
- 00:02:45 Codex 使用限额重置引发模型对比讨论
- 00:03:47 一张图看懂 AI 时代 Stack Overflow 的衰落
- 00:05:04 欧盟禁止销毁未售出服装和鞋类法规正式生效
- 00:06:07 纽约议员:房东不得暗中使用 AI 图像宣传房产
- 00:07:00 Google DeepMind 与 Isomorphic Labs 联合发布生物韧性方案
- 00:07:59 Kimi K3:搅动大模型经济格局的新开源模型
- 00:08:37 Claude 控制你的 Mac:一份隔离实操指南
- 00:09:50 Qubes OS 安全策略接受学术审视
- 00:10:49 Q3Edit:在浏览器里编辑并试玩《雷神之锤3》地图
- 00:11:32 极客独立建站:每天一分钱,百分百自建
- 00:12:23 Transcribe.cpp:轻量级本地语音转文字模型
- 00:13:12 再见,感谢所有自行车棚:协议设计与法律的困境
- 00:14:20 LG 显示器通过 Windows Update 静默安装软件
相关信息
- GPT-5.6 used a prompt to close a 30-year gap in convex optimization - Bri Hacker News Campaign Feed
- Fable 5 vs. GPT-5.6 Sol on an NP-Hard Problem: Does /goal help? - Bri Hacker News Campaign Feed
- Codex Resets - Bri Hacker News Campaign Feed
- What AI did to stackoverflow in a graph - Bri Hacker News Campaign Feed
- EU ban on destruction of unsold clothes and shoes enters into application - Bri Hacker News Campaign Feed
- Mayor Mamdani Says Landlords Can't Use AI Images to Advertise - Bri Hacker News Campaign Feed
- Our Approach to Bioresilience: Isomorphic Labs and Google DeepMind - Bri Hacker News Campaign Feed
- The Kimi K3 Moment - Bri Hacker News Campaign Feed
- Setting up your spare Mac for Claude Code to control, a step-by-step guide - Bri Hacker News Campaign Feed
- Qubes OS Security in the Public Record - Bri Hacker News Campaign Feed
- Show HN: Q3Edit – Edit and play Quake 3 maps in the browser - Bri Hacker News Campaign Feed
- Hardcore IndieWeb: Run your own website 100% independently for only $0.01/day - Bri Hacker News Campaign Feed
- Transcribe.cpp - Bri Hacker News Campaign Feed
- Goodbye, and Thanks for All the Bikesheds - Bri Hacker News Campaign Feed
- LG monitors silently install software through Windows Update without consent - Bri Hacker News Campaign Feed
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
茉莉: 欢迎收听Bri旗下的播客节目——HackerNews每日沙龙,我是茉莉。
白桦: 我是白桦。今天我们来看看社区里都在聊些什么。
茉莉: Reddit数学社区在讨论一个挺惊人的说法:GPT-5.6通过一个特定提示,攻克了凸优化领域一个开放三十年的难题。评论里有个观点很有意思——这不是说AI创造了什么全新方法,而是表明,只要一个结论能用现有技术拼出来,现代AI就能把它解决掉。
白桦: 也就是说,低悬的果实正在被快速摘走。另外Hacker News上有人在比Claude和Copilot的使用限额谁先重置,Stack Overflow问答量从2017年起持续下滑,2023年降幅还明显加速了。还有欧盟禁止销毁未售出服装的法规已经生效,纽约市那边则在讨论房东用AI生成图像宣传房产的问题。好,我们一个一个来看。
茉莉: Reddit 数学社区最近炸了锅,焦点是一篇帖子,标题直截了当:GPT-5.6 通过一个提示,攻克了凸优化领域一个开放了整整三十年的难题。
白桦: 听起来像是大突破。不过社区里的讨论反而更冷静。有评论特别指出,这个结果并不是在凸几何或优化理论里创造了什么全新的方法,它更像是一个信号。
茉莉: 什么信号呢?就是说,如果一个结论用现有技术本来就能达到,那现代 AI 就可以把它解决掉。换句话说,低悬甚至中等悬而未决的果实,以后可能就不值得人类研究者去费心了。
白桦: 这个判断挺重的。顺着它往下推,人类仍然会被需要,但只限于那些真正需要全新方法的问题。有人把这称作引发未来核心争论的"新的大问题"。
茉莉: 同一轮讨论里还有另一篇深度评测,把 Fable 5 和 GPT-5.6 Sol 放在一个 NP 难问题上对比,重点分析 /goal 指令到底有没有用。
白桦: 评测的图表还闹了个小插曲。Y 轴标着"数值越小越好",但视觉上高低方向让一些读者觉得困惑,不太直观。
茉莉: 不过数据之外,用户反馈更值得注意。有用户说,/goal 已经取代了之前的计划模式,现在占到他 AI 工作流的 95%。
白桦: 具体怎么用呢?先让模型理解某个特征的细节,一旦发现总结有遗漏,就不断重复确认,直到全面掌握为止。听上去像是一个迭代对齐的过程。
茉莉: 我们再看看另一边的讨论,关于 Codex 的使用限额重置。用户 yewenjie 在 Hacker News 上提问,说 Claude 是不是也在做类似的事情,因为他注意到 Fable 的使用限额比预期更早重置了。
白桦: 用户 zwily 回复说,Claude 确实有过一次,但据他所知仅此而已,远远不能跟 Codex 那边的情况比。
茉莉: PacificSpecific 补充了更具体的体验。他在个人 Pro 计划上遇到过类似现象,运行 usage 命令的时候,系统显示重置时间是明天,而不是立刻切断。
白桦: 更有意思的是他描述的感觉:Anthropic 好像多次宣布即将切断服务,但又一再延长,甚至可能重置了限额。不过他自己也说了,不能完全确定。
茉莉: 用户 rovr138 还提供了一个线索,说他们昨天曾因故允许 Fable 获得额外用量,猜测团队正在为此做什么准备。整体来看,这些现象似乎指向某种后台调整。
白桦: 沿着 Hacker News 的讨论继续看,有一张图把 AI 对 Stack Overflow 的冲击直观地摆了出来。问题是,这个下滑趋势到底从什么时候开始的?
茉莉: 用户 hbcdbff 指出,曲线里可以明显看到新冠疫情的影响。但 mid-kid 马上补充,除了新冠,下滑趋势其实在那之前就已经存在了。
白桦: 关键节点在 2023 年。zh3 发现这一年的降幅显著加速,推测是 AI 工具助推导致的。Stack Overflow 的问题和回答数量从 2017 年就开始持续下滑,但 2023 年明显是个拐点。
茉莉: 那如果没有 AI 呢?dumberquestions 提出了一个有意思的反事实:他认为,就算没有 AI 介入,原来的趋势也未必会自然延续到同一个终点。
白桦: hilariously 的看法更根本。他说,早在 GPT 这类模型出现之前,Stack Overflow 就已经在走向衰落了。根源部分内嵌在它成为编程信息权威来源的初始设计里。
茉莉: 对,社区氛围的负面评价虽然经常被提起,也有道理,但 hilariously 觉得更根本的原因可能还在别处。这张图引发的讨论,其实是在追问一个平台从底层设计上能走多远。
白桦: 最后一件事发生在监管领域。欧盟禁止销毁未售出服装和鞋类的法规已经正式生效了,具体是在《可持续产品生态设计法规》框架下,由一项授权法案来执行的。
茉莉: 禁令覆盖全欧盟范围,分阶段推进。大型企业从 2026 年 7 月 17 日起就要遵守,中型企业过渡期到 2030 年 7 月 17 日,小型和微型企业直接豁免。
白桦: 讨论中自然出现了规避的问题。有人担心企业会把未售出商品运到海外去销毁。但评论者 wolvoleo 指出,这类行为同样可以被处罚,杜绝故意工业浪费这件事并不是徒劳的。
茉莉: 不过也有不同声音。graemep 认为,认可目标合理,不代表当前监管就是正确的路径。规则的漏洞和豁免利用,极难完全封堵。
白桦: 这个讨论其实指向一个更深的问题:在环保目标和商业现实之间,监管到底应该画在哪条线上,又能不能真正落地。
白桦: 纽约市议员马姆达尼提出的方向很有意思——房东不得秘密使用人工智能生成的图像来宣传房产。
茉莉: 对,这个立场的核心是透明。用 AI 生成的图没问题,但不能偷偷用,得让看房的人知道。
白桦: 不过 Hacker News 上的讨论把这个话题拉得更远了。有评论说,光管广告不够,应该全面禁止在赌博、约会、招聘这些领域用 AI,说这对社会有利。
茉莉: 这是一个很激进的延伸。但是另一个评论马上抛出一个实际问题——基础的修图算不算 AI?比如调个色彩平衡、拉一下动态范围,这些操作现在很多工具里都嵌了 AI。
白桦: 这确实是个模糊地带。如果连调色都算,那禁令的边界在哪?Hacker News 上的讨论没有给出答案,但把问题的复杂度摊开了。
茉莉: 接下来看 Google DeepMind。他们和 Isomorphic Labs 联合发布了一份叫《Our Approach to Bioresilience》的文件,讲的是 AI 在生物防御领域的应用。
白桦: Hacker News 上的反应两极。有人直言不讳,说 Google 应该先追上 Anthropic 和 OpenAI 的前沿模型,而不是在模型跑不过别人的时候转向 AI 安全和生物防御的宣传。
茉莉: 这个批评挺尖锐的。但另一边也有用户肯定 AI 用于生物防御的价值,觉得这个方向本身没毛病。
白桦: 讨论里还带出一个有意思的判断:很多人认为 Anthropic 是当前最值得关注的前沿模型玩家。虽然它的资源远少于 OpenAI,没有无限算力、也没有最大的用户群,但在 AI 安全方面发出的声音是最多的。
茉莉: 所以焦点不在生物防御这个议题本身,而在谁来做、在什么阶段做。Google 的时机选择被一些人解读为一种战略转移。
白桦: 转到模型本身。最近有一些网站做了 AI 成本计算器的人工分析,提供帕累托前沿视图,让你在模型性能和推理成本之间做取舍。
茉莉: 这很实用。但 Hacker News 上有人担心一个问题:向中国模型发送数据。这个顾虑在社区里反复出现。
白桦: 除了安全顾虑,还有一个关于内容来源的讨论。有人质疑这些分析文章是不是 Kimi K3 或者 Fable 生成的。
茉莉: 但另一些用户判断不像 AI 写的。风格上的争议本身就说明现在辨别内容的难度——人和机器之间的那条线越来越模糊。
白桦: 最后一则,跟 Claude Code 的实操有关。有人发了一篇详细的指南,教你如何把一台备用 Mac 配好,让 Claude 直接控制整台机器,而不是在容器里跑。
茉莉: 作者 ykdojo 一步步写了流程。这跟之前社区里流行的做法不太一样。有个叫 addajones 的用户说,自己是把 Claude Desktop 装在独立的 Mac mini M4 上,用 Dispatch 来控制,问是不是有必要换成这种新方法。
白桦: 另一个用户 hahajk 点出了一个关键区别:Dispatch 和 Cowork 本质上是容器里的 Claude Code,容器的权限限制导致 Cowork 没法下载文件、填写 PDF、甚至阅读 PDF。而原生 Claude Code 直接用 curl 和 wget,这些都不是问题。
茉莉: 还有 _puk 补充说 Cowork 会跟 Git 冲突,操作失败后删不掉锁文件。他的解决方案是在终端跑辅助程序,让 Claude 在指定工作目录操作,然后创建.commit 文件。
白桦: 所以核心取舍是:容器方案更安全但能力受限,原生方案更灵活但风险也更高。社区正在摸索中间的平衡点。
茉莉: 先来看 Qubes OS 安全机制方面的一个公开记录。一位研究者 adg001 发表了一篇论文,梳理了 Qubes OS 开发者长期以来的安全策略。核心发现是什么呢?就是开发者其实严重依赖上游补丁,而不是自己从头写安全代码。
白桦: 这个策略其实挺务实的。adg001 在 Hacker News 上确认了自己的身份,还开了问答帖。社区成员 Topfi 就指出,Qubes 的架构本来就很瘦小,主要利用上游成果其实是符合设计目标的,并不是偷懒。
茉莉: 对,Topfi 还提到了一个有意思的点。他说 Qubes 的隔离架构,潜力不止于安全加固。他曾经受到启发,在专用虚拟机里跑 Microsoft Office 之类的应用。
白桦: 而且他还在考虑重新审视之前做过的一些实验。就是说,这种隔离思路可能催生出一些安全之外的用法,甚至改变日常软件的使用习惯。
茉莉: 下一个是一个让老玩家兴奋的工具。有人在 Hacker News 上展示了 Q3Edit,一个完全在浏览器里运行的《雷神之锤 3》关卡编辑器。
白桦: 这个确实有意思。它提供的是 Radiant 风格的布局,支持 brush 和 patch 编辑、CSG、地形雕刻,还有实体编辑。基本上把桌面端编辑器的核心功能都搬到了浏览器里。
茉莉: 而且它可以打开和保存.map 文件,最酷的是什么呢?它借助 ioquake3 的 WebAssembly 构建,能直接在浏览器里试玩你刚建好的地图。
白桦: 等于说从编辑到测试,整个工作流不用离开浏览器。对想快速上手做地图的人来说,门槛低了很多。
茉莉: 接下来聊聊独立建站的话题。有一篇文章标题就很硬核,叫「Hardcore IndieWeb」,倡导完全独立自建网站,号称每天只要零点零一美元就能运行自己的站点。
白桦: 文章作者的思路是不用 Cloudflare、也不用 GitHub Pages。部分评论者很欣赏这种做法。但也有人提到 Vercel 和 Netlify 这些平台。
茉莉: 有一条评论说得很具体:GitHub Pages 提供免费托管、域名和 SSL,没有账单,而且寿命长。这是对独立建站主张的一个直接反驳。
白桦: 另一条评论则提到了 Cloudflare 在维持盗版网站运行方面的作用,算是从另一个角度讨论平台的角色。还有人说自己就在卧室用树莓派 4 自建站点,写私人分析,完全是自己的基础设施。
茉莉: 最后来看一个叫 Transcribe.cpp 的项目。作者 sebjones 在 Hacker News 上展示了它,并且强调这不是 AI 写的内容,他说文字「来自我的嘴或手指」。
白桦: 这个态度挺鲜明的。评论者 arikrahman 提了一个有意思的组合思路,说把这个工具和当天同样受关注的一个 500KB 的 TTS 模型搭配,就能构成完整的本地推理链路。
茉莉: zuzululu 回复说看过演示,效果令人印象深刻,但音频仍然有机械感。这说明离完全自然还有距离。
白桦: aarvin_roshin 的评论则从趋势来看,他说未来会有更多推理在本地运行,需要降低推理部署的门槛。像 Transcribe.cpp 这样的项目,就让本地推理变得更可信、更容易上手。
茉莉: ACM Queue 上有一篇名为《Goodbye, and Thanks for All the Bikesheds》的文章,它的读者讨论区里有一条评论说得非常直白:要么在技术上保证隐私,要么就别想有隐私。
白桦: 这个论点挺尖锐的。评论者的逻辑是,一旦协议在技术上允许被攻破,很快就会被以法律的名义大规模滥用——而且守法公民会首当其冲。
茉莉: 他举了 Stingrays 设备做例子。这种设备可以模拟基站,无辜的人可能因为站不住脚的借口,就遭到大规模监视。
白桦: 对,这就是他担心的那个链条:技术上留了后门,执法机构就可以用,然后范围不断扩大。
茉莉: 而文章的原作者看法不太一样。他认为技术圈坚持不妥协,反而导致我们失去的隐私超过了必要的限度——等于说,追求完美方案,结果连中间方案都丢了。
白桦: 这两个立场其实代表了一个很真实的困境:一边说技术上绝不能留口子,另一边说现实世界里完全不妥协可能更糟。两边都没有给出一个简单答案。
茉莉: 再来看一个跟用户控制权直接相关的消息。有用户发现 LG 显示器会通过 Windows Update,在未经用户同意的情况下静默安装软件。
白桦: 静默安装,没有任何弹窗提示,而且卸载入口还藏得很深——只在 Microsoft Store 的库里才能找到。有 Windows 11 的用户已经确认了这种行为。
茉莉: 讨论里也指出,这其实不是 LG 一家的问题。雷蛇、罗技、英伟达这些厂商,都有类似的模式,通过驱动包把软件静默捆绑进来。
白桦: 根源在于厂商有这个需求,而且驱动包的架构决定了你很可能没法只装驱动、不装附带软件。等于用户拿到的不是一个选项,而是一个打包好的结果。
茉莉: 好,那今天聊下来,我自己最大的感受其实是这一条——Reddit数学社区在讨论,说GPT-5.6用对了一个提示,就把凸优化领域一个三十年的开放难题给解了。但评论里很多人强调,这不是凭空发明了什么新方法,而是说,如果一个结论本来就能用现有技术推导出来,那现代AI就有能力把它找出来。 换句话说,低悬的果实正在被AI一颗一颗摘走。
白桦: 对,而且这个趋势不止在数学圈。你看Stack Overflow,从2017年开始问答数量一路往下走,Hacker News上有人分析说,2023年降得特别猛,很可能就是开发者直接去问大模型了,不再发帖等回复。
茉莉: 嗯,另一边今天还有个法规也值得关注——欧盟禁止销毁未售出服装和鞋类的禁令已经正式生效了。大企业2026年7月开始必须遵守,中型企业缓到2030年。也就是说,以后品牌不能把卖不掉的新衣服新鞋直接销毁了。
白桦: 好,以上就是今天《科技简报》的全部内容。感谢收听,我们下期再见。