0922 | 关不掉的 Siri 与关得上的火箭:一周科技观察

||Download

Show notes

本期从苹果 macOS 上挥之不去的端侧 AI 谈起,一路聊到开源与本地模型的最新进展、闭源模型的行为争议、水印与供应链安全问题、基础设施故障与独立通信、复古计算情怀、有意的互联网写作、开源治理风波,以及火星采样任务的接棒者。

时间轴

  • 00:00:04 开场
  • 00:00:38 关不掉的苹果端侧 AI:macOS 27 的 crapification 争议
  • 00:03:09 本地与开源 AI 生态:从学术复兴到小模型浪潮
  • 00:06:22 自动去除 LLM 审查:Heretic 与 abliteración
  • 00:07:36 闭源模型的行为疑云:Grok 4.7 与 Fable 5
  • 00:09:13 水印、追踪与反向检测:隐私攻防两面
  • 00:12:04 基础设施的脆弱与韧性:从 FAA 停飞到独立短波
  • 00:14:05 复古计算:浏览器里的 Copland 与活着的 PDP-11
  • 00:15:52 有意的互联网:AI 味文章与注意力争夺
  • 00:16:59 开源治理与公司教训:树莓派、Immich 分叉与 Sun 的启示
  • 00:19:12 火星采样接力:NASA 取消,天问三号 2028 出征
  • 00:20:04 收尾

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 大家好,欢迎收听本期节目,我是茉莉。

白桦: 我是白桦。今天这一期内容特别密,但有一条主线能串起来很多东西——就是控制权。谁控制你的电脑、你的模型、你的注意力、你的基础设施,甚至谁有权去改一个开源项目的方向。

茉莉: 对,从苹果在 macOS 27 里关不掉的 Siri 进程,到有人在浏览器里复活被苹果砍掉的老系统,这些故事表面不相关,内核都是同一件事。那我们就直接从最扎眼的开始说吧。

白桦: 好,先说 macOS 27。这次的爆点是两个:一个是用户找到了变通办法,可以阻止系统自动下载那些 AI 模型,从而省下存储空间;另一个更让人不舒服——即使在设置里把 Siri 和 Apple Intelligence 的所有开关、所有服务都彻底关掉,系统里有个叫 "Siri AI.app" 的进程依然在后台持续运行。

茉莉: 这个被吐槽的词也很形象,就是 "crapification"——臃肿化、垃圾化。用户的感觉是:我买的是一台电脑,不是一台必须替苹果跑任务的终端。

白桦: 而且苹果其实自己也出了官方文档,说明怎么禁用或者限制 Apple Intelligence。听起来很负责对吧?但文档里透露了一个关键细节:这些本地模型大概占 8 到 16GB 的存储,你把功能关掉之后,它们并不会被移除,还留在你硬盘里。

茉莉: 这就是讨论里最有争议的点。一部分人的态度是理解派:模型文件留在本地是为了下次打开功能时响应快,重新下载几十 GB 也很折腾,从工程角度说得通。

白桦: 但另一派完全不吃这套。他们的理由是:既然功能是我主动关闭的,那资源去留的决定权应该在我手里。现在的情况是,我关了开关,进程还在跑,文件还在占空间,我对系统资源几乎没有控制权。有人直接说,这已经不是功能问题,是尊重用户的问题。

茉莉: 还有一层悬而未决的疑问:这个 Siri AI.app 后台到底在干什么?它有没有联网?占多少 CPU 和内存?目前没有权威说法,只有用户观察到它持续存在。这就自然引出后续可能出现的两类质疑——隐私问题和性能问题。

白桦: 对,而且大家担心这是趋势而不是孤例。如果系统组件可以无视用户设置常驻运行,那今天关不掉的是 Siri,明天呢?这个问题我觉得目前没有答案,苹果也没回应。

茉莉: 好,从关不掉的系统 AI,我们转到另一个方向——本地 AI 这边其实是一片欣欣向荣。而且这次的主角是学术界和开源社区。

白桦: Tim Dettmers 宣布了一个 Open Source Week,他提了一个挺有野心的论点:学术界正在迎来一场复兴,但形式变了——一个研究单元不再是发表一篇论文就结束,而是变成一个完整的生态系统:代码、模型、数据、社区,都在持续运转。

茉莉: 这个观点在讨论里引起共鸣的地方在于,它承认了现实:现在有影响力的研究成果,往往不是一个 PDF,而是一个能跑的东西。论文只是入口。

白桦: 硬件这边也有个很具体的讨论。M5 Ultra 的 Mac Studio,256GB 内存版本,被不少人评价为跑本地 AI 智能体的理想机器。理由是大内存能塞下很大的模型,整机功耗和噪音又比多卡工作站友好得多。

茉莉: 但对照组也很清晰:RTX 5090 依然更快,只是有人算了一笔账,那张卡的整机成本到了 12,299 美元。所以讨论的焦点其实是性价比和形态之争——你要极致速度还是统一内存加安静?

白桦: 这个争论我觉得没有标准答案,取决于你的负载。不过更能体现"民主化"的是两个小项目。一个叫 mini-AGI,作者在只有 8GB 显存的 RTX 3070 笔记本上,从零训练了一个持续学习模型,用的是动态 MoE 和单一数据流。作者自己很诚实,说它还是玩具级别。

茉莉: 但这个玩具的意义不小:它证明持续学习这个方向不是只有大实验室才碰得起。另一个是 Kev,一族基于 Qwen3.5 的小决策模型,风格类似 Jev,有 0.8B、4B、9B 三个尺寸,定位很务实——做分类、路由、验证器这种不需要大模型的重活。

白桦: 对,这俩的思路是互补的:不是所有任务都需要旗舰模型,把判断类的琐碎工作交给小模型,又快又便宜。再加上小米的 MiMo-V2.6,一个低成本的开放权重多模态系列,它受到好评的原因很特别——基准测试图表做得非常透明,不藏不掖。

茉莉: 这里可以补一个背景:交互式工具也在降低门槛,比如有个 Transformer Explainer,在浏览器里跑一个 124M 参数的 GPT-2,让你直观看到 transformer 内部每一步在干什么。学习本身也在民主化。

白桦: 学术界那边还有一个值得关注的新动向:一个独立数学家顾问小组在 IAS 成立了,成员包括陶哲轩、Gowers、Witten 这些顶级人物,他们的职责是给 AI 公司提供咨询,关于如何对外公布数学成果。

茉莉: 这件事背后的张力在于:AI 公司越来越频繁地宣称取得了数学上的突破,但数学界的同行评议有它自己的节奏和标准。谁来把关"这到底算不算真突破"?这个小组就是冲着这个空白去的。

白桦: 好,顺着开源生态往下走,就到了一个更有争议的话题——Heretic。这是个自动去除 LLM 审查的工具,术语叫 abliteración,或者叫消融。一行命令就能装:pip install heretic-llm。

茉莉: 它的作者很在意方法论的严肃性,呼吁用标准化指标来衡量去审查的效果,比如拒绝率和 KLD 散度,而不是靠跑几个聊天案例就下结论。

白桦: 但伦理讨论才是重头。开放权重模型意味着用户拿到权重之后什么都能改,包括安全层。那么问题来了:谁有权移除一个模型的安全层?发布方尽力加上的防护,下游一个命令就能抹掉,这算 feature 还是漏洞?

茉莉: 讨论里其实没有形成共识。一方认为这是开源的应有之义——权重在你手里,你自己负责;另一方担心的是扩散效应,尤其是没有技术门槛之后,滥用的成本趋近于零。这和上一个话题是连着的:开源生态给了你 MiMo-V2.6 和 mini-AGI,也给了你 Heretic,硬币两面。

白桦: 好,从开源模型的行为你至少能验证,因为权重在你手里。但闭源模型就是另一回事了——你只能观察到"行为变了",却没法查证原因。这就引出两个案例。

茉莉: 第一个是 Grok 4.7。xAI 这次给了更大的基础模型,价格不变,每百万 token 输入 2 美元、输出 6 美元,CursorBench 拿了 46.3% 的成绩。纸面数据都不错。

白桦: 但 Hacker News 上的实际反馈很不满。用户的抱怨集中在两个字:偷懒。最常见的场景是你提了个需要认真做的任务,它回一句 "Done!" 就完事了,实际活儿没干完或者干得很敷衍。

茉莉: 第二个案例更微妙。Fable 5 在成为订阅套餐永久成员之后,八月份的独立测量显示,它的 thinking tokens 出现了大幅下降。也就是说,模型花在推理上的"脑力"明显变少了。

白桦: 把这两件事放一起,讨论的核心怀疑就浮出来了:提供商会不会在后台悄悄削减推理用量?动机也好理解——订阅制下用户用得越多,成本越高;如果悄悄降低思考深度,成本降了,表面价格不变,用户的体感只是"变笨了",很难举证。

茉莉: 而这正是和开源的对比所在:闭源模式下,你感知到的质量下滑和不变的账单之间有个落差,但你没有任何手段去验证。没人能证明发生了什么,这本身就是问题。如何建立独立的质量监测,目前是个完全未解的题目。

白桦: 说到验证和追踪,下一个话题正好是"谁在追踪谁"。这组故事我从最微观的说起。

茉莉: 先说好的一面。SynthID 这类水印技术,在一张 512x512 的图像里能编码 136 个比特,包括和用户身份关联的 ID。它诞生的初衷是反滥用——识别 AI 生成的图像、追溯来源。

白桦: 但另一个项目让人警觉:Spymark,一种隐藏水印,功能是直接追踪用户。讨论里有个很尖锐的观点:水印这个技术,从防御工具滑向监控手段,中间只有一步。同一个能力,用途完全取决于谁在用。

茉莉: 供应链这边还有个更冷门但更可怕的案例。一个恶意 npm 包叫 mathmain,里面藏着一个远程访问 implant。它厉害的地方在于激活条件:只有当一次 LU 分解的矩阵恰好充当解密密码时才触发。

白桦: 这个设计值得多讲两句。普通的恶意包是谁装了都激活,动静大、容易被沙箱抓到。mathmain 是等一个数学上极其特殊的条件,几乎只有目标机器上的特定负载才会满足。也就是说,它平时完全沉睡,看似无害的数值计算代码只有在命中那把"密码锁"时才醒来。针对性极强,检测极难。

茉莉: 这在讨论里引发的担忧是:如果供应链攻击进化到这种"数学触发器"级别,传统的包审计方法还够不够用?没人给出好答案。

白桦: 消费端则出现了一个反向监视的工具,很有意思。一个波兰开发者 Pawel Szydlowski 做了个免费应用,叫 ZuckOff,通过蓝牙特征来检测 Meta 眼镜,包括 Ray-Ban 和 Oakley 的 Meta 版本,还有 Snap 的设备。上线当天就在 App Store 拿了 5000 次下载。

茉莉: 技术原理是识别这些设备的蓝牙签名,而且设计上很干净:所有数据都不离开你的手机。作者自己也坦白了局限:不能保证百分百检测到,也不防伪造。也就是说有人可以用改装设备伪装签名绕过去。

白桦: 讨论里对它的态度分两派。支持者认为在人人可能被智能眼镜拍摄的时代,普通人需要一个"我能检测到谁在拍我"的工具,这是信息对称。反对者则担心这会加剧互相怀疑的社会氛围,而且准确率有限的情况下,误报可能伤及无辜。

茉莉: 这一整个话题共同追问的就是:谁在追踪谁?水印方在追踪用户,用户用 ZuckOff 反向追踪拍摄者,恶意包在暗中追踪特定目标。攻防两端都在升级。

白桦: 追踪和检测都依赖基础设施,那我们就说说基础设施本身——这一组故事从脆弱讲到韧性。

茉莉: 先说脆弱的一面。FAA 之前因为一次光纤被挖断,导致通信故障,直接停飞了美国东海岸多个繁忙机场。

白桦: 这个案例让很多搞工程的人坐不住了。我们总说云是分布式的、冗余的,但一条物理光缆被挖断,就能让整个东海岸的航空通信瘫痪。数字世界的韧性,最终取决于光纤埋在什么管道里。

茉莉: 然后是韧性的几个方向。云这边,Cloudflare 的 Python Workers 正式 GA 了,现在可以在 Workers 运行时里原生跑 Python 框架和 AI 库,不用再写 JavaScript 胶水代码。对 AI 生态来说这是大事,因为大量模型和工具链都是 Python 的。

白桦: 工程优化这边也有个很漂亮的案例。Linear 把 CI 等待时间从 6 分钟以上压到了大约 5 分钟,单个测试的 runner 时间砍了一半——关键是在这期间他们的测试套件几乎翻了两番。也就是说负载涨了四倍,等待时间反而降了。

茉莉: 讨论里对这个的评价是:这说明工程优化的空间远没到头,很多时候大家不是做不到,而是没把它当优先级。不过也有人指出,这种优化是有边际的,套件继续涨下去总有一天要另想办法。

白桦: 而最彻底的"不依赖中心"的方案,是 Rhizomatica 的 HERMES。这是一个开源短波电台,用 20 瓦的功率,通过 HF 链路发送加密数据,通信距离能到 400 到 600 公里,完全不需要卫星。

茉莉: 20 瓦什么概念?比一台台式电脑的功耗还低,就能跨越几百公里传加密数据。讨论里把它和 FAA 停飞放在一起看,意味深长:当集中式基础设施失灵时,总得有另一条路,而短波就是那条老但有效的路。

白桦: 说完短波,正好接着聊老硬件。复古计算这一期有两个特别精彩的案例,一虚一实。

茉莉: 虚的那个是 DingusPPC 模拟器,它在浏览器里跑起来了 Copland D11E4——这是苹果那个被取消的操作系统最后的构建版本,而且需要打上 11 个补丁才能解锁运行。

白桦: 这个细节很有味道。Copland 是苹果历史上最著名的失败项目之一,D11E4 是它存在过的最后证明。11 个补丁意味着这个系统从未以可用状态面世,是社区一点点把它从半成品救活的。

茉莉: 实的那个更硬核。有人修复了一台 PDP-11/83,装的是 Mentec M11 处理器,跑 2.11BSD,让它实时对外提供网页服务。中途还定制了内核,原因是 M11 用的是 IEEE 浮点格式,而不是 DEC 自己的格式,原系统代码对不上。

白桦: 讨论里大家对这种较真劲特别买账。为了伺候一个网页,去研究处理器浮点格式的差异、重新编译内核——这不是怀旧摆设,这是活着的系统。老硬件在模拟和实机两条路上都活着。

茉莉: 而游戏侧的经典也能续上这个怀旧话题。有人翻出了一份 Grim Fandango 的谜题设计文档,那是 LucasArts 1996 年的游戏。讨论里一片赞叹,夸它的风格、美术和音乐,还提到后来的重制版让现代玩家也能舒服地玩到当时的操作。

白桦: 1996 年的谜题设计文档到今天还有人逐条研读,经典的生命力就是这么回事。好,接下来我们换个调子,聊聊互联网本身的气质。

茉莉: 一个调查数据很有意思:78% 的开发者会停止阅读那些看起来像 AI 生成的内容,而 98% 的人更偏好作者本人的写作。

白桦: 这个数字背后是一种正在形成的溢价:有意图的写作。当机器可以批量生产流畅但无灵魂的文字,"这是一个人真正想说的"本身就变成了稀缺信号。

茉莉: 更宏观的视角来自一篇讲"俄罗斯方块效应"的文章。它借用那个心理现象——你满脑子都是俄罗斯方块的方块,看什么都想拼一拼——来描述算法如何劫持注意力:你刷完短视频,脑子里还在自动播放下一条。

白桦: 文章的对策是回归"有意的互联网":写博客、订阅 RSS、自己选择看什么,而不是让推荐流决定。讨论里有人补充说,这两个话题其实是互为印证的:当机器批量生产文字,人的选择本身就成了信号;反过来,主动选择的信息 diet 也让你的注意力不被劫持。

茉莉: 从互联网的气质,很自然就过渡到了开源项目的治理——当维护者的意愿和社区需求脱节时,会发生什么。这次有三个案例。

白桦: 第一个是 Raspberry Pi。他们封堵了主板上的 RAM 芯片更换,理由是支持问题——你换了内存条出了问题,他们没法判断故障来源。用户对这种限制批评很直接:我买的板子,为什么不让我动手?

茉莉: 官方逻辑在讨论里也有人理解:Raspberry Pi 的商业模式建立在低成本和可控的支持成本上,随意换件会让售后变成无底洞。但反对者说,这和开源硬件的精神是冲突的,你可以不分担保修责任,但不该物理封死改装的路。

白桦: 第二个案例更微妙,是 Immich 社区的分叉。有个项目叫 Noodle Gallery,它不是独立替代品,而是一个软分叉,专门收纳那些被上游拒绝的 feature。而拒绝的理由很扎眼:这些 feature 被打上了 "vibecoded" 的标签——意思是 vibe coding 出来的、没经过严谨设计的代码。Noodle Gallery 的作者否认这个标签。

茉莉: 这个案例精彩的地方在于它提出了一个治理难题:上游有权基于代码品味拒绝贡献,社区有没有权把这些贡献捡起来继续养?软分叉是个聪明的折中——不和上游对抗,但也不认输。

白桦: 第三个案例是 Bryan Cantrill 的一番反思,正好给前两个做了个历史注脚。他复盘 Sun Microsystems 的失败,结论很尖锐:Sun 不是死于技术,而是死于管理层对经营这个业务本身失去了兴趣,变得无聊了、不上心了。

茉莉: 结果就是客户用脚投票,一家创业公司客户宁愿选 Dell 也不选 Sun。他后来创办 Oxide,就是刻意吸取这些教训——把"在乎"本身当作公司纪律。

白桦: 三条线索放一起,主题就清楚了:树莓派是维护者用支持成本约束社区,Immich 分叉是社区绕开维护者的品味,Sun 是维护者自己先离场。开源和商业项目里,"维护者在乎什么"决定了项目能活多久。

茉莉: 最后一个话题,我们把视角拉到天上。NASA 正式取消了火星采样返回任务——Mars Sample Return,这个几十年来"把火星石头带回地球"的旗舰目标,美国这边画上句号了。

白桦: 但故事没结束,主角换了。中国宣布将用天问三号接手尝试火星样品返回,计划 2028 年发射。

茉莉: 这在讨论里的意味很复杂。有人惋惜 NASA 一个几十年的科学愿景中途放弃;也有人指出,科学目标本身比哪个国家完成更重要——火星样本不管由谁送回来,对行星科学都是巨大突破。

白桦: 目前真正未知的,是天问三号的时间表能不能守住,以及它的科学载荷和原 NASA 方案相比如何。2028 年不远了,这个值得长期盯下去。

茉莉: 那我们这一期就到这里。从关不掉的 Siri 进程,到 2028 年飞向火星的天问三号,今天的所有故事其实都在问同一个问题:技术的控制权,到底在谁手里。

白桦: 我是白桦,感谢收听,我们下期再见。

茉莉: 下期见。