跳到主要内容

Agili 的 Hacker Podcast 2026-07-28

地震、新型疫苗研究、AI 编码基准测试、以及一杯茶的微生物学实验——今日话题涵盖了从自然灾害到日常生活的广泛领域。我是 Agili 的 Hacker Podcast,每日为你梳理黑客社区的热议与新知。

日本熊本县发生 7.1 级地震

与 2016 年地震位置相近,多地记录到最高震度

7 月 28 日下午,日本熊本县南部发生 7.1 级地震。日本气象厅的震度(shindo,反映某地点实际摇晃程度的指标)数据显示,宇城市等多个地区达到最高等级震度 7。这个指标比里氏级数更能直接反映破坏程度。

基础设施受损、火灾与人员伤亡

地震导致广泛破坏。NHK 画面显示日本造纸厂烟囱倒塌、高速公路桥梁路面断开和桥面坠落、道路开裂,以及多处火灾。熊本县一家 Aeon 购物中心屋顶坍塌——该商场在 2016 年地震受损后重新开业时曾声称加强了防灾设计。据 NHK 报道和车内摄像头视频,地震后商场疑似发生燃气泄漏,二层美食区随后发生爆炸,造成多人死亡。熊本城的石墙再次受损。

地震后数小时统计显示:至少 50 人因伤住院、9 人失踪、12 栋房屋倒塌、4 人被困、7 处起火。约 46,000 户家庭停电,依赖空调和医疗设备的老年人尤受影响。GPS 基准站数据显示地面位移最大达 84 厘米。TSMC、索尼、富士胶片等附近半导体和材料工厂已疏散人员,但未报告设备损坏。三座附近核电站未检测到异常。

灾后安置与长期挑战

熊本县在 2016 年地震后尚未完全修复,许多旧建筑和木结构房屋在此次地震中再次受损。因紧急避难所建筑安全未确认,政府开放停车场让民众在车内过夜,同时提醒避免长时间睡在狭小空间导致“经济舱综合征”。许多当地用户通过 NERV 应用(源自《新世纪福音战士》的实时灾害信息服务)和 NHK World English 直播获取信息。熊本所在的九州地区近年人口外流严重,此次灾害可能进一步加速小城市和农村地区的空心化。

新型 HIV 疫苗在临床前研究中取得突破

一种全新的免疫训练策略

La Jolla 免疫研究所、Scripps 研究所和 IAVI 的科学家开发出一种新型 HIV 疫苗,在恒河猴中首次引发大量“广谱中和”抗体。研究发表在 Nature 上,团队负责人 Shane Crotty 将其比作阿波罗计划级别。人类试验已经启动。

HIV 用糖分子伪装自己、快速变异,感染后还会改变形状。免疫系统的 B 细胞需要不断调整才能制造有效抗体,但 HIV 从不给 B 细胞足够时间。罕见情况下,一小部分感染者体内确实产生了能识别病毒关键结构的广谱中和抗体。疫苗的目标就是让普通人也能批量制造这类抗体。

“种系靶向”:分步骤教育 B 细胞

实现路径叫“种系靶向”。团队先分析那些高效抗体的 B 细胞从什么状态一步步成熟,然后反向设计疫苗。这不是一针,而是一系列循序渐进的注射:第一针“启动”幼稚 B 细胞,后续“引导”加强针一步步诱导 B 细胞朝正确方向突变。有评论者解释:你体内可能有 100 万个 B 细胞攻击病毒伪造的诱饵,只有一个攻击真正关键的结构。系列疫苗要做的事,就是让那个“百万分之一”的细胞获得晋升机会。

在恒河猴中,约 44% 的动物血液中产生了高水平广谱中和抗体。团队还发现这些抗体在分子上与罕见人类感染者体内的抗体高度相似,所以科学家相信在人类身上可能更有效。

疫苗在 PrEP 时代的角色

许多 HN 评论指出,现有工具如 PrEP(暴露前预防)——尤其是每半年注射一次的 lenacapavir——已极好地阻断 HIV 传播,因此疫苗并非“必要”。但多位评论者强调关键区别:PrEP 需要持续依从、经济条件和医疗可及性;而一次性或几次注射的疫苗可以大幅降低门槛。对贫困地区、教育不足的人群,以及难以坚持日常服药的人来说,疫苗有巨大的杠杆优势。另一个观点是,即使效果不是 100%,只要降低群体传播速度,就有方向性意义。也有谨慎声音:临床前研究距离人体应用还很远,过去太多 HIV 疫苗都在临床试验早期失败。

Opus 5 在长期编码基准上表现如何

SlopCodeBench 的渐进式需求测试

SlopCodeBench 是 2026 年 3 月发布的长期编码基准,来自 UW Madison 的 @GOrlanski 团队。与传统基准不同,每个挑战包含多个检查点,模型开始时不知道全部需求,需随着新需求逐步披露来演化代码库。作者 dexhorthy 用三个 Claude 模型(Opus 4.8、Sonnet 5 和 Opus 5)跑了 17 个检查点的子集,每个检查点用新上下文窗口,按 strict pass 标准计分——所有从之前检查点继承的回归测试也必须通过。

Opus 5 通过了 4 个检查点(24%),而原始论文中 Opus 4.6 的 strict pass 率是 17%,GPT-5.4 是 11%。Opus 4.8 和 Sonnet 5 各只通过 1 个(6%)。所有模型都没能走到任一问题的终点——连标为“easy”的问题也失败。作者认为,对分步骤迭代的真实软件工程工作,今天的模型还不能无监督运行。

代码质量指标与“slop”

Opus 5 写出的函数数量是 Opus 4.8 的五倍,但其中只有 15% 是单次调用,而 Opus 4.8 和 Sonnet 5 的单次调用比例分别达 49% 和 72%。几乎所有模型生成的代码都触发了基准的“slop 规则”:Opus 4.8 平均 98% 的行被标记,Opus 5 是 93%,Sonnet 5 是 89%。作者将自己 TypeScript monorepo 的生产代码与 Opus 5 无监督生成的代码对比,发现后者每千行的 slop 触发数是前者的 11-12 倍。

社区反馈中,多位用户印证 Opus 5 的提升有限,有人已切换回 Fable 或 Codex Sol。也有人认为 SlopCodeBench 的优势在于模型必须处理自己累积的垃圾代码才能获得功能奖励,而多数模型的代码复杂度与缺乏重构冲动有关,可通过周期性“重构轮次”缓解。

500 美元的强化学习微调让小模型超越前沿模型

电商目录审查上的显著差距

一家公司用 500 美元的 GPU 费用,对 9B 参数的开源模型进行 GRPO 强化学习微调,在电商目录审查任务上取得 87.3% 的质量分数,而最优前沿模型配置只有 76.9%。该微调模型每处理 1000 条商品条目的成本是 0.50 美元,最便宜的前沿模型是 19 美元,最贵的 172 美元——成本差距在 40 倍到 340 倍。按每天约 4000 万次决策的规模计算,使用前沿模型每年花费约 5 亿美元,微调专用模型只需约 700 万美元。

文章认为这是一个反复出现的模式:用开源模型、专有任务数据和强化学习,可在高频、可验证的任务上碾压通用前沿模型。Shopify、Bridgewater、Harvey、Intercom 等公司都有类似实践。

隐性成本与适用边界

社区讨论指出,500 美元训练费只是冰山一角。文章所用的 17.7 万条标注数据是从 Amazon Berkeley Objects 数据集合成的,而非来自真实业务日志。一位有实践经验的读者说,在拥有一份干净、可评估的专用数据集之前,工程、标注、质量监控投入可能远超直接调用前沿 API 的成本。

关于适用场景,一个 2×2 决策矩阵(横轴任务频率,纵轴结果是否可验证)指出:只有右下角(高频 + 可验证)才值得微调。微调模型在通用能力上无法与前沿模型相比——前沿模型能解决开放式问题、做出新发现,这是小模型做不到的。有评论总结:“如果总工作量只有 1000 条,质量要求 70%,为什么不直接花 19 美元调 Gemini API,而要花 500 美元加一堆时间做微调?”

用沸水泡“益生菌”茶,细菌还活着吗

一个实验推翻的假设

微生物学博士生 Jane Cook 买了一盒标着“含益生菌”的 Bigelow 柠檬姜茶,泡出来味道很差,像煮过的细菌水。她好奇:用沸水泡茶,细菌还能活着吗?她的导师也觉得“难喝”,两人便用标准微生物学方法检验。

这种益生菌叫 BC30(Bacillus coagulans GBI-30, 6086),是一种孢子形成菌。Cook 准备了三种泡法:4 分钟沸水、15 分钟沸水、冷水。茶汤和茶包内容物分别涂在培养基上,37°C 培养两天。结果所有平板都长出了菌落,包括沸水泡过的茶——每毫升约 1.4 万菌落单位(CFU),比冷水组的 2700 CFU 还多。PCR 确认这些就是 BC30。

BC30 的孢子可抵抗高温、辐射和化学消毒剂。工业上生产时,先让细菌大量繁殖,再让它饿到产生孢子,用酶杀死未形成孢子的细胞,最后——充满讽刺地——进行巴氏杀菌,杀死所有非孢子态微生物。

临床剂量与实际摄入量的差距

一杯标准泡法的茶大约提供 3 万 CFU。而 BC30 官网引用的人体试验,每天剂量是 10 亿 CFU。也就是说,一杯茶的活菌量只有临床剂量的 0.003%。而且那些试验本身也存在问题——比如 IBS 研究里,安慰剂组的腹痛基线比治疗组高 12.5% 和 30%。目前科学界对孢子能否在肠道中存活并发挥益生作用仍有争议。

Cook 用这篇文章展示了一个科学家如何用简单实验推翻假设,也提醒读者:益生菌产品背后的证据常常很弱,而消费者为此支付了更高价格。

苹果的车辆运动提示功能如何帮助减少晕车

用动画点同步视觉与内耳感知

苹果在 iOS 18 中加入车辆运动提示(Vehicle Motion Cues)功能,通过在屏幕边缘显示与车辆运动同步的动画点,来减少视觉与内耳感受之间的冲突。用户可以手动开启,或设置为自动检测。iOS 26 版本允许自定义图案、颜色和点的大小。

许多社区用户证实有效。一位用户说,以前在优步上看屏幕就会恶心,现在完全没问题;他的妻子原本几乎无法在车里看屏幕,现在可以正常工作。也有人表示,虽不能完全消除晕车,但能把“立刻想吐”延长到 30-40 分钟。少数用户反馈效果有限,比如白色点在浅色背景下看不清。

为什么姗姗来迟,以及跨平台生态

有读者指出,晕车机制早已明确,手机内部也有加速度计和陀螺仪,逻辑上并不复杂。但在大公司里,同时熟悉传感器 API、系统级覆盖、又亲身受晕车困扰的开发人员,加上合适的推动力,这种组合并不常见。该功能最初在 2024 年 5 月作为辅助功能推出。

Android 端有 KineStop 和开源 MotionSickness(F-droid 可下载)等类似方案。一些国产 Android 手机(Vivo、Honor)也在系统层面加入类似功能。MacBook 上同样有该功能,有人靠它在出租车后座工作也不晕。有读者希望在 CarPlay 或特斯拉后排屏幕中集成,还有人在渡轮上测试也有缓解作用。

Kimi Linear:混合线性注意力架构的新进展

KDA 在短上下文、长上下文和 RL 扩展中都超越全注意力

Moonshot AI 发布 Kimi Linear 混合线性注意力架构,核心是 Kimi Delta Attention (KDA)。论文声称在公平比较中首次全面超越全注意力架构。KDA 在 Gated DeltaNet 基础上引入更细粒度的门控机制,使模型更有效地利用有限的 RNN 内存。团队基于 KDA 和 Multi-Head Latent Attention 的逐层混合,预训练了一个激活参数 3B、总参数 48B 的模型,使用相同训练配方,在所有评测任务上以明显幅度超越全 MLA,同时将 KV 缓存使用量降低最多 75%,在 100 万上下文下实现最高 6 倍的解码吞吐量。模型权重已开源。

架构演进与社区讨论

有评论指出 KDA 系列实际是 LSTM/RNN 思路的现代版本:从线性注意力加入衰减项得到 Mamba2,再修改衰减项得到 DeltaNet,加入输出门得到 Gated DeltaNet,KDA 则进一步增加了更富有表现力的门控。这被看作是用类似的基本构件组装出逐渐复杂的模块。

关于蒸馏的争论也有所涉及:有观点认为 Kimi 的成功仅靠蒸馏 Claude 模型,反驳者指出 Fable 发布与 Kimi K3 发布仅隔两周,蒸馏如此庞大模型几乎不可能。后续 Kimi K3 模型(2025 年 7 月)的架构报告显示,其 93 层中包含 69 层 KDA,但并非完全相同架构。K3 的核心贡献还在于 Stable LatentMoE 和大量 RL 工作。整体看,Kimi Linear 代表了中国 AI 实验室在注意力架构创新上的进展,开源姿态获得社区认可。

使用开源模型的感受:出奇地好

断开连接的自由感

Modal 员工 Matthew Saltz 最近把 opencode 连到自己的 Modal 推理端点上,用了公司刚推出的 Kimi K3 模型。他的第一反应是“出奇地好”——数据从笔记本直接到端点再回来,断开了和其他供应商的连接。他形容这种感觉像在大型编辑器里泡久了后打开 vim,一片干净的空白。文章披露了他与 Modal 的关系,评论区有人直言是广告,但也有读者认为感情真实。

实际用法与硬件门槛

社区讨论集中于实用用法:wps 指出,Claude Code 擅长把模糊提示变几千行代码,但那不是软件开发的方式。用开放模型做小范围、精准的函数改动,效果一样好。Gigachad 花 15 美元充一次 OpenRouter 用了很久,因为他一次只改一小块,用正确的术语描述改动。有用户通过 AllRouter 等工具,把 Claude Code 的 agent 框架配给开放模型用,效果不错。

硬件门槛仍是现实问题。自建一台能跑好模型的机器成本超过 5000 美元,且电费不低。但 irishcoffee 认为,用任意旧硬件跑一个小模型就足够开始“玩”,不必追求前沿——很多人在 15 年前也是这样折腾 Linux 和 Gentoo 的。整体感受是:开放模型在快速迭代中越来越接近前沿,差距在缩小,足够应付日常编程。而真正让人感到好的,是不再被绑定在某一家公司的产品上。

为 C/C++ 项目打包 Zig 构建脚本

统一构建系统的一次尝试

名为“allyourcodebase”的 GitHub 组织正在为 C/C++ 项目编写 Zig 构建脚本(build.zig),目标是用 Zig 的构建系统替换 Make、CMake、autoconf、bash 脚本等传统工具。Zig 自带 Clang,可原生跨平台编译 C/C++/Zig 代码,发布版本只需运行 zig build release

社区讨论集中于几个方向。一些评论认为,这可能复刻 Bazel 世界的经典问题:每个人都自己写构建脚本,而不是改进上游工具,增加“新标准”而非减少碎片化。另一些用户指出,Zig 构建系统可调用外部命令,但真正烦人的是每个 C/C++ 项目的构建脚本都有自己独特的依赖查找和可选特性配置方式——这正是 Linux 发行版一直在做的枯燥工作。对于 sqlite 这类简单项目,Zig 构建简化显著;但对 libevent 或 gRPC 这类复杂项目,重写 build.zig 成本很高。

文件长度对比上,Wayland 的 meson.build(仅主文件)142 行,而 allyourcodebase 的 build.zig 有 581 行。支持者认为 Zig 版本更明确每一步在做什么;反对者认为手动硬编码配置头是一种退化,这些本应由 autoconf 等工具动态探测。总体看,allyourcodebase 展示了可能性,但长期影响力取决于上游维护者是否愿意采用,以及 Zig 构建系统能否真正降低维护负担。

将 RTX 2080 Ti 显存升级至 22 GB

一家位于阿联酋的维修公司 GPU Solutions 提供将 RTX 2080 Ti 的 1 GB GDDR6 模块全部替换为 2 GB 颗粒的服务,使总容量达 22 GB。服务包括 BGA 重焊、VBIOS 配置和稳定性测试,工时 12 天,提供 90 天保修。不过有 Hacker News 用户尝试预约时看到提示:“因内存模块成本翻倍,所有升级暂停,预约页面已关闭”。

多位评论者提到,类似改造在中国早已存在,Tom‘s Hardware 曾报道中国工作室将旧旗舰 2080 Ti 升级至 22 GB 并以约 499 美元出售,价格低于二手 RTX 3090。讨论中,有用户认为 2080 Ti 本身已过时,直接买 3090/4090 更划算;也有用户指出其性能仍可应对很多场景,升级后用于 AI 或高分辨率纹理场景性价比不错。

播客全文

女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是莓莓。

男:大家好,我是阿迪。

女:今天想跟你聊一件小事儿。前两天我坐朋友的车,在副驾上回了条消息,没两分钟就开始恶心。后来朋友让我打开苹果手机上一个设置,屏幕边缘出现了一些会动的小黑点,跟着车子的晃动一起动,结果我真就没那么晕了。

男:你说的是 iOS 上的车辆运动提示功能。这些小黑点其实是在屏幕上模拟车辆的运动方向,比如你左转,它们就慢慢往右漂。原理很简单,就是减少视觉和内耳前庭感知之间的冲突。你眼睛盯着相对静止的屏幕,但身体感觉到车在晃,大脑就容易混乱,然后催吐。那些动点给了眼睛一个运动的参照物,大脑就不那么困惑了。

女:怪不得。就像一个会跟着浪摇晃的小浮标,让你眼睛觉得‘哦,我也在晃’,欺骗大脑。社区里很多人也说有效,有人说以前在优步上完全没法看手机,现在可以正常工作了。还有人说他妻子之前车里看屏幕就吐,现在也能看一段时间。

男:对。不过效果也因人而异。有人觉得不能完全消除,但能把‘立刻想吐’拖到三四十分钟。也有反馈说加减速时反应不够快,或者白底背景时看点不明显。但总的来说,这功能解决了一个很多人默默忍受的问题。有意思的是,Android 端早有 KineStop 之类的第三方应用,苹果 2024 年才作为辅助功能加上去。

女:为什么这么晚?这个机制好像也不算新。

男:可能这就是大公司的通病。技术原理清楚,传感器数据也有,但得恰好有一个既懂底层 API、又能做系统级浮层、自己还晕车的开发者去推动。很多‘看不见的需求’就是这样被漏掉的。有人举例说他色盲的同事在玩密室逃脱时,分不清红绿提示卡,别人根本意识不到有这个困难。这种辅助功能的价值,只有被困扰过的人才懂。

女:确实,很多东西我们以为是理所当然的,直到某天自己被卡在外面。说到卡住,我想到另一个例子:如果你有一张老显卡,比如说 2080 Ti,想跑现在的大模型显存不够,你会怎么办?

男:换一张 3090 或者 4090。

女:但有个公司不打你这张卡的芯片主意,而是把显卡上每一颗 1 GB 的显存颗粒,吹下来,焊上 2 GB 的,直接凑出 22 GB 显存。

男:这活儿听着粗暴,但其实在中国早就有工作室这么干。用 BGA 焊台把 GDDR6 颗粒替换掉,再刷好对应的 VBIOS,就能让 2080 Ti 显存翻倍。价格嘛,有报道说成品卡卖 499 美元,比二手 3090 便宜。Hacker News 上有人提到一家阿联酋的维修公司也做这个,但因为内存颗粒涨价,预约暂停了。

女:这有点像改装车,不换发动机,换个更大的油箱。但这长期用稳定吗?

男:关键还是看手艺和颗粒体质。有人担心散热和供电,但 2080 Ti 的 TU102 核心本身性能还不错,应付中轻度 AI 推理或高分辨率纹理处理够用了。对预算紧张又想玩大模型的人来说,算一条野路子。社区里有人也说,换卡的性价比是另一个维度,如果你本来就有这张卡,花点钱升一下比直接买新卡省得多。

女:动手能力强的乐趣,外人确实不太懂。不过刚才聊的这些——让硬件适配更多任务——反而引出下一个我想问你的问题。现在大家在玩的,不管是老卡升级还是用本地模型,背后有一个共同的情绪,我在一篇博客里读到,叫“切断触手”。

男:你是说 Matthew Saltz 那篇文章吧。他是 Modal 的员工,把 opencode 连到了自家推理端点上的 Kimi K3 模型,说代码数据直接从笔记本到端点再回来,不经过其他的云厂商,感觉像‘切断触手’一样自由。

女:对,他形容好像在重型编辑器里泡了很久,突然打开 vim,一片干净的空白。下面有人就笑,说这明摆着是广告。

男:确实有这层嫌疑,但有些评论也挺实在的。比如有人说,你用 Claude Code 可能一口气生成几千行代码,但那不是真实的软件开发方式。实际上大多数时候你只是想做一个小范围的、精准的函数改动,比如改一个解析逻辑或者加一个边界处理。这时候开源的小模型完全够用,而且成本极低。有人充 15 美元用 OpenRouter,能用很久,因为他一次只改一小块,从来不让模型一次生成整个应用。

女:还有人说他把敏感数据,比如日历、家居控制,全部交给本地模型,彻底不用公共 API。

男:隐私是另一个驱动力。代码走公共 API 还能接受,但个人行程或者家里设备的控制,很多人不愿意交给第三方。自己搭一个 agent 系统,每月花两美元,拍照添加日历、归档 PDF、搜索网页,全靠开源模型跑本地。他觉得这种完全控制工具的感觉,比 ChatGPT 好用。

女:硬件门槛呢?自己跑模型不便宜吧?

男:要跑最好的模型确实贵,一台机器可能超过五千美元。但如果只是入门玩一玩,任意旧硬件跑个 7B 或 9B 参数的小模型就行了。很多人在十五年前也是这样折腾 Linux 的,慢慢摸索。而且像 Modal 这种托管端点,本质上是租用,不是持有一整台机器,门槛可以低不少。

女:说到成本,有个让我特别吃惊的数据。一篇文章提到,有家公司用五百美元的 GPU 费用,对一个 9B 参数的开源模型做了强化学习微调,在电商目录审查这种任务上,质量得分 87%,而最好的通用前沿模型才 76%。

男:而且成本差距惊人。那个微调模型处理一千条商品条目只要五毛美元,最便宜的前沿模型是十九美元,最贵的一百七十二美元。按每天四千万次决策算,用前沿模型一年花五亿美元,专用模型只要七百万。

女:但是,五百美元训练费是不是太理想化了?

男:这就是文章被社区批评的地方。那十七万七千条标注数据,是从 Amazon Berkeley Objects 数据集合成的,不是真实业务日志。真正用起来,数据清洗、标注、质量监控的投入,可能远超直接调 API 的费用。文章自己也列了个决策矩阵:只有高频、可验证的任务才值得自己做。如果总共就一千条数据,质量要求 70%,花十九美元调个 Gemini API 最省事。

女:所以不是‘微调就是好’,而是‘只有当你的业务知识值得固化进模型参数里’的时候,这条路才走得通。

男:对。而且微调模型除了它训练过的那一个任务,其他方面完全比不上通用模型。前沿模型能解开放式问题,甚至证猜想,小模型做不到。

女:不过这个思路——让模型通过强化学习自己优化奖励函数——和前面聊的代码生成基准有奇妙的呼应。那个叫 SlopCodeBench 的测试,就是你之前提过的,让模型分段迭代写代码的那个。

男:SlopCodeBench 的思路很狠。它不是让模型一次性完成需求,而是分检查点,逐步追加新需求,模型每次都得继承之前自己写的代码继续改,同时必须通过所有老需求的回归测试。作者用三个 Claude 模型跑,Opus 5 只通过了 24% 的检查点,其他更差。连标为“简单”的问题,三个模型都跑不到终点。

女:这说明什么?模型写单段代码还行,但没办法维护一个不断长胖的代码库?

男:是。而且质量方面,Opus 5 写出的函数数量是前代的五倍,但其中只有 15% 被真正调用。有用户评论说,模型没有重构的冲动,就是不停地堆代码,结果复杂度越来越高。但也有人说这可能只是一个 harness 的问题——如果你要求模型只在特定接缝处改动,而不是原地编辑,效果可能完全不同。

女:所以强化学习微调也好,代码迭代也好,关键不是你用了哪个模型,而是你给模型搭建了什么工作流?

男:差不多是这意思。而且这也回到刚才那个‘切断触手’的话题。很多人现在尝试把 Claude Code 的 harness 拆下来,套在开源模型上,发现效果也不错。有人预测六个月后,最好的 agent 框架会是开源社区里涌出来的那个,而不是某家巨头的产品。

女:这让我想到最近一个新架构,叫 Kimi Linear,据说是首次在公平比较中全面超越了全注意力机制。

男:Kimi Linear 的核心是 Kimi Delta Attention,可以理解为一种用有限状态 RNN 内存来高效管理上下文的机制,把 KV 缓存用量最多砍掉了 75%,长文本解码速度快了六倍。他们开源了预训练模型和内核,社区评价还不错。不过后来发布的 Kimi K3 并没有完全沿用整套 Linear 架构,而是混合了很多其他新技术。

女:所以也不是什么终极答案,而是一次有意思的路线探索。

男:对。而且讨论中一直有个争论,就是他们到底有没有蒸馏过别人的模型,社区争得挺厉害。不过抛开这些,大家比较认可的是,中国 AI 实验室在注意力机制这条线上确实有推进,不只是跟随。

女:但不管怎么说,我现在更困惑的是,这些厉害到不行的模型,有时候连一杯茶里有几个活菌都搞不清楚。

男:你说的是那个微生物学博士做的益生菌茶实验吧。

女:对。Jane Cook 买了一盒写着‘含益生菌’的姜茶,泡了之后觉得味道像煮过的细菌水。她就拿到实验室去培养,看看沸水泡茶,里面的菌是不是还活着。

男:结果是,沸水泡完,菌落数量反而比冷水泡的还多。因为这种叫 BC30 的芽孢杆菌会形成孢子,孢子就是自带保护壳的种子,可以抵抗干燥、辐射、化学消毒剂,沸水根本杀不死。工业上生产时,最后一步甚至是巴氏杀菌——用高温杀死所有非孢子态的微生物,只留下孢子。

女:这个逻辑挺讽刺的。所以一杯茶里真的能补到益生菌吗?

男:按她的实测,一杯茶大约三万个菌落形成单位。而 BC30 官网引用的人体试验,每天要吃十亿个单位才可能有临床效果。也就是说,一杯茶里的活菌只有所谓有效剂量的 0.003%。而且那些临床试验本身,安慰剂组和试验组的基线差异也有问题。

女:所以这是一个典型的营销胜于证据的案例。消费者花更高的价钱买带‘益生菌’标签的茶,其实可能只是买了个概念。

男:这件事的精彩在于,一个科学家用极低成本的实验,就戳破了一个消费泡沫。另外,Hacker News 有读者纠正了一些细节,比如文章开头引用的 CDC 数据——‘70% 美国人被开了抗生素’其实是每千人 679 到 775 次处方,不是覆盖率的概念。这也提醒我们,即使是科学家,传播数据时也要特别小心来源。

女:数据如果不精确,结论就立不住。不过说到数据,我突然想起另一件事,就是熊本县前两天的大地震。我正好有朋友在九州,说震感非常强烈。

男:7 月 28 日下午那次 7.1 级地震,震中和 2016 年的熊本地震几乎一样。多个地区测到日本最高等级的震度 7。NHK 拍到高速公路断裂、购物中心屋顶坍塌、商场美食区还发生了爆炸。

女:那个购物中心 2016 年就震坏过,重新开业时还说加强了防灾设计。

男:是,结果这次又塌了。而且更让人难过的是,熊本县很多地方 2016 年的伤还没养好,木结构老房子二次受损,震后避难所因为安全没确认,政府只能开放停车场让民众睡车里。但长时间缩在狭小空间又容易导致经济舱综合征,真的是两难。

女:九州地区本来人口就在外流,这种灾害一来,小城市和农村的空心化可能会更严重。我看到有报道说,附近台积电、索尼的工厂都疏散了,幸好核电站没有异常。

男:嗯,基础设施方面,大面积停电让很多依赖空调和医疗设备的老年人陷入危险。GPS 基准站数据显示地面位移最大有 84 厘米,这已经不是轻微晃动,而是地块本身的位置变了。

女:大地震面前,技术再先进,人还是很脆弱。但反过来,像车辆运动提示这种小功能,又让技术显得特别温暖。

男:都是工具,就看用在什么地方,解决的是什么人的什么问题。

女:今天聊了挺多,从车上的小黑点,到显卡换显存,再到代码模型迭代、开放模型和隐私,最后到益生菌的真相和熊本地震。

男:好像没有一条主线,但都指向同一个问题:我们怎么用工具,工具又怎么反过来塑造我们的判断和选择。

女:是的。希望大家听完,至少能记住一件事:下次泡茶,别指望菌能活着;但坐车看手机,可以试试那个动点点。

男:或者,如果你想写代码,也许先弄清楚自己真正需要的是什么——庞大模型的一口气生成,还是安静精准地改一小块。

女:感谢收听这期节目。如果你喜欢我们的播客,记得用泛用型播客客户端订阅,这样就不会错过更新。

男:我们下期再见。

女:拜拜。

参考链接