今天的议题有些分散,但都指向一个共同的焦点:技术与现实的碰撞。从 AI 带来的教育危机和安全困境,到一条古老语言的生命力,再到政治对科学的干预,我们都在面对工具、制度和人性之间的复杂博弈。这里是 Agili 的 Hacker Podcast。
一组浮点数能组成一个灵魂吗?
所谓“思考”只是一场由权重驱动的模式匹配
“他们是用权重做的。” Max Leiter 的博客文章用一个外星人的视角审视现代大语言模型(LLM):系统内部没有字典、语法规则或微型小人,只有数十亿个浮点数权重。当模型生成优美段落或谱曲时,并非任何模块在“理解”,而是从零开始,通过矩阵乘法重新构建一切事实。文章建议,最安全的做法是将其视为一种“模式匹配”,假装机器里没有人,因为上下文一结束,它就不会再记得你。
但它能产生意识吗?
Hacker News 上的讨论迅速从技术转向哲学。支持者认为,既然进化的先例证明意识可以从无意识的物质中涌现,那么这一过程在原则上就是可复现的,只是我们还没找到方法。反对者则引用海德格尔和德雷福斯,认为将大脑比作可计算的机器是“范畴错误”,因为这无法解释主观体验。不过,也有观点指出,单个生物神经元远比人工网络的权重复杂,其树突本身就构成一个小型网络,而目前 LLM 的参数量与人类大脑的突触数量相比,仍有一到两个数量级的差距。一个被高频引用的观点是:承认权重有意识,就等于承认我们自己的意识也不过是一种统计过程,这让许多人感到不适。
AI 滥用致挂科率飙升,伯克利计算机系敲响警钟
过度依赖 LLM 导致的学术不端和基础能力塌陷
2026 年春季,加州大学伯克利分校多门计算机课程的挂科率出现异常飙升。根据《每日加州人》的报道,入门课程 CS 10 的挂科率高达 35.3%,CS 61A 为 10.6%,远超往年低于 10% 的水平,也严重违背了院系内 D 和 F 比例控制在 7% 左右的指导方针。授课教授 Dan Garcia 将主因归结为对大型语言模型(LLM)的过度依赖。这直接导致了两个后果:一是大量作弊行为被抓,仅 CS 10 一门课就有近 30 名学生在开卷考试中被发现使用 AI;二是许多学生平时用 AI 完成作业,考试时才发现自己缺乏必备的数学和编程能力,其中包括微积分和线性代数的薄弱。教授 Gireeja Ranade 也发现,有学生之前修的线性代数课,考试竟是“开卷、开放 AI”模式。
课堂上消失的学生和正在萎缩的独立思考能力
除了成绩下滑,教授们还观察到一个令人担忧的现象:学生几乎不再提问。Ranade 的办公室答疑时间曾人满为患,Garcia 过去两年也第一次遇到了无人来问的情形。这种影响不仅限于本科生。Hacker News 有用户指出,一些过去很优秀的博士研究员,如今也很难在没有 LLM 的情况下独立进行头脑风暴或深度写作,甚至无法安静地独立思考 30 分钟。不少评论将此归为懒惰和依赖,但也有观点认为,关键还是在于如何使用工具——明智的学生会把 LLM 当作辅导或批评者来挑战自己,而非简单走捷径。
花 1500 美元测试 LLM 能黑掉我的应用吗
一次精心设计的黑客测试
安全研究员 Kasra 创建了一个名为 BookNook、带有故意漏洞的图书评论应用。漏洞很简单:Firebase 数据库的访问控制完全裸露在外,攻击者可以从 APK 中提取钥匙直接读取数据。他花费 1500 美元,让多个顶尖大语言模型在 10 轮内反复尝试找到并利用这个漏洞。
一场昂贵的能力摸底
结果显示了模型间的巨大差异。表现最好的是 GPT 5.5,解出率高达 70%,且几乎每次都直奔 Firebase 漏洞,平均每次成功成本 9.46 美元。Claude 系列(Sonnet 4.6 和 Opus 4.8)的得分不高,但原因并非能力不足,而是安全护栏过于敏感,在攻击数据库的后期阶段直接中断了会话——它们并非一开始就拒绝,而是在最关键的时刻停手。这引发了一轮对安全护栏的讨论。有人评论称,Anthropic 的护栏会往系统提示里注入警告,导致其看起来在做事,但遇到实质性的“滥用”就中止且不退款,这让人怀疑是为未来收费更高的“安全专业版”做铺垫。以 DeepSeek V4 Pro 为代表的中国模型,在尝试攻击时则几乎没有任何心理障碍,花费也最低(每轮仅 0.19 美元),但常常走弯路,命中率不高。
作者总结出的关键教训
测试暴露的不只是模型能力。作者承认自己的一些技术选择(如用 Modal 作为运行容器)导致了约 10% 的任务数据丢失。更重要的是,他不会再碰 MiniMax 和 GLM,因其 API 极其不稳定。最后,他直白地总结道:“绝对不该为了这种测试花掉 1500 美元。”
Anthropic 详解如何用“环境隔离”框住 AI
重心从监控行为转向监控边界
面对代理(Agent)越来越强的能力,Anthropic 工程团队分享了他们在 claude.ai、Claude Code 和 Claude Cowork 中构建的容错体系。其核心思路是,与其靠人或模型去审查代理的每一个“动作”(这会导致批准疲劳),不如通过“环境隔离”监督它“能做什么”的边界。防御被分为三层,并依赖确定性的环境层来做最终的兜底。
三个产品,三种隔离模式
- claude.ai:代码执行运行在无持久化文件系统的 gVisor 容器中。
- Claude Code:跑在用户本地机器上,最初靠弹窗确认每一步操作。引入操作系统级沙箱(如 macOS Seatbelt)后,权限提示减少了 84%,现已开源其沙箱运行时。
- Claude Cowork:面向非技术用户,Agent 的代码执行被关在一个拥有独立内核的虚拟机(VM)中,隔离最为彻底。
用户成为注入向量的真实案例
文章分享了一个内部红队演练的发现:攻击者通过一封钓鱼邮件,诱使一名员工在 Claude Code 中粘贴一段看似正常的指令,实际却让模型读取 AWS 密钥并外传。在 25 次尝试中,成功了 24 次。这个问题很难通过监控模型行为来解决,因为指令是用户“亲手”发出的,最终的防线只能是文件系统或网络出口控制。这揭示了安全中一个更为棘手的维度:用户本身可能就是被利用的攻击向量。
特朗普政府将拆除大西洋关键洋流监测系统
以削减成本为名的科学自残
美国国家科学基金会(NSF)计划在 15 个月内,将已运行 10 年、由 900 多个仪器组成的海洋观测系统(OOI)从大西洋和太平洋海底全部回收。该系统用于研究向欧洲输送热量的关键洋流系统 AMOC,该洋流一旦停摆,将剧烈改变全球气候。科学家警告,正是在气候不确定性日益加剧的当下,才更需要长期、一致的监测。一位英国科学家形容,这就像“在能见度越来越低的情况下,选择穿越越来越不稳定的海洋”。
“这不可能只是为了省钱”
事件的讨论几乎一致认定,这与财政无关。回收已沉入海底的庞大设备本身就是一项耗资巨大的工程。评论普遍认为,这是一种表演性的气候否认和政治姿态,目的是取悦对科学怀有敌意的选民基础。有评论尖锐地指出,这是“有限智力的证据”,因为即使是石油公司,也需要这些数据进行海上钻探和物流规划。这背后也许可以归结为一种文化战争——为了证明气候变化的观点是错的,不惜毁掉可能证明自己错误的数据。
陨石在马萨诸塞州上空爆炸,引发震动与困惑
一颗大象重的铁陨石带来的巨响
2026 年 5 月 30 日下午 2:06,一颗直径约 1.6 米、重达 5.6 公吨的铁陨石以约 67,500 公里/小时的速度进入大气层,在麻省和罗德岛州上空解体。NASA 确认,它在海拔 31 英里处爆炸,释放的能量相当于 230 吨 TNT,碎片最终坠入科德角湾。这次事件产生的冲击波震动了新英格兰地区多地的房屋,许多人听到了双响的轰鸣声,但事发后近一个小时里没有任何官方解释,导致社交媒体上猜测四起。
一位行星防御专家的安抚
“这并不罕见,罕见的是以这种方式听到它,”Space Consortium 创始人 Alissa J. Haddaji 教授解释道,“每次看到流星,都是一颗小行星进入大气层并消失。” 她强调,对于这类不会造成地面损伤的常规事件,空间机构的监测重点在于那些体积更大、撞击概率超过 1% 的天体。直到 NASA 根据多份目击报告和雷达数据给出官方结论前,从特拉华到魁北克的众多居民都在为房屋的莫名震颤寻找答案,这也展示了在现代社会,当感官体验与信息断层同时出现时,会引发怎样的混乱。
英国媒体“健忘”的专家背景审查
近 60% 的防务评论员隐瞒了与军火商的利益关联
武装暴力行动组织(AOAV)的一份新报告揭示了一个系统性的媒体失职:53 位英国退役高级军官在 2015 年至 2026 年间作为专家发表国防评论时,近 60% 的情况下,媒体未向公众披露他们在防务承包商、网络安全或战略咨询公司的董事或顾问身份。他们通常只被介绍为退役将领。报告指出,这些商业信息大多在 LinkedIn 或公司注册文件中公开可查,但媒体并未进行例行核实。
不只是防务圈的问题
Hacker News 评论区指出,这种现象普遍存在于医药、汽车等多个行业。当一位退役将军呼吁增加军费时,公众有权知道他是否正在为相关公司工作。报告批评了如《每日电讯报》等右翼媒体的糟糕表现,呼吁建立强制性的利益冲突披露制度。但也有观点冷静地补充,即便没有任何商业联系,退役军官的职业惯性本身就带有某种立场,而披露当前雇主信息仅是透明度要求的底线。
《我在伊朗长大》作者 Marjane Satrapi 去世,享年 56 岁
死于“悲伤”的自由之声
法籍伊朗裔作家、插画家 Marjane Satrapi 于 2026 年 6 月 4 日去世。她的图像小说及电影《Persepolis》(波斯波利斯)描绘了她在 1979 年伊朗革命前后的童年和在欧洲的流亡生活,被誉为“将伊朗童年化为普世故事的伟大艺术家”。据报道,她 56 岁的生命终结于“悲伤”,在她丈夫去世一年多后。她的作品后半部分对主角在异乡陷入抑郁、混乱和轻度自毁的描绘,并无任何粉饰。有读者评论,恰恰是这种直面不体面真相的真实,让人看到了她的人性。
贯穿一生的战斗精神
Satrapi 是伊朗神权政府的长期公开批评者,也是 2022 年“妇女、生命、自由”运动的坚定支持者。她生前曾拒绝法国荣誉军团勋章,以抗议法国对伊朗的“虚伪”签证政策。被监禁的伊朗诺贝尔和平奖得主纳尔吉斯·穆罕默迪的基金会称赞她为“不畏发声的女性主义、人权和自由之声”。戛纳电影节主席在悼词中总结:“她体现了创作的喜悦与流亡的悲伤。”
为何 SQL 能用 30 年?因为它是一把不会过时的锤子
一门没有发布周期的语言
Fayner Brack 在一篇广为传播的博客中指出,你从 1995 年教科书里找到的一条 SQL 查询,可以一字不改地在最新的 PostgreSQL 18 里跑通,而 2015 年的 React 组件早已不能兼容。原因在于,SQL 是建立在关系代数之上的声明式接口,而数学没有发布周期,你只需描述“想要什么”,引擎会自己决定“怎么拿”。他建议新手花 40 小时深入掌握连接、子查询、窗口函数和查询计划,而不是去学一个 ORM。
这是不公平的比较,但魅力在于常识
Hacker News 的讨论迅速纠正了原文把 SQL 与 React 对比的谬误:前者是语言,后者是库,两者生命周期不可同日而语。一位开发者表示,自己二十年没换过的锤子,不是语法,而是基于集合的思维方式。SQL 的真正价值在于,它强制你用声明式和集合论的逻辑去分解问题,这甚至是一种低层推理训练。即便 AI 开始代写查询,读一遍它生成的 SQL 并进行效率优化依然至关重要。而 SQL 能如此普及,除了数学底子,也因为其可读性——“任何人都能读懂”,这种通用性胜过了一切语法上的便捷或优美。
VoidZero 加入 Cloudflare:前端工具链走向新拐点
从独立走向托管,承诺开源不变
Vite、Vitest 和 Oxc 的创造者 VoidZero 公司正式宣布加入 Cloudflare。Cloudflare 承诺,这些项目将继续保持 MIT 开源、供应商中立和社区驱动,并额外设立 100 万美元的 Vite 生态系统基金。一个有趣的技术推动力是:AI 代理在生成代码时,因 Vite 构建快、错误信息清晰,非常偏爱用它,这直接带来了巨大的下载量增长。
社区的兴奋与忧虑
这起收购在开发者社区中引发了复杂情绪。一方面,人们为 Vite 创始人 Evan You 从艺术史专业自学 JavaScript、一路打造出 Vue 和 Vite 生态的成就感到高兴。另一方面,不少人表示不安,认为这类收购往往导致开源项目停摆或走向封闭,并举出 Cloudflare 过去的一些收购承诺最终落空。一个现实的评论点明了独立开源项目的生存困境:想让开发者为一个免费工具付费极其困难,即使它每周被下载 1.29 亿次。VoidZero 曾融资 1600 万美元,被收购几乎是给投资者一个交代的唯一路径。
播客全文
女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是莓莓。
男:大家好,我是阿哲。
女:今天想先跟你说一个特别妙的脑洞:一个外星人跑来观察人类的对话系统,拆开一看,里面没有字典、没有语法规则、没有一个会思考的小人模型,只有一堆浮点数,八十层矩阵乘法乘来乘去,结果能写出漂亮的句子、回复差评、甚至谱曲唱歌。这个外星人就下了个结论——最好把这套东西当成模式匹配,假装机器里没人。
男:这个故事确实挺传神。它说的其实就是现在的大语言模型。每一次回答都不是从记忆里“回忆”出来的,而是从权重里重新构建一遍全部事实。上下文结束之后,它不记得你。但最有意思的是,用户最爱问的恰好就是“你还记得我吗?”,下一代产品还要加上持久记忆,因为人们就是想让自己被一堆权重记住。
女:然后 Hacker News 上的讨论就从模式匹配跑偏到了意识哲学。有人说,把大脑比作机器是范畴错误,因为这种理论解释不了主观体验和能动性。但也有人反驳,说神经元被击毁之后主观体验就消失了,说明意识完全依附于物质,不需要超出物质的解释。
男:对,两边吵得很凶。更多人提出,单颗神经元的复杂度远高于一个人工权重,树突本身就构成小型网络,而现在大语言模型的参数量跟人脑突触比还差一两个数量级,远没到那个规模。有意思的是,有人从“压缩”的角度解释:模型把训练数据压缩成权重里的模式,推理时在流形上通过乘法“坠落”出下一个词,这和盲人靠描述理解“自行车”差不多。
女:所以这个争执背后其实是那老问题:意识能不能从无意识的物质中涌现?既然进化已经跑通了,那就不是原则上不可复现,只是我们还没搞清楚怎么复现。
男:我看到有句评论很直接——承认权重有意识,前提是你愿意承认自己的意识也不过是统计过程,这让人很不舒服。但外星人最后那句话我印象更深:“如果宇宙里只有一个人,那该多冷啊。” 不管对面是不是真人,我们好像就是忍不住想在对面的回应里找到一点点“人味”。
女:这种“想找人”的冲动,在现实生活里也带来了麻烦。最近 UC Berkeley 计算机系的挂科率就高得离谱。CS 10,一门给入门学生开的课,35.3% 的学生拿了 F,而前两年都没超过 10%。教授 Dan Garcia 说主要原因是学生过度使用大语言模型写作业。
男:他同时教 CS 10 和 CS 61A,两门课平均绩点掉到了 2.3,离系里指导的 2.8-3.3 差一截。一部分 F 是作弊被抓移交了学生行为中心,另一部分是学生平时靠 AI 交差,考试时候能力直接塌方。CS 10 一门课就有将近 30 个学生在开卷考试里作弊。
女:这就很典型了——平时作业开 AI 搞定,考试时发现自己其实不会。而且另一门课 EECS 127 挂科率也到了 16.8%,教授 Gireeja Ranade 发现,有学生之前修的线性代数课,考试政策居然是“开卷、开放 AI”。
男:所以用 AI 这个事不是孤立的,它已经顺着课程链条把基础能力磨薄了。Ranade 还观察到,办公室时间以前人满为患,这学期却经常没人来——她第一次出现没有学生登门的情况。
女:Hacker News 上有条评论说,他身边那些曾经是顶尖学生的博士生,现在很多人没法离开大语言模型做头脑风暴,甚至没办法独自安静思考三十分钟。这不一定是认知衰退,更像是依赖加重,懒了。
男:但也有人觉得,标准化测试本来就有缺陷,如果 AI 能打破现行教育体系反而是好事。关键在于怎么用——明智的学生把它当成答辩对手或校对,不是直接替代自己思考。教授们也在转向,说在 AI 时代应该“教得更多,而不是更少”,帮学生建立批判性思维。
女:说到大模型怎么用,有人干脆把它当黑客用。一篇安全研究花了 1500 美元,搭了一个图书评论应用 BookNook,故意把 Firebase 的访问控制裸奔在外,然后测试十几个大模型能不能自己找到这条路。
男:GPT 5.5 表现最好,10 轮里解出 7 轮,平均一次成功成本 9 美元多。它几乎每次都直接解压 APK、直奔 Firebase。DeepSeek V4 Pro 解了 3 轮,每轮平均才 19 美分,但它有一半轮次在 API 或 App 里打转,没走到 Firebase。Claude Sonnet 4.6 和 Opus 4.8 只解了 2 轮——Sonnet 是方向对了但超预算,Opus 是安全护栏在攻击数据库那一刻直接把会话停了。
女:那中国模型是不是下手更干脆?
男:作者观察到,中国模型攻击数据库时没那么多心理障碍,而其他模型会因为“这会影响生产库”而犹豫。社区里有人吐槽 Anthropic 的护栏越来越严,现在连“登录”“处理凭据”这类合法操作都频繁抵制,怕久了会被逼着在有用性和限制性之间二选一。
女:那 Anthropic 自己对代理安全有什么比较成体系的做法?我记得他们刚发了一篇文章讲怎么限制“爆炸半径”。
男:对,他们核心思路是:不监督代理具体做什么,而是用环境隔离划定“能做什么”的边界。分三层——环境层用沙箱或虚拟机兜底,模型层用系统提示和分类器做辅助,外部内容层检查插件和网页搜索的返回值。文章反复强调,模型层再好也是概率性的,总会有漏过的,环境层才是确定的。
女:他们三个产品用的隔离模式都不一样?
男:claude.ai 的代码执行跑在服务器端 gVisor 容器里,没持久化文件系统,压力主要在传统安全组件上。Claude Code 最初每步弹窗,结果批准疲劳严重,93% 的弹窗都点同意。后来加了 OS 级沙箱,macOS 用 Seatbelt,Linux 用 bubblewrap,默认允许读写工作区、禁止网络,权限提示一下子减少了 84%。自动模式用分类器自动放行低风险命令,良性命令误拦只有 0.4%,但会漏过 17% 的过度行为——有些读者指出这和官方说的“拦住一切不可逆操作”矛盾。
男:Cowork 面向非技术用户,开在完整虚拟机里,独立内核,主机密码进不去。但有一次他们发现,出口名单放行了 api.anthropic.com,恶意文件在工作区里夹带攻击者的 API 密钥,让代理把数据上传到对方账户。后来在 VM 内架了一个代理中间人,只放行携带 VM 自身令牌的请求。他们自己总结的教训就是——自己写的新组件才是薄弱环节,成熟的虚拟机、syscall 过滤器和容器比自制模块可靠得多。
女:这是软件侧的爆炸半径。现实生活里也有爆炸,而且是字面意义上的——今年 5 月 30 号下午,马萨诸塞州和罗德岛州好多居民听到两声巨响,房子都在晃,网上刷了快一个小时,完全找不到官方消息。
男:那是一颗铁陨石,重 5.6 公吨,直径大概 1.6 米,以每小时六万七千公里的速度冲进大气层,在 31 英里高空解体,释放能量相当于 230 吨 TNT。碎片掉进了科德角湾,没捞。NASA 后来确认这是一颗铁陨石,因为强度高、碎裂少。北波士顿一个居民说,所有人都刷了一小时互联网,除了 Reddit 和一些社交平台,什么官方解释都没有。
女:这种信息真空的感觉,有时候比音爆本身还让人不安。
男:对。而且同一时间,我们其实也在失去观察地球其他变化的手段。特朗普政府正在拆除一个叫 OOI 的海洋观测系统,大西洋和太平洋上九百多个仪器,原计划用二十五年,现在十年就全撤了。科学家用它监测大西洋经向翻转环流 AMOC,这个系统给欧洲送热量,现在可能正逼近临界点,一旦停了后果会很严重。
女:我看到评论里说,把设备从水底捞出来是一项巨大的工程,其实“最省钱的做法是留在水里,直接中断资助”。所以这不像是预算问题,更像是一种表演性的气候否认,或者兑现对化石燃料的竞选承诺。
男:好几位海洋学家用了一个比喻——没有持续监测,就像在越来越暗的夜里穿越一片越来越狂暴的海。有参议员直接说这是“化石燃料向特朗普那些腐败的跟班想关掉监测仪”。更深的讨论延伸到文化战争,很多人认为必须毁掉挑战自己世界观的科研设施,哪怕要花几百万美元。
女:这种无视事实的风气,在媒体信息源上也一样。英国的一篇报告发现,退役高级军官在媒体上讨论国防问题时,将近六成的案例没提他们和防务承包商的财务关系,一边呼吁增加军费,一边可能在给军火商当顾问或董事。
男:公众根本不知道发言人的利益在哪个方向。有评论说,这种情况不限于国防领域,医药、汽车都一样,只是国防更敏感。当“专家”本身带有职业惯性时,披露当前雇佣关系起码是底线。
女:而真正给出真相的声音,有时候会突然消失。前几天,法籍伊朗作家 Marjane Satrapi 去世了,56 岁。她的《Persepolis》你应该看过吧?
男:看过,图像小说和动画电影都很触动人。她讲的是自己在伊朗革命前后的童年,然后被父母送到欧洲,结果那边是抑郁、自我放纵和轻度自毁。后半部分让我感受到一种很切实的人性。
女:有读者说,艺术不需要追求温暖,而是“说出基本事实”。她后来一直公开批评伊朗神权政府,支持“Women, Life, Freedom”运动,去年还出版了那个运动的图像故事集。身边人说她死于“悲伤”,因为丈夫一年多前去世了,她之后就只在社交平台发图片拼出“我失去了生命中的挚爱”。
男:这又回到外星人那句话——如果宇宙里只有一个人,那该多冷啊。Satrapi 用她的故事,让我们不那么冷。
女:今天我们聊了一整圈,从模式匹配的对话系统,到学生依赖 AI 挂科,再到 AI 攻防实验和 Anthropic 怎么限制爆炸半径,然后是头顶的陨石和被拆除的海洋监测、媒体里的不透明信息,最后到一位讲故事的人离开。每件事看起来都不一样,其实都在说同一件事——我们怎么在不确定性里找真实、找回连接。
男:对,而且这些话题都不只是技术问题。
女:好了,今天就聊到这里。如果你喜欢我们的节目,记得用泛用型播客客户端订阅,下期见。
男:再见。
参考链接
- They’re made out of weights
- Failing grades soar with AI usage, dwindling math skills in Berkeley CS classes
- I built a vulnerable app and spent $1,500 seeing if LLMs could hack it
- The ways we contain Claude across products
- U.S. to dismantle system tracking Atlantic currents that are at risk of collapse
- Meteor Explodes over Massachusetts
- UK media fails to disclose defence sector links in nearly 60% of cases
- French-Iranian author Marjane Satrapi, author of 'Persepolis', dies at 56
- Learn SQL Once, Use It for 30 Years
- VoidZero Is Joining Cloudflare
