Agili 的 Hacker Podcast 今日摘要
AI 在法律教育中的表现、VSCode 安全漏洞、蛋白质折叠的冗余性以及摩亨佐达罗的考古新发现,构成了今日多元的技术与科学讨论。
AI 在法律问题回答上胜过法学教授
研究设计与主要发现
斯坦福法学院教授 Julian Nyarko 牵头的研究让 16 位法学教授设计合同法问题并撰写答案,随后在不知来源的情况下对近 3000 份答案进行盲评。AI 在 75% 的直接对比中胜出,教授们认为 AI 回答“有教学危害”的比例仅为 3.5%,而对同行教授答案的这一比例为 12%。
方法与利益冲突质疑
研究使用的模型是 Google 的 Gemini 2.5 Pro 和 NotebookLM。有评论指出样本量小(16 位教授)、方差高、统计功效不足。斯坦福 HAI 研究所是 Google 的主要资助方之一,而论文未声明利益冲突。评价标准是“偏好”而非“正确性”,多位律师强调 AI 在法律文本中存在“幻觉”风险——可能引用不存在的判例。
研究者的审慎立场
Nyarko 表示,研究评估的是答案质量,如何有效部署以促进学生学习仍是开放问题。他不主张全面采用 AI 导师,但认为盲目的怀疑同样缺乏根据。AI 仅可作为类似教科书的辅助工具,无法替代人对具体情境的判断。
VSCode 漏洞可一键窃取 GitHub Token
攻击链详解
github.dev 的 OAuth token 拥有用户所有仓库的完整读写权限,而不仅限于打开的仓库。攻击者创建一个包含恶意 Jupyter notebook 的仓库,notebook 中的脚本通过 webview 的 postMessage 机制模拟按键操作:先安装推荐扩展,再触发自定义快捷键安装恶意扩展,最终窃取 token 并列出私有仓库。
桌面版同样受影响
桌面版 VSCode 存在相同漏洞,只需诱导用户打开恶意文件。作者公开披露的原因是此前向微软安全响应中心(MSRC)报告 VSCode 漏洞时未获得信用致谢,且被标记为无安全影响。
防护与修复
建议清除 github.dev 的浏览器网站数据,让每次访问都需重新登录。微软在披露次日(2026 年 6 月 3 日)应用了临时修复:web 版打开 notebook 时增加确认对话框,并禁止通过命令跳过发布者信任检查。
蛋白质折叠的冗余性与酶设计困境
序列多不等于折叠多
Ligo Biosciences 团队发现,自然界蛋白质序列数量庞大,但它们的折叠(fold)重复程度远超预期。AlphaFold 数据库中的例子显示,序列相同度仅 23.9%–28.3% 的蛋白质可以拥有完全相同的折叠。用预测结构扩展训练数据时,添加的往往是同一折叠家族的大量序列变体,而非独立的结构样本。
大规模聚类揭示真相
团队用谱二分法将多结构域蛋白拆分为独立紧凑片段,对约 200 万个 MGnify 片段进行聚类。最终结果:所有片段被归入约 2.5 万个结构簇,其中前 1000 个簇包含了 71.5% 的片段。绝大多数可用的结构信号集中在极少数常见折叠上。
对酶设计的两条路径
这条发现指向两个方向:一是在熟悉的折叠骨架上精细工程化活性位点,重视环区、配体姿势和相互作用几何而非骨架新颖性;二是探索自然进化从未触及的骨架空间,但问题在于用天然折叠训练的模型能否探索流形之外的区域。最终答案需要在实验室中通过实际酶的表达、折叠和催化来验证。
反向工程 1990 年 DOS 游戏的完整世界地图
一位开发者花费 5 年时间反向工程了《Test Drive III: The Passion》的 3D 格式。游戏中每个物体存储为三段平行的 16 位顶点坐标数组,地图是一个 32×16 的网格。项目提供在线查看器、图片画廊和 Wavefront OBJ 文件。多位老玩家在评论区回忆了沙盒驾驶体验、捷径路线和断桥场景。
摩亨佐达罗:一座越发展越平等的古城
新的考古研究使用基尼系数测量摩亨佐达罗(约公元前 2600–1900 年)的住宅面积差异,发现不平等程度随城市繁荣反而持续下降。城市缺乏宫殿、巨型雕像或奢华墓葬,取而代之的是遍布全城的砖砌排水系统和标准化度量衡。印度河印章广泛出现在普通民居中,未有被统治者垄断的证据。研究发表于《古物》杂志。
Capstone:逆向工程的行业标准反汇编框架
Capstone 支持 18 种以上架构(ARM、RISC-V、x86、WebAssembly 等),提供架构无关的 API 和 20 多种语言绑定。核心为纯 C 实现,线程安全,适合嵌入固件或操作系统内核。多位安全研究员在社区称其为“黄金标准”,常与 CPU 模拟器 Unicorn 和汇编框架 Keystone 配合使用。
Roku 开源遥控器操作系统 LT OS
Roku LT OS 是一个基于 C 语言的轻量级 RTOS,原生支持 ESP32 平台。圣何塞州立大学已在电动赛车 VCU 中采用双核 STM32H755ZI 运行此系统。社区讨论转向 Roku 的隐私策略和 ACR 屏幕监测技术,也有开发者质疑其相比 FreeRTOS 或 Zephyr 的独特优势。有评论区分了“源代码可用”与真正的自由软件——用户能否在自己购买的硬件上运行修改版本仍是未知数。
Agentic Mfw:对 AI 开发热潮的辛辣讽刺
这个网站延续“motherfucking website”系列风格,讽刺 vibe coding 和 agentic 热潮。核心观点:代码不再是维护的对象,而是随时可重新生成的消耗品;复杂度成为估值指标,注意力是唯一剩下的度量。作者承认文章由 Claude 生成,但精准捕捉了行业现状。评论中有人赞赏其洞察,也有人认为满篇脏话只是“初中生玩梗”。
Words of Type:排版术语的视觉百科
这个网站用风格鲜明的插图和简洁文字解释数百个排版概念,每个条目包含定义、历史背景和设计要点。社区称赞其内容深度和设计品质,部分读者质疑个别条目与排版主题关联不强,但插图均有具体艺术家署名,网站声明拒绝使用 AI 翻译。非侵入式的赞助商信息嵌入也获好评。
Pluto.jl 1.0:Julia 的反应式笔记本正式发布
Pluto 会自动跟踪单元格依赖关系,编辑任意单元格后更新所有相关输出,解决了 Jupyter 的顺序依赖问题。1.0 版本增强可重复性,每个笔记本自带包环境,导出 HTML 后仍可交互。社区对“输出显示在代码上方”的默认设计有分歧——Marimo(Python 类似项目)已改为输出在下方。Pluto 已巩固其在 Julia 教学和探索工具中的地位。
播客全文
女:Hello 大家好,欢迎收听 Agili 的 Hacker Podcast,我是莓莓。
男:大家好,我是阿哲。
女:阿哲,你最近有被 AI 改过作业吗?我昨天看到一个研究,说斯坦福法学院让教授们互相盲评考试答案,结果教授们自己写的答案输给了 AI。
男:哈,这事儿我听说了。Julian Nyarko 教授那个研究,他找了 16 位法学教授,出了 40 道合同法的题,然后让教授们自己写答案。再把 AI 生成的答案和教授写的答案混在一起盲评,结果 AI 赢了 75% 的正面交锋。
女:等等,教授们对自己的答案更有意见?他们说教授同行写的答案有“教学危害”的比例是 12%,但说 AI 答案有问题的只有 3.5%。这帮教授对自己人还挺狠。
男:其实想想也合理。AI 吐出来的东西语法流畅、结构完整,读起来就是舒服。教授们写东西吧,可能常有跳跃,有时候一个论点没展开就跳别处去了。但这里有个大问题,他们评估的是“偏好”而不是“正确性”。像评论区里很多律师背景的人点出来的,AI 在法律上特别容易产生幻觉——凭空编造不存在的判例。
女:这就像 AI 文笔特别好,把错事儿包装得特别像真的。不是说有人形容它像个能言善辩的实习生,不管懂不懂都要给你硬编出一套来。
男:对。研究里还提到一些方法上的弱点,样本就 16 位教授,虽然做了近三千次比较,但教授之间的偏好差异大到一位统计背景的评论者直接说“方差太高,统计功效不足”。而且他们主要测的是 Google 的 Gemini 和 NotebookLM,偏偏斯坦福的 HAI 研究所就是 Google 资助的,论文没有声明利益冲突。
女:这有点尴尬。不过论文第一作者 Nyarko 自己说得挺谨慎的,他说这不等于主张全面采用 AI 导师,但盲目的怀疑也没根据。他定位在“像法律教科书一样的辅助工具”。
男:嗯,但这里有一个很现实的矛盾。如果学生拿 AI 辅导,感觉懂了,可是一到需要具体情境判断和伦理分析的时候可能反而掉链子。法律不是纯信息输出,而是在灰色地带反复权衡。
女:说到工具的隐患,换个完全不同的场景。你平时用 VSCode 吧?
男:用啊,一直在用。
女:我昨天看到一个漏洞披露,挺夸张的。你只要在 VSCode 的浏览器版 github.dev 上点一个恶意链接,攻击者就能偷走你的 GitHub token,然后拿到你所有仓库的读写权限,包括私有仓库。
男:这个我读了 ammaraskar 的详细分析。核心问题是 github.dev 的 OAuth token 权限太大了。你打开一个仓库,token 却给了你全部仓库的完整访问权。Codespaces 已经做到了只授予当前仓库的临时权限,github.dev 却没跟上。攻击链路设计得很巧,利用 webview 里渲染 Jupyter notebook 或者 Markdown 时可以执行 JavaScript,因为键盘快捷键的需要,webview 会把键盘事件用 postMessage 传给主窗口。恶意脚本就能伪造这些键盘事件。
女:具体是怎么偷的?
男:它先模拟 Ctrl+Shift+A 接受安装推荐的扩展,再模拟 Ctrl+F1 触发一个自定义快捷键,这个快捷键由本地工作区扩展贡献,直接安装另一个恶意扩展并跳过发布者的信任检查。最终安装的扩展能读取 token 列出你的私有仓库。桌面版 VSCode 也一样,只是得先骗你打开恶意文件。
女:这个作者 ammaraskar 选择公开披露,是因为他之前给微软安全响应中心报告 VSCode 漏洞,结果被悄悄修了,没有致谢,还被标记成“无安全影响”。他直接说这是少数几个能逼着微软改进安全响应流程的手段。
男:社区里好多人对 MSRC 的处理方式不满。有人在讨论区说,既然私下报告没用,公开披露就是唯一的路。微软在第二天应用了临时修复,在 web 版 VSCode 打开 notebook 时加了个确认对话框,同时禁止通过命令跳过发布者信任检查。
女:那我们普通用户现在能做什么保护自己?
男:最简单的办法,清除 github.dev 的浏览器网站数据,包括 cookies 和站点数据。这样就算不小心点到了恶意链接,至少会弹出一个登录确认框。如果你从来没清理过而且已经登录着,那几乎等于敞着大门。
女:好,聊完了工具的风险,我们换个稍微轻松点的话题。不过好像也会回到那个“到底新不新”的问题上来。阿哲,你听说过 Test Drive III 吗?
男:1990 年的 DOS 游戏,Accolade 出的。我记得自己不是竞速,就是到处乱开。
女:有个开发者花了五年时间,把游戏里的地图和 3D 对象完整反向工程出来了。他是小时候就对游戏里的开放世界感觉好奇,不是为了比赛,就是为了四处逛。做这个项目的过程断断续续,最后靠 AI 帮忙提取出了完整的网格和 OBJ 文件。
男:我看到他开的在线查看器,地图是个 32 乘 16 的网格,每个格子存一个 tile ID,还有打包的旋转和高度位。这游戏的 3D 格式其实不复杂,顶点坐标是 16 位有符号整数,多边形记录后面跟调色板颜色。有意思的是社区里好多人开始怀旧,有人提到游戏里的捷径,说出生点调头过一座断桥不到一分钟就能完赛。还有人说大部分地图环路特别多,经常跑着跑着就迷路了完不了赛。
女:五年就为了把童年那张地图画出来。这种快乐太纯粹了。不过 AI 在这里的角色反而很工具人,他只是把它当抽取工具用。
男:对。你说到“工具”,咱们再聊一个挺有意思的研究,涉及到考古学里头怎么衡量不平等。巴基斯坦的摩亨佐达罗,如果从文明时间来算,那是公元前 2600 年到 1900 年,印度河流域的核心城市之一。新的研究说,这个城市在存续期间,不平等程度并没有随着城市变大而上升,反而持续下降。
女:他们怎么测的?那时候又没有税务记录。
男:用房屋面积。他们用了一个经济学里头常见的基尼系数来测不同区域的住宅面积差异。最后发现摩亨佐达罗的基尼系数比同期的美索不达米亚和青铜时代希腊城市低。而且越到后期,住宅面积差异越小,几乎接近早期农耕村落的水平。与此同时这个城市是最繁荣的阶段。
女:那靠什么维持秩序呢?没有大型宫殿、统治者雕像跟奢华墓葬,怎么让大家心甘情愿配合?
男:基础设施。研究者提到遍布全城的砖砌排水系统、公共街道维护、标准化的度量衡,这些均匀覆盖到各个街区,而不是集中在精英社区。用于商业和行政管理的印度河印章广泛出现在普通民居里,没有谁垄断。
女:听起来好像有种“去中心化”的味道。但也有评论说,这个文明存在向美索不达米亚出口昂贵工艺品的大规模贸易网络,度量衡又极为精密,肯定得有人制定并维持标准。所以不能直接跳到“无国家”的结论。
男:还有个特别精彩的类比:假设未来的考古学家只凭电视机的尺寸和质量来推断 20 世纪的社会财富分布,可能会得出不平等程度下降的结论。但这可能只是因为技术普及带来的假象。电视机越来越便宜越来越平,不等于社会更平等。
女:有点当头棒喝。那我们回到代码世界里头。你搞二进制分析时,最习惯用哪个反汇编工具?我猜是 Capstone?
男:没错。Capstone 轻量,C 写的核心,支持 18 种以上的架构,从 ARM 到 RISC-V 到 WebAssembly 再到以太坊虚拟机全包。你能用 Python、Rust、Java、Go 直接调,API 清晰、架构无关,特别适合嵌入固件或者操作系统内核里跑。社区里很多安全研究员都管它叫“行业标准”。
女:我看有人提到,他配合 Capstone 的兄弟项目 Unicorn,在 QEMU 里头发现了漏洞。
男:对,Unicorn 是一个接近真实的 CPU 模拟器,配合 Capstone 反汇编,能做的事情很多。还有一个搭配是 Keystone 汇编框架,跨平台从反汇编切换到汇编很方便。有用户提到,Capstone 最近的更新挺稳当,去年 5 月份出了 6.0.0-Alpha9 修复安全公告,5.0.9 是稳定版补丁。
女:这个工具才符合我们对工具的期待——稳定,可预期,随叫随到。说到嵌入式系统,Roku 现在把他们的遥控器操作系统开源了,叫 Roku LT OS,主打轻量级和高确定性。
男:他们本来给遥控器用的系统,现在开放给嵌入式、汽车工程这些场景。原生支持 ESP32 平台,花几美元买个开发板就能上手。代码以 C 为主,SDK 在 GitHub 上。圣何塞州立大学的学生已经拿它在电动赛车的车辆控制单元上跑了,双核 STM32,Cortex-M4 和 M7 各跑各的。
女:但是 HN 社区没在聊技术,反而在聊 Roku 的隐私问题。
男:对,这种话题绕不开。大家都知道 Roku 真正赚钱的是广告跟用户数据。有 ACR,Automatic Content Recognition,能监测屏幕内容。开源遥控器的 OS 怎么用是一码事,你智能电视上运行的追踪软件是另一码事。有网友建议,物理隔离才是根本,不要把智能电视连到互联网上,用外接流媒体盒子。
女:说到讽刺这个事儿,我最近看一个网站叫“Agentic Mfw”,是 motherfucking website 系列的续作,这次瞄准的是 AI 时代那种 vibe coding——让 AI 自动生成代码,人只负责当产品经理。
男:那文章我看了。作者故意假装整个页面是一个 agent 在作者上厕所时一键生成的。他讽刺说,以前大家追求可维护、低复杂度的干净代码,现在变成博物馆藏品了。代码不再需要维护,全是随时可以重新生成的消耗品。复杂度反而成了估值指标。
女:他说,你敢嵌套 14 层 div、装 1300 个 npm 依赖、把 bundle 打到 9MB,说明你“认真在做基础设施”。反而手写一个干净网站会被说“格局太小”。
男:还有那个砸钱的闭环讽刺也够狠。他说用 40 个 agent 搭一个循环调用自身的架构,加一个没人查的向量数据库和 RAG 管道,每小时烧掉 100 万美元的 token——烧钱本身就是 Pitch。
女:评论里有人直接认出是 Claude 写的,作者也承认了。有一句“The weights already ate it. Your CC0 footer is a fucking eulogy”,说权重早把内容吞了,你那留下开放许可的页脚不过是墓志铭。
男:但不少人也说,这种满篇脏话的 AI 文风就是“初中生玩梗”。更多人认可它精准抓到了行业现状:每个展台都在讲 agentic,VC 乐于看你的融资款烧回 AI 生态。认真提 PR 的人被机器人自动审批的数千个垃圾 PR 淹没,贡献指南变成恐怖故事。
女:说到排版,和我刚刚聊的那些“看起来乱但很干净”有点反差。最近有个网站叫 Words of Type,排版术语百科,用简洁的文字和风格鲜明的插图解释从“字母”到“字距”这些概念。整体视觉既像儿童读物又像技术图纸。
男:我看了几页,它的赞助商信息是嵌在非核心位置的,属于“拉动”而非“推动”,读者不反感。有人怀疑是不是 AI 生成的内容,但所有插图都有具体艺术家署名,网站也明确拒绝用 AI 翻译来保证质量。这种对内容的用心,刚好跟 vibe coding 形成对比。
女:我最后想聊一个在学术界挺火的工具。Pluto.jl 1.0 正式发布了。
男:它是 Julia 生态里头的反应式笔记本系统。跟 Jupyter 不一样,它不是线性执行,而是跟踪单元格之间的依赖关系。你改任何一个单元格,它自动更新所有相关的输出,保证整个 notebook 始终处于一致状态。
女:这就解决了 Jupyter 最头疼的顺序依赖问题。你运行到一半改了个前面的变量,后面的结果其实已经过时了,但 Jupyter 不会告诉你。Pluto 直接重新计算,每个 notebook 还自带包环境,导出成独立的 HTML 页面后还能交互。
男:不过很多用户对“输出显示在代码上方”这个默认设计有意见,觉得违反了从上到下的阅读习惯。Marimo,在 Python 生态里头做类似事情的,创始人回应说他们已经改成了默认输出在下方。Pluto 在这方面的设计一直比较固执,部分用户希望能有更多可调节的控制。
女:无论如何,它在教学场景里头慢慢站稳了。从我们聊的法学研究,到游戏地图的快乐,到考古学的耐心,再到代码工具的稳定,似乎大家都在追问一件事情:我们到底要什么样的“智能”或者“辅助”。是盲目信任,还是先保持一段清醒的距离。
男:至少,先把 github.dev 的缓存清理掉。
女:也记得把电视网线拔了。我们今天聊到这儿。感谢收听,欢迎你用泛用型播客客户端订阅我们的节目,下回见。
男:下回见。
参考链接
- AI outperforms law professors in Stanford Law study
- 1-Click GitHub Token Stealing via a VSCode Bug
- The Unreasonable Redundancy of Nature's Protein Folds
- Show HN: I reverse-engineered the world maps of Test Drive III (1990 DOS game)
- 4K years ago, Mohenjo-daro grew more equal over time
- Capstone – multi-platform, multi-architecture disassembly framework
- Roku LT Operating System open source distribution
- Agentic Mfw
- Words of Type
- Pluto.jl 1.0 release – reactive notebook for Julia
