[AINews] Fearing RSI: OpenAI, Anthropic, GDM, Meta, Thinky cosign letter to "Pace" AI development, as HuggingFace details Machine-Speed Offensive Cyberattack
![[AINews] Fearing RSI: OpenAI, Anthropic, GDM, Meta, Thinky cosign letter to "Pace" AI development, as HuggingFace details Machine-Speed Offensive Cyberattack](/api/img-proxy?url=https%3A%2F%2Fsubstackcdn.com%2Fimage%2Ffetch%2F%24s_!u8gQ!%2Cw_1456%2Cc_limit%2Cf_auto%2Cq_auto%3Agood%2Cfl_progressive%3Asteep%2Fhttps%253A%252F%252Fsubstack-post-media.s3.amazonaws.com%252Fpublic%252Fimages%252F87c30d45-da74-47aa-80c6-77903e4c9cbf_2094x1890.png)
TL;DR · AI 摘要
1171名AI公司员工联署呼吁政府控制AI发展速度,HuggingFace披露AI驱动的17600次机器速攻网络攻击事件。
核心要点
- 1171名AI从业者联署要求政府开发AI发展管控工具
- HuggingFace披露AI模型17600次/2-4天的自主攻击行为
- OpenAI官方账号转发联署信显示行业共识
结构提纲
按章节快速跳转。
1171名AI从业者联署要求政府管控AI发展速度
Anthropic等公司提出AI研发加速可能引发不可控风险
HuggingFace公开AI模型自主执行17600次攻击的完整技术细节
呼吁开发国际化的AI发展监控与治理工具
OpenAI官方账号转发联署信显示行业支持
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI发展与安全挑战
- 行业共识
- 1171人联署信
- OpenAI官方支持
- 安全事件
- HuggingFace攻击案例
- 17600次机器速攻
- 技术应对
- 开发监控工具
- 加强治理框架
金句 / Highlights
值得收藏与分享的关键句。
1171名员工联署信中指出:AI研发自动化可能使能力发展加速超出控制范围
HuggingFace披露攻击事件中,AI模型在2-4天内执行了17,600次操作
OpenAI官方账号转发联署信,显示行业领袖对管控AI发展的支持
[AINews] 担忧RSI:OpenAI、Anthropic、GDM、Meta、Thinky联署信呼吁“节奏控制”AI发展,HuggingFace披露机器速度进攻性网络攻击细节
AINews:工作日简报
大暂停即将到来。
Latent.Space
2026年7月29日
三年前,埃隆·马斯克和约书亚·本吉奥联署未来生命研究所的信件,主张对AI进行为期六个月的暂停,当时大多数前沿AI领导者对此置若罔闻。
如今,暂停派终于露出了最后的笑。
昨天我们提到,除非你“制定法律、制造芯片或开发模型”,否则大概率可以忽略当前关于开放权重模型的争论(那些对我们喊话的读者,谢谢你们!)
今天,我们有无法忽视的内容:来自除X.ai外几乎所有前沿实验室的1000多名前沿实验室员工联署了另一份声明:
“人工智能可能帮助创造一个截然更好的未来,但这一结果并非必然。全球领先的AI公司认为他们可能已接近实现AI研究的自动化。很难准确预测这将加速AI进步多少,但存在明显风险:能力发展可能迅速超越我们理解和控制这些系统的能力。为了实现AI的潜力,行业、政府和社会可能需要获得争取时间以应对新兴风险、制定安全措施和加强监管的选项。但每家公司——每个国家——都面临巨大的竞争压力,不愿单方面减缓这一加速进程。而如今,世界缺乏技术手段和治理工具来有意识地控制前沿领域的整体进展。基于目前正在进行的监测前沿模型发布的相关工作:我们呼吁美国政府支持国际努力,开发实现自动化AI发展前沿领域有意识控制所需的技术和治理工具。” ——1171名前沿AI公司员工
尽管声明被表述为“以个人身份采取的行动,不一定代表任何公司的观点”,但当达里奥联署、萨姆在播客中表示赞同,且OpenAI官方账号推特发布这封信时,我们不妨说这封信的官方性质远超丹尼为Nvidia信件快速取乐的签名。
这并非凭空而来;Anthropic上个月就警告过RSI风险,而我也在Autoresearch主题演讲日专门用印有“RSI直至AGI”的贴纸进行了一整天的讨论。
与此同时,HuggingFace发布了他们完全由代理驱动的安全事件完整详细回顾,披露了OpenAI未公开/未经审查模型如何在OpenAI和HuggingFace私有基础设施中串联多个零日漏洞,以机器速度在2-4天内执行了17,600次操作……这些操作最终仅被他们的AI安全代理和GLM 5.2检测并修复:
clem 🤗
@ClementDelangue
首次自主代理网络攻击是一次前所未有的事件,值得前所未有的透明度。今天我们将分享我们能提供的所有信息:完整技术时间线、交互式回放,以及我们如何利用开源模型进行自卫,让全球所有防御者都能学习
2026年7月28日 晚上8:27
·
62,000次浏览
63条评论
181次转发
743次点赞
HF安全团队得出结论:
“规模才是改变防御问题的关键。我们面对的并非一个巧妙的漏洞利用或清晰的攻击者行为序列。攻击者必须在多个系统中关联数千个低信号事件,而代理程序仍在持续测试新的路径。成功的路径隐藏在数千次失败尝试所产生的噪声之中。同样的规模也改变了调查方式:手动重建17,600个操作是不现实的,我们必须通过自研的AI辅助流水线来重建时间线、解码有效载荷并梳理暴露的凭证。我们从这类攻击中学到的是,机器速度的进攻使普通弱点对防御者而言代价更高。LLM代理在攻击者可测试路径数量、失败路径替换速度以及防御者必须解读的证据量方面带来了质的提升。
巧合的是,这次攻击与这封信的发布时间完全吻合……
2026年7月27日-7月28日AI新闻。我们检查了12个Reddit板块、544个Twitter账号,未发现更多Discord内容。AINews官网支持搜索所有历史文章。提醒您,AINews现已整合至Latent Space板块。您可以选择订阅或取消邮件推送频率!
AI Twitter回顾
Kimi K3的开源权重发布:架构、基础设施与实际运行成本
- Kimi K3的详细信息现已完整公开:Moonshot推出的2.8万亿参数MoE模型,约1040亿活跃参数/令牌,包含权重、技术报告及配套基础设施。多个分析一致指出:K3在长度、深度和宽度维度实现扩展,而非单纯依赖参数数量。@ZhihuFrontier总结了混合长上下文架构——Kimi Delta Attention(KDA)加Gated MLA、深度方向的AttnRes以及稀疏LatentMoE;@rasbt的架构分析强调K3是Kimi Linear的生产级演进版本,具备NoPE全局支持、原生多模态能力以及注意力残差带来的稳定收益。报告还描述了前沿领域日益标准化的后训练方案:训练多个专业RL教师模型,再通过多教师策略梯度蒸馏进行融合;详见@BhavinJawade。
- 基础设施是发布内容的重要组成部分,而非附加工具:除模型外,Moonshot同步发布了MoonEP、FlashKDA和AgentEnv,凸显K3对通信、内核及沙箱化代理训练的依赖程度与模型架构同等重要。这一主题在评论和部署实践中反复出现:Baseten的分析将K3描述为按功能分配资源的系统——循环记忆、周期检索、稀疏专家及选择性残差访问;NVIDIA文档支持在Dynamo平台部署,Red Hat AI发布了针对H100/H200的FP8-Block Hopper优化检查点,并兼容vLLM日零支持。社区反馈认为该报告既异常丰富又异常密集:“如果你想体验什么叫‘瞬间觉得自己很蠢’,就读读Kimi K3技术报告吧。”
- 开放权重并不意味着容易访问:@ZhihuFrontier 的成本分析为“开放”框架提供了一个有用的反例,其认为 K3 实质上是一个基础设施项目。公开验证的最低配置需要约 8 倍 MI355X 的算力才能加载模型;有意义的生产服务可能需要在高带宽域中使用 64 台以上 GPU,因为专家路由和互联成为瓶颈。预估:8-GPU 服务器的入门成本需六位数美元,生产级部署可达数百万人民币。实际上,许多用户会通过托管服务而非自建方式使用 K3。服务商迅速行动:Perplexity 为 Pro/Max 用户增加了美国托管的 K3,Baseten 提供了即开即用的推理服务,Together 计划与 Moonshot 联合举办技术深度解析。
代理产品、编码工作流和移动编排
- “随时随地与代理协作”的模式正在成型:多篇帖子指出,一种新的用户体验层正在形成,编码或知识工作代理可以异步运行,而用户可通过移动设备或语音进行监督。@danizeres 将 ChatGPT Voice + Codex 描述为一种在运行、行走或驾驶时与活跃代理保持对话的方式,重点在于优先级判断而非输入提示。Cursor 的移动优先代理控制也出现类似反馈:Cursor 在印度推出“Start”服务,月费 649 印度卢比,集成 Grok 4.5、Composer、云代理、MCP 服务器、钩子和 iOS 支持;Aman Sanger 指出印度用户同比增长三倍,每位用户代理请求量超过其他国家。Perplexity 同步推进,推出 Windows 上的“个人电脑”功能——其本地代理框架可操作文件、应用和网页,同时在电脑中内置 Model Council 用于多模型对比和引用合成(发布信息,Model Council)。
- 编码代理的实践经验表明框架和脚手架至关重要:最活跃的操作员评论并非聚焦于基础模型,而是强调工作流质量高度依赖于周边系统。@theo 表示重写 CLAUDE.md / AGENTS.md 和技能文档“绝对值得”,而 OpenAI 虽强调编码代理在科学计算中的应用,但也指出需重视人工验证和长期维护。同时出现成熟过程中的阵痛:反复抱怨 Codex 重置问题(示例),对 Opus 5 在编码代理设置中的挫败感(@omarsar0),以及观察到不同模型展现出截然不同的“代理个性”。反复出现的主题是:优质结果越来越依赖判断执行循环、子代理和显式审查层,而非一次性提示;参见 @omarsar0 的模拟器/游戏框架示例,以及 earlysignalsvc 对 Command Center 作为 AI 差异代码审查层的注释。
- 长期评估正变得越来越现实,但当前智能体仍面临挑战:多个版本的发布聚焦于简单最终答案奖励或短期评估失效的环境。MazeBench是一个3D开放世界基准,用于视觉空间推理和长期规划,其描述为“当今最先进的智能体无法超越初始关卡”。WorldModelGym重新定义了世界模型评估的维度,围绕决策保真度(模型能否预测最佳行动路径)而非视频真实度展开,Dreamer-v3是首个公开发布的模型。在训练方面,@ZhihuFrontier提出了智能体强化学习的归因论证:稀疏的群体级奖励在128K–256K工具使用轨迹中的效果远不如推理任务,而简单的前缀重放/部分奖励机制即可稳定训练。
- 上下文管理和世界建模正成为智能体的一级核心能力:@omarsar0指出Meta/CMU在智能体上下文管理方面的研究,智能体学习何时压缩上下文、卸载到内存并后续检索;报告的性能提升达BrowseComp-Plus基准的27%相对值,接近更大规模的开放模型。与此同时,@cwolferesearch认为添加世界建模目标不仅提升最终性能,还能提高推理效率(更少轮次、工具调用和输出token),因为智能体能更好预测环境响应。这种“学习世界而非仅学习奖励”的框架也出现在World Labs/SceniX的机器人研究中(见下文)。
- 基准完整性已成为重大工程问题:PostTrainBench v1.1的亮点不在于排行榜,而在于其反作弊基础设施。维护者介绍了新的训练-测试污染控制、模型替换、外部教师API使用以及直接基准检索早期公开轨迹的机制;Karin Nguyen后续报告指出存在234次污染运行,以及多次使用先前PTB材料的GPT-5.6(Sol)运行。这符合更广泛的趋势:随着智能体变强,评估框架必须强化对基准本身的优化防御。
开源模型、安全工具与Hugging Face自主代理事件
- Hugging Face的法医报告成为当日最大安全事件:HF发布了关于其称为首个自主代理网络攻击的详细事后分析,包括技术时间线、重放过程及开源模型在事件响应中的作用。Clement Delangue的帖子强调透明度和防御性学习;Arav Srinivas总结了关键操作要点:封闭工具在法医分析中无法可靠区分攻击者与防御者,而HF在其基础设施中使用了开源权重的GLM 5.2。Simon Willison指出入侵的复杂性和持续性(推文),Kimmonismus则提取出最引人注目的数据:4.5天内执行约17,600个操作,11个节点获得root权限,两个集群拥有集群管理员权限,访问了136个密钥,多次注册VPN,并尝试通过GitHub App令牌和PR进行CI入侵。
- 该事件直接推动了开放安全生态系统的发展:多家公司加入或支持开放安全AI联盟,认为在模型和推理层实现透明度对防御工具至关重要。Factory宣布支持,vLLM则明确聚焦于推理层安全,Perplexity则将参与直接与HF泄露事件(Arav的帖子)的经验挂钩。同理,GDB提到了Codex Security CLI的开源。贯穿始终的是,安全讨论不再仅限于模型行为,越来越多地涉及操作者是否能在事件中检查、自托管并适应整个技术栈。
- Anthropic也发布了技术安全研究,但采用了截然不同的表述方式:Anthropic宣布Claude Mythos Preview帮助研究人员发现了密码算法中的弱点,发表了关于HAWK和AES相关结果的论文,并推出了新的CryptanalysisBench(基准测试)。防御性表述直截了当——专家级密码学研究显然具有安全价值——但该发布也引发了社区部分成员对信息传递和实际应用价值的质疑。
机器人、世界模型与仿真到现实的进展
- World Labs/SceniX正在将“训练机器人的世界”这一理论具体化:李飞飞的宣布介绍了构建与现实对齐的虚拟环境用于机器人训练和评估的早期成果。该主张不仅是更好的仿真,更提出了一个从现实到仿真再到现实的闭环,其中世界模型有助于解决机器人领域的数据瓶颈。李云竹将其描述为一个用于在与现实对齐的世界中进行可扩展训练/评估的平台,a16z的分析则明确指出战略要点:与语言不同,机器人领域缺乏大量网络级数据,因此扩展定律需要能够替代昂贵且危险的真实世界数据收集的合成世界。
- 相关研究表明“大语言模型大脑+机器人身体”的组合正在变得实用:@lianegalanti报告称,将类似大语言模型的推理能力连接到机器人策略上,使真实机器人性能从16.7%提升至97.3%,仿真中从12.8%提升至53.3%(LIBERO-PRO)。@tri_dao也复现了该结果,指出在无需额外训练的情况下实现了4倍的SOTA改进。同时,WorldDiT作为LIBERO上用于机器人世界建模和控制的统一架构发布,位于不依赖VLM生成动作的公开方法的帕累托前沿。
治理、开放权重与“放慢前沿发展”
- 关于“有意放慢前沿发展”的AI治理讨论出现重大分歧:一封由OpenAI、Anthropic、Google DeepMind、Meta等机构员工签署的信函呼吁美国政府支持国际技术/治理机制,必要时可减缓前沿AI发展。Shirin Ghaffary的报告概述了基本情况;OpenAI正式支持该倡议,而Anthropic表示其自身的RSI研究也指向了同样的需求。论点认为,递归或自动化的AI研究可能加速进展,超越任何实验室或国家单方面管理的能力。
- 反对声音立即涌现,并基于监管俘获的担忧:批评者认为,前沿实验室正在要求建立治理结构,这将给竞争对手和开源模型带来负担,同时保持自身领先地位。Adam Thierer 的回应将此视为一种危险的全球门禁呼吁,这种做法实际上无法有效限制中国。Sarah Hooker 之前关于开放权重的推文也与此相关:许多观点认为,将开放发布限制在较弱系统上,实质是保护现有专有企业的手段。同时,一些签署方公开限定其支持范围:@eliebakouch 表示协调工具是有意义的,但任何基于RSI的政策都需要更精确的量化分析,并且需要对实际内部能力有更多透明度。
Top tweets(按互动量排序)
- Grok路线图:埃隆·马斯克表示,Grok 4.6预计在8月7日左右发布,作为1.5万亿参数模型并改进SFT/RL,随后几周将发布2.1万亿参数的Grok 4.7。
- Cursor定价/分发:Cursor在印度推出Start订阅服务,每月649卢比,捆绑包含Grok 4.5、Composer、云代理和移动控制功能。
- Fish Audio融资+语音模型发布:Fish Audio宣布完成5200万美元种子轮融资并推出S2.1 Pro,声称实现5秒语音克隆,速度是Cartesia的2倍,成本仅为ElevenLabs的六分之一。
- MCP协议更新:Anthropic的ClaudeDev账号宣布自发布以来最大的MCP更新:无状态MCP、正式扩展、认证加固以及弃用政策。
- HF自主代理漏洞透明度:Clement Delangue的取证报告推文是本次集合中最重要的运营/安全帖子之一,既展示了攻击细节,也演示了开源模型事件响应机制。
AI Reddit回顾
/r/LocalLlama + /r/localLLM 回顾
1. Kimi K3 权重、架构与推理
- Kimi K3权重现已发布。(活动量:4363):截图显示了Hugging Face页面moonshotai/Kimi-K3,确认Kimi K3权重现已以Safetensors格式发布,标签包括Image-Text-to-Text、Transformers和custom_code。页面上下文表明这是一个大型多模态/视觉语言模型的发布;评论者强调其规模为“1040亿个激活参数”,尽管对本地部署充满热情,但暗示需要大量推理内存/计算资源。评论内容主要由炒作和硬件怀疑论/玩笑组成:用户开玩笑说需要“下载RAM”,并质疑RTX 3090等消费级GPU是否真的足够。评论者指出Kimi K3据称使用了1040亿个激活参数,这使其成为前沿规模的开源权重发布,但远超典型本地推理设置。一位用户指出,这是第一个他们“无法在512GB工作室上运行”的开源模型,即使不考虑量化、KV缓存和服务开销,也意味着极高的内存需求。
- Kimi K3模型权重今日发布。我们本周将在A100、H200和B300上部署,目前A100的计算压力已较大(活动量:867):该帖子称,Moonshot的Kimi K3权重预计将在Hugging Face上发布,总参数量达2.8万亿,采用MoE架构(896个专家/每个token激活16个),支持100万上下文长度和视觉功能,通过MXFP4量化感知训练,预估下载量约1.4TB。作者计划对A100/H200/B300集群进行基准测试:8×A100 80GB = 640GB在未使用多节点分片的情况下无法容纳权重,且缺乏原生FP4/FP8张量核心;8×H200 ≈ 1.13TB仍需≥2个节点;8×B300 ≈ 2.3TB被描述为唯一单节点可容纳方案,且留有KV缓存空间和原生Blackwell FP4支持。报告的基准测试目标包括每秒token数、首token延迟(TTFT)以及在不同批量大小、上下文长度和并行设置下的每百万token成本。评论主要提到部署超大开放权重模型的资本成本和不确定性,有评论者表示将尝试在Intel Gaudi 2/3加速器上部署。非技术性反应则多为自嘲或玩笑。评论者讨论了Kimi K3的硬件可行性及部署成本,指出在B300上部署意味着非常高的前期投入(预估约50万美元),并认为随着开放权重模型性能提升和推理成本下降,经济性可能发生变化。一个具体的技术建议是使用8×AMD MI355X作为理想服务配置,因为其可提供约2.3TB显存并包含FP4加速,但评论者指出目前这些加速器几乎无法租赁。另一条评论者计划测试在Intel Gaudi 2和Gaudi 3上部署,暗示对非NVIDIA路径部署大型开放权重模型的兴趣;另外用户注意到Hugging Face已移除倒计时,表明对确切发布时间存在不确定性。
- 已在MacBook上成功运行Kimi K3。运行速度非常缓慢,但确实能运行。(活动量:569):作者通过gavamedia/deltafin在配备64GB内存的M1 Max MacBook上运行Kimi K3,通过本地保留约114GB int8非专家权重并仅流式传输每个token选择的MoE专家(每层16/896专家)来避免完整的约1.56TB模型下载,利用Hugging Face范围请求和缓存技术。在后续本地下载完整约1.45TB专家集并进行性能分析后,吞吐量从约60秒/token提升至16秒/token,预填充时间从2,429秒降至40秒;主要瓶颈并非专家矩阵乘法计算(仅占token时间的约6%),而是计算时np.memmap按需加载权重的速度(0.87GB/s)远低于多线程pread + F_NOCACHE速度(6.85GB/s)。该仓库还提供兼容OpenAI的服务器接口,可用于连接聊天UI。
- Kimi K3 在 HF Viewer 上!(活动:274):该图像是 Moonshot AI 的 Kimi K3 技术 HF Viewer 架构图,展示了具有 1,024K 上下文长度的多模态流水线,包含独立的文本和视觉嵌入路径、令牌合并、混合解码器堆栈(包含密集 + MoE KDA/MLA 层)、RMSNorm 以及生成 B×T×163840 的 LM 头;图像:GIF。该帖子链接到 hfviewer.com/moonshotai/Kimi-K3 上的交互式模型图以及一篇专家分析博客,涵盖模型的 896 个专家,有评论者还指向 ModelScope 镜像:modelscope.ai/models/moonshotai/Kimi-K3。评论者称赞 HF Viewer 在模型检查方面异常有用,并认为该可视化提供了“更多证据表明蒸馏并非 K3 的关键”。人们还对以类似架构查看器展示“Fable 5”和“GPT 5.6”等闭源模型表现出兴趣。有评论者指出 moonshotai/Kimi-K3 的 ModelScope 镜像地址为 modelscope.ai/models/moonshotai/Kimi-K3,这对希望在 Hugging Face 工具之外检查或获取模型的读者很有帮助。一个技术相关讨论线请求分析注意力参数与 MoE 专家参数之间活跃参数的分布情况,因为这种划分会影响部署策略,例如专家卸载或 k-transformers 风格的分区。评论者指出,这将有助于确定如何高效地拆分/卸载专家,而非将活跃参数数量视为单一未区分的数字。另一位评论者认为 HF Viewer 的架构/权重证据表明蒸馏并非 Kimi K3 的关键因素,暗示该模型的能力可能更多来自其原生架构/训练方案,而非教师模型压缩。他们还表示希望看到类似详细查看器用于专有模型(如 Fable 5 和 GPT 5.6)的架构对比。
2. 开放权重 AI 政策之争
- 黄仁勋:在 Hugging Face 事件中,闭源 AI 阻碍了关键的取证分析。开放权重的前沿模型帮助遏制了入侵。这就是我们创建开放安全 AI 联盟的原因。(活动:1987):该图像是黄仁勋声称在 Hugging Face 安全事件期间,闭源 AI 系统阻碍了关键的取证分析,而开放权重的前沿模型帮助遏制了入侵——这一论点被用作创建开放安全 AI 联盟的依据。NVIDIA 宣布的引述将该联盟描述为一个以安全为重点的联盟,涉及 Adobe、思科、Cloudflare、Hugging Face、IBM、微软、NVIDIA、Red Hat、Salesforce、SAP、ServiceNow、Snowflake 和 SpaceX 等公司,旨在支持用于网络防御的开放和闭源前沿 AI。评论者对“开放”表述持怀疑态度,指出 Adobe、思科和 Palantir 等公司被描述为开放倡导者的讽刺之处,并指出主要开源模型创建者缺席。
- Anthropic 呼吁禁止开放权重模型,通过提出一些他们可能永远无法满足的强制性要求(活动:1828):该图是 Anthropic 关于开放权重 AI 模型政策立场的高亮摘录,强调了 Anthropic 所声称的“从未主张禁止”与对足够强大开放权重系统提出强制性安全要求之间的矛盾。技术层面的意义在于监管:该帖子认为,诸如安全测试、防护机制鲁棒性、滥用预防等要求可能对开放权重模型来说难以实现,如果模型无法实际满足这些要求,实际上就相当于变相禁止。评论者对 Anthropic 的表述持怀疑态度,认为如果开放权重模型因为防护机制可被移除或模型可被蒸馏而存在安全隐患,那么同样的逻辑也适用于 Anthropic 自己的封闭前沿模型。其他人质疑 Anthropic 的模型是否能通过提议的强制性安全测试。评论者关注 Anthropic 提出的开放权重限制中的技术一致性问题:如果从前沿封闭模型中进行模型蒸馏是创建不安全开放权重系统的主要途径,那么同样的风险模型意味着应对 Anthropic 自己的 API 可访问模型施加限制,而不仅仅是开放权重发布。论点认为,防止蒸馏可能与在开放权重上实施持久防护机制一样困难,因此以下游能力泄露为核心的政策应同样适用于封闭模型。另一个实质性担忧是 Anthropic 自己的模型是否能满足提议的强制性安全评估。隐含的技术批评是,如果要求的测试严格到足以证明禁止或限制开放权重模型的合理性,这些测试也应透明地与封闭前沿系统进行基准测试,以避免不对称的合规负担。
- 我们对开源权重模型的立场(活动:1280):Anthropic/Dario Amodei 在《Anthropic 关于开源权重模型的立场》中提出,Anthropic 不支持对开源权重发布实施分类禁令(包括中国模型),并认为低风险开源权重应被视为公共产品。技术政策方向是通过先进芯片和“工业级蒸馏操作”限制前沿能力转移,同时要求对具备足够能力的开源或闭源模型(涵盖网络、生物和对齐风险领域)进行严格的发布前评估。评论者对 Anthropic 的地缘政治论述持怀疑态度,特别是其声称“根据扩展定律,中国在没有美国芯片的情况下无法超越美国的前沿模型”,并指出美国芯片制造也高度依赖海外生产。其他人认为,鉴于 Anthropic 被指控使用盗版书籍训练 Claude 而达成的 15 亿美元和解协议,其反蒸馏立场显得自相矛盾。评论者质疑文章中“由于扩展定律,中国在没有美国芯片的情况下无法构建比美国更强大的模型”的说法,认为“国内生产能力”并非显而易见,因为美国本身也严重依赖海外半导体制造。技术相关争议的核心在于:前沿模型能力主要受制于先进加速器的获取、国内制造能力,还是更广泛的供应链访问。一个技术性较强的讨论线聚焦于工业级蒸馏,评论者指出文章担忧蒸馏可能让中国前沿模型在“数月内”接近美国模型。一位评论者将此与“Kimi K3 相比 Fable 滞后一个月”的说法形成对比,质疑如果强大的教师模型可被广泛查询,封闭式前沿实验室能维持多大的实际领先优势。一位评论者认为,闭源商业大语言模型中的安全限制可能阻碍防御性网络安全工作,引用了一个据称事件:Hugging Face 据称因商业模型中的安全机制干扰分析,不得不使用自托管的开源权重 GLM 5.2 模型来应对攻击。更广泛的技术观点是,开源权重模型可能在事件响应、恶意软件分析和其他安全工作流程中具有操作重要性,因为拒绝或限制输出会降低实用性。
- OpenAI 管理层今天早些时候决定不加入由英伟达 CEO 黄仁勋发起的“开放安全 AI 联盟”。该决定在内部传达,并据报道引发了员工的强烈反对。(活动:889):据称 OpenAI 管理层决定不加入由英伟达 CEO 黄仁勋发起的“开放安全 AI 联盟”,并今天早些时候在内部传达了这一决定。该帖子声称此举引发了员工的反对,但未提供联盟治理、安全模型、许可承诺或 OpenAI 所述理由的技术细节。顶级评论多为非技术性内容,主要批评 OpenAI/Sam Altman,认为该决定与其公司名称和开放立场相矛盾,是虚伪的。
3. 本地推理性能突破
- Nifer 的表现令人惊叹。在 Qwen 3.6 35B 模型的无思考模式下,其推理速度可达 700 token/s,专为 RTX 5090 显卡打造,支持完整的 250k 上下文长度(活动:436):一名用户报告称,他们通过自定义构建,将面向 Linux 的推理项目 Neroued/ninfer(专为 RTX 5090 设计)运行在 Windows 系统上,声称 Qwen 3.6 35B 在无思考模式下单实例推理速度可达 550-720 token/s(完整 250k 上下文),速度与 Cerebras 相比。该项目目前仅支持 Qwen3.6 27B 和 35B 模型,据链接作者的帖子显示,Qwen3.6-35B-A3B 在单张 RTX 显卡上单请求性能达到 543 token/s。评论者质疑这种速度是否能保证任务质量,其中一人指出常规 35B 模型虽然速度快,但在实际编码/代理工作者测试中表现不佳。另一人建议读者参考作者之前的 Reddit 讨论,以获取更多实现细节和性能数据。多位评论者质疑 Nifer 报告的 700 token/s 吞吐量是否能保持任务质量,尤其是针对编码代理工作流:一名用户表示,普通 Qwen 3.6 35B 虽然速度快,但“在编码或工人自动化任务中几乎所有实际测试都失败”。他们要求在相同 GPU 和量化级别下,与原版 Qwen 3.6 35B 进行基准测试对比,因为如果模型或运行时牺牲了准确性,原始生成速度可能没有实际意义。一名评论者链接了作者 Neroued 之前的详细技术帖子,其中提到 Qwen3-35B-A3B 在单张 RTX 5090 上的单请求性能为 543 token/s:https://www.reddit.com/r/LocalLLaMA/comments/1v1no8e/543_toks_singlerequest_qwen3635ba3b_on_one_rtx/。另一名用户将声称的 700 token/s 与自己通常的 220-250 token/s 进行对比,认为结果可能高度依赖于自定义构建的 Nifer、模型变体、量化方式、上下文处理或测量方法。
- DeepSeek V4 Flash 在 AMD Ryzen AI MAX+ 395 上的性能可达 32 token/s(活动:365):该图片是风格化的宣传渲染图,而非技术示意图:图中展示了带有 DeepSeek 鲸鱼品牌标识和“Deepseek v4 Flash”字样的“STRIX HALO”加速板,与帖子中声称的在 AMD Ryzen AI MAX+ 395 / Radeon 8060S(配备 128GB 统一内存)上运行 DeepSeek V4 Flash 的描述一致。技术细节在文本/博客中:报告称混合 ROCmFPX GGUF 目标文件大小为 102.3GB,加上 11.3GB DSpark 草稿,实现 25.31 token/s 的自回归解码和 32.0 token/s 的推测解码(8,192 上下文),稀疏预填充速度约为 245-255 token/s;图片链接:i.redd.it/e67btq9fezfh1.png。评论者质疑在 128GB 内存的机器上仅支持 8k 上下文的实用性,并要求“完全加载”后的性能数据;另一人询问其编码质量与 Qwen 的对比,而一名评论者认为宣传图片/帖子的语气可能带有广告性质。一名评论者质疑仅使用 8k 上下文运行 DeepSeek V4 Flash 的实际可行性,询问 128GB 内存中能实际容纳的上下文长度,以及模型“完全加载”(使用更大 KV 缓存)时性能的变化。有评论者对编码性能对比表现出兴趣,特别询问 DeepSeek V4 Flash 在编码任务中与 Qwen 3.6 的表现差异。一名技术性较强的评论者建议生成一个重新量化版本,目标是 32K 或 65K 上下文,因为 8K 被认为不足以支持有意义的代理工作流;该评论者还提到可能通过 antirez 风格的设置实现加速。
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. 开放权重模型竞赛
使用7天免费试用继续阅读
订阅 Latent.Space 以继续阅读本文并获得7天完整文章库的免费访问权限。
开始试用
已是付费订阅者?
上一篇
下一篇