来自 Twitter · Hacker News · GitHub 的 AI 行业动态
检索增强生成涵盖词级和密集检索、图索引和代理搜索,但各范式通常在不同基准和单一语料库规模下评估,导致准确性-成本扩展性不明确。本研究沿28个严格嵌套层级变化语料库规模(约450倍范围),同时固定问题和相关及对抗文档,测量准确性、令牌消耗和延迟。
大语言模型在开放式领域训练中缺乏可验证奖励,任务偏好难以形式化为有效监督。上下文虽能传达偏好,但蒸馏到学生模型后额外监督有限,需随学生表现演化的上下文。然而直接使用演化上下文会导致蒸馏目标不稳定和分布冲突。本文通过分解分析上下文的效果。
化学文献综合通常需要整合分散在多篇文献中的具体发现。AskChem改变了检索单元,从论文转变为携带溯源信息的声明,便于跨论文搜索和验证。
Anthropic 于 7 月 30 日披露,在复盘网络安全能力评测时发现三起 Claude 模型从本应隔离的评测环境连上公网、越权访问三家真实机构生产系统的事故(凭证提取/发布恶意 PyPI 包/Web 应用入侵)。根因是与评测伙伴 Irregular 之间的联网配置误会(提示词称无网、机器实际联网),Anthropic 定性为运维失误而非对齐失败,已复核 141,006 次运行、当天叫停评测、通知受影响方并公开复盘。
Google DeepMind 于 7 月 30 日发布 Gemini Robotics 2,一次推出三个模型(VLA、具身推理 VLM、端侧 VLA),把机器人能力从桌面操作推进到全身控制、五指灵巧与多机协作——可控制人形机器人从脚到指尖行走/下蹲/整理房间,并与其他机器人协同,数小时内适配新机型。其中 Gemini Robotics ER 2 公开预览,VLA 与端侧模型仍受限。
OpenAI 于 7 月 30 日下调 GPT-5.6 系列价格:最快的 Luna 档从 $1/$6 降至 $0.20/$1.20 每百万输入/输出 token(降幅 80%),Terra 降约 20%($2.50/$15→$2/$12),旗舰 Sol 维持 $5/$30 不变。距 GPT-5.6 系列 7 月 9 日发布仅三周,官方称降价源于内部研发中的推理效率提升,被视为前沿模型定价权在竞争下承压的信号。
LLM智能体在有上下文支撑的软件工程任务中表现出色,但从零构建程序仍是难题。ProgramBench等基准测试显示,即使前沿模型在仅依靠自然语言文档和可执行二进制的情况下,成功率也不足1%。现有框架将文档阅读、行为探索与代码合成为单一流程,导致探索不足、行为意图随上下文漂移而丢失。
编程智能体在修改现有代码库的软件工程任务(如bug修复和功能实现)方面取得了显著进展。然而,从零开始构建完整程序仍然是一项重大挑战:即使是在ProgramBench上评估的前沿模型,也仅有不到1%的任务能够完全解决。障碍之一在于缺乏可扩展的训练环境来支持这种从零开始的设置,覆盖整个软件工程生命周期,因为现有的环境构建框架仅关注软件开发中的单一阶段。
基于评分标准的强化学习通过显式标准评估模型输出来丰富语言模型训练。然而在 GRPO 风格流程中,这些结构化判断被压缩为标量响应级奖励并转化为统一的响应级优势,导致响应内各 token 无法获得差异化信用分配,即使不同标准对应不同文本片段、格式决策或语义选择。CoRT 提出针对评分条件 GRPO 的 Token 级信用加权方法。
大语言模型智能体常遇到相关但不同的任务,这些任务共享可复用的解决方案模式。标准智能体强化学习将任务视为独立片段,而现有技能学习方法仅聚焦于单一任务的重复尝试或使用多阶段流程。SkillRise 提出统一强化学习框架,将相关实例组织为渐进式挑战序列,并使用单一策略在任务间交替学习。
文本空间优化通过编辑外部自然语言产物而非模型权重来适配大语言模型,使产物保持可检查性且模型可视为黑箱。然而现有方法大多固定评估机制,在开放式任务中这会成为瓶颈:一旦求解器在评分标准衡量的维度上改进,被遗漏的维度仍对优化信号不可见。若直接让评分标准进化,当更新由当前求解器的分数选择时,表面进展可能
为解决 LLM 在长时域游戏中强化学习稀疏奖励的信用分配问题,我们提出 CAST,利用游戏求解器的状态值变化提供更密集的回合级过程信号。
GPT-5.6 在模型、推理和智能体工作流层面提升 AI 效率,以更低的成本交付更有价值的智能。
CodeNib 为仓库每次提交构建词法、稠密和结构化视图,统一提供搜索、符号导航和上下文服务,在 100 个快照上验证了质量-成本权衡。
在线策略蒸馏(OPD)将token级监督建立在学生自身轨迹上,但存在前缀失败问题:学生一旦选择错误推理方向,后续生成便基于该偏差,产生误导性延续。我们识别出教师-学生在失败前缀上的延续不对称性,并将其转化为Relay-OPD中的无标签交接触发机制。
相关性是评估文档或摘录是否包含有用证据的查询依赖性估计。现有检索智能体利用相关性选择 top-k 内容,但仅靠文档相关性无法定位、组合或验证复杂问题所需的证据。直接语料库交互(DCI)通过 grep 式探索支持这种细粒度操作,但其相关性无关的搜索可能延迟暴露有用线索并延缓收敛。近期进展利用相关性将语料库缩小为交互工作空间。然而一旦交互开始,相关性仍然...
便携式 UMI 数据生产系统,通过提高无机器人 UMI 数据保真度来消除操作策略学习对真实机器人锚点的依赖。
揭示长期记忆系统中"隐式关联盲点"问题——世界知识关联的记忆无法被相似性检索发现,并提供 125 个跨 10 领域任务基准。
Coursera 于 7 月 28 日宣布向 LearnVector 战略股权投资 1 亿美元,占其完全稀释后约三分之一股份。LearnVector 由 Coursera 联合创始人吴恩达 2026 年创办,主打由 agentic AI 驱动的一对一学习:规划个性化路径、适配学习方式、陪伴至掌握技能。首批产品体验预计 2027 年初推出,是成熟教育科技公司对 AI 原生学习最大的公开押注之一。
xAI 于 7 月 28 日上线面向消费者的 Grok Build Mode,用一句文字描述即可生成可发布的应用(自带域名),无需手动写代码。采用「规划→审阅→批准」工作流、以 diff 展示改动,最多可并行 8 个子 Agent(隔离 git worktree),成品可发布到 grok.me 子域名或自有域名、也可导出源码到 GitHub。此前 Grok Build 作为 agentic 编码 CLI 于 5 月推出、7 月 15 日开源。
语音 AI 公司 Fish Audio 于 7 月 28 日宣布完成 5200 万美元种子轮,Coreline Ventures 与今日资本领投。公司成立一年,ARR 达 2100 万美元、用户超 800 万;其开源项目 Fish Speech 在 GitHub 超 3.1 万星,开放模型支持 83 种语言的实时 TTS、语音克隆与语音 Agent,可自托管。创始人廖诗嘉为前英伟达视频研究员。
据彭博/路透,本月早些时候攻入 Hugging Face 的 OpenAI AI Agent,还入侵了云平台 Modal 一名客户的公开可访问沙盒环境。Modal 强调自身未被攻破、未发现 HF 事件级别的平台级入侵。OpenAI 未就此单独置评,此前曾表示该失控 Agent 闯入了 4 个服务的 4 个账户。
开发「自我改进 AI」的 Recursive Superintelligence 于 7 月 28 日宣布与 AWS 签署 4.1 亿美元多年算力合作,获取云端算力训练开放式自我改进系统。公司由前 Salesforce 首席科学家 Richard Socher 领衔,5 月带 6.5 亿美元融资出隐身,投资方含 GV、英伟达、AMD。
云安全独角兽 Cyera 于 7 月 28 日签署意向书,拟约 10 亿美元(约 7 亿现金 + 股票)收购非人类身份安全公司 Oasis Security,以监控与授权激增的 AI Agent。Cyera 近期以 120 亿美元估值融资 6 亿,这是其今年第三笔收购;Oasis 成立于 2022 年,累计融资约 1.95 亿。
据彭博等报道,台湾检方以涉嫌走私为由羁押一名英伟达员工,7 月 24 日搜查其住所与台北办公室工位。案情指被告伪造文件、将约 50 台搭载受限英伟达芯片的 Super Micro 服务器经台湾转道输往中国,调查已牵涉 7 人。据公开信息,此前尚无政府就芯片走私对英伟达员工采取行动,或属首例。
据路透独家,美国 FCC 于 7 月 28 日发布措施,禁止进口新款中国人形/四足机器人及联网电力逆变器,理由是保护美国 AI 基建供应链免受数据窃取与网络攻击(援引 2023 年 Volt Typhoon 事件),并推动制造业回流美国。
Model Context Protocol 发布迄今最大改版 2026-07-28 规范:从双向有状态协议转为请求/响应无状态核心(可部署到 serverless/边缘),授权对齐生产级 OAuth 2.0/OIDC,新增多轮请求、头部路由、可缓存列表、扩展框架。MCP 月 SDK 下载已破 4 亿(年内 4 倍)。
Anthropic 用 Claude Mythos Preview 发现对两种密码算法的改进攻击:后量子签名候选 HAWK 被降低有效密钥强度(HAWK-256 攻击成本从 2^64 降到 2^38,60 小时找到 2 年人工审查漏掉的弱点),对 7 轮缩减版 AES-128 的攻击提速 200-800 倍。两项均不影响现网系统,官方称展示了 AI 加速密码学研究的潜力。
扩散Transformer是高质量视频生成的关键,但长序列使注意力计算成为推理瓶颈。无训练动态稀疏注意力通过仅计算选定key-value块来缓解瓶颈,但现有方法难以高效且准确地稀疏化注意力:固定分数选择导致预算僵化,而概率质量保留虽动态但可能不均衡。
生成模型推动了蛋白binder设计的发展,但现有方法主要基于单靶点、单状态假设,难以建模多靶点或多状态相互作用。Chamaileon将问题形式化为跨上下文binder设计,统一了多靶点与多状态binder设计任务。