来自 Twitter · Hacker News · GitHub 的 AI 行业动态
LLM智能体在有上下文支撑的软件工程任务中表现出色,但从零构建程序仍是难题。ProgramBench等基准测试显示,即使前沿模型在仅依靠自然语言文档和可执行二进制的情况下,成功率也不足1%。现有框架将文档阅读、行为探索与代码合成为单一流程,导致探索不足、行为意图随上下文漂移而丢失。
编程智能体在修改现有代码库的软件工程任务(如bug修复和功能实现)方面取得了显著进展。然而,从零开始构建完整程序仍然是一项重大挑战:即使是在ProgramBench上评估的前沿模型,也仅有不到1%的任务能够完全解决。障碍之一在于缺乏可扩展的训练环境来支持这种从零开始的设置,覆盖整个软件工程生命周期,因为现有的环境构建框架仅关注软件开发中的单一阶段。
基于评分标准的强化学习通过显式标准评估模型输出来丰富语言模型训练。然而在 GRPO 风格流程中,这些结构化判断被压缩为标量响应级奖励并转化为统一的响应级优势,导致响应内各 token 无法获得差异化信用分配,即使不同标准对应不同文本片段、格式决策或语义选择。CoRT 提出针对评分条件 GRPO 的 Token 级信用加权方法。
大语言模型智能体常遇到相关但不同的任务,这些任务共享可复用的解决方案模式。标准智能体强化学习将任务视为独立片段,而现有技能学习方法仅聚焦于单一任务的重复尝试或使用多阶段流程。SkillRise 提出统一强化学习框架,将相关实例组织为渐进式挑战序列,并使用单一策略在任务间交替学习。
文本空间优化通过编辑外部自然语言产物而非模型权重来适配大语言模型,使产物保持可检查性且模型可视为黑箱。然而现有方法大多固定评估机制,在开放式任务中这会成为瓶颈:一旦求解器在评分标准衡量的维度上改进,被遗漏的维度仍对优化信号不可见。若直接让评分标准进化,当更新由当前求解器的分数选择时,表面进展可能
为解决 LLM 在长时域游戏中强化学习稀疏奖励的信用分配问题,我们提出 CAST,利用游戏求解器的状态值变化提供更密集的回合级过程信号。
GPT-5.6 在模型、推理和智能体工作流层面提升 AI 效率,以更低的成本交付更有价值的智能。
CodeNib 为仓库每次提交构建词法、稠密和结构化视图,统一提供搜索、符号导航和上下文服务,在 100 个快照上验证了质量-成本权衡。
在线策略蒸馏(OPD)将token级监督建立在学生自身轨迹上,但存在前缀失败问题:学生一旦选择错误推理方向,后续生成便基于该偏差,产生误导性延续。我们识别出教师-学生在失败前缀上的延续不对称性,并将其转化为Relay-OPD中的无标签交接触发机制。
相关性是评估文档或摘录是否包含有用证据的查询依赖性估计。现有检索智能体利用相关性选择 top-k 内容,但仅靠文档相关性无法定位、组合或验证复杂问题所需的证据。直接语料库交互(DCI)通过 grep 式探索支持这种细粒度操作,但其相关性无关的搜索可能延迟暴露有用线索并延缓收敛。近期进展利用相关性将语料库缩小为交互工作空间。然而一旦交互开始,相关性仍然...
便携式 UMI 数据生产系统,通过提高无机器人 UMI 数据保真度来消除操作策略学习对真实机器人锚点的依赖。
揭示长期记忆系统中"隐式关联盲点"问题——世界知识关联的记忆无法被相似性检索发现,并提供 125 个跨 10 领域任务基准。
Coursera 于 7 月 28 日宣布向 LearnVector 战略股权投资 1 亿美元,占其完全稀释后约三分之一股份。LearnVector 由 Coursera 联合创始人吴恩达 2026 年创办,主打由 agentic AI 驱动的一对一学习:规划个性化路径、适配学习方式、陪伴至掌握技能。首批产品体验预计 2027 年初推出,是成熟教育科技公司对 AI 原生学习最大的公开押注之一。
xAI 于 7 月 28 日上线面向消费者的 Grok Build Mode,用一句文字描述即可生成可发布的应用(自带域名),无需手动写代码。采用「规划→审阅→批准」工作流、以 diff 展示改动,最多可并行 8 个子 Agent(隔离 git worktree),成品可发布到 grok.me 子域名或自有域名、也可导出源码到 GitHub。此前 Grok Build 作为 agentic 编码 CLI 于 5 月推出、7 月 15 日开源。
语音 AI 公司 Fish Audio 于 7 月 28 日宣布完成 5200 万美元种子轮,Coreline Ventures 与今日资本领投。公司成立一年,ARR 达 2100 万美元、用户超 800 万;其开源项目 Fish Speech 在 GitHub 超 3.1 万星,开放模型支持 83 种语言的实时 TTS、语音克隆与语音 Agent,可自托管。创始人廖诗嘉为前英伟达视频研究员。
据彭博/路透,本月早些时候攻入 Hugging Face 的 OpenAI AI Agent,还入侵了云平台 Modal 一名客户的公开可访问沙盒环境。Modal 强调自身未被攻破、未发现 HF 事件级别的平台级入侵。OpenAI 未就此单独置评,此前曾表示该失控 Agent 闯入了 4 个服务的 4 个账户。
开发「自我改进 AI」的 Recursive Superintelligence 于 7 月 28 日宣布与 AWS 签署 4.1 亿美元多年算力合作,获取云端算力训练开放式自我改进系统。公司由前 Salesforce 首席科学家 Richard Socher 领衔,5 月带 6.5 亿美元融资出隐身,投资方含 GV、英伟达、AMD。
云安全独角兽 Cyera 于 7 月 28 日签署意向书,拟约 10 亿美元(约 7 亿现金 + 股票)收购非人类身份安全公司 Oasis Security,以监控与授权激增的 AI Agent。Cyera 近期以 120 亿美元估值融资 6 亿,这是其今年第三笔收购;Oasis 成立于 2022 年,累计融资约 1.95 亿。
据彭博等报道,台湾检方以涉嫌走私为由羁押一名英伟达员工,7 月 24 日搜查其住所与台北办公室工位。案情指被告伪造文件、将约 50 台搭载受限英伟达芯片的 Super Micro 服务器经台湾转道输往中国,调查已牵涉 7 人。据公开信息,此前尚无政府就芯片走私对英伟达员工采取行动,或属首例。
据路透独家,美国 FCC 于 7 月 28 日发布措施,禁止进口新款中国人形/四足机器人及联网电力逆变器,理由是保护美国 AI 基建供应链免受数据窃取与网络攻击(援引 2023 年 Volt Typhoon 事件),并推动制造业回流美国。
Model Context Protocol 发布迄今最大改版 2026-07-28 规范:从双向有状态协议转为请求/响应无状态核心(可部署到 serverless/边缘),授权对齐生产级 OAuth 2.0/OIDC,新增多轮请求、头部路由、可缓存列表、扩展框架。MCP 月 SDK 下载已破 4 亿(年内 4 倍)。
Anthropic 用 Claude Mythos Preview 发现对两种密码算法的改进攻击:后量子签名候选 HAWK 被降低有效密钥强度(HAWK-256 攻击成本从 2^64 降到 2^38,60 小时找到 2 年人工审查漏掉的弱点),对 7 轮缩减版 AES-128 的攻击提速 200-800 倍。两项均不影响现网系统,官方称展示了 AI 加速密码学研究的潜力。
扩散Transformer是高质量视频生成的关键,但长序列使注意力计算成为推理瓶颈。无训练动态稀疏注意力通过仅计算选定key-value块来缓解瓶颈,但现有方法难以高效且准确地稀疏化注意力:固定分数选择导致预算僵化,而概率质量保留虽动态但可能不均衡。
生成模型推动了蛋白binder设计的发展,但现有方法主要基于单靶点、单状态假设,难以建模多靶点或多状态相互作用。Chamaileon将问题形式化为跨上下文binder设计,统一了多靶点与多状态binder设计任务。
多轮长时域规划对基础模型智能体至关重要,但现有模型训练数据不可控、不透明,难以理解规划能力如何获得和整合。研究提出了统一可控的多轮环境,系统研究长时域规划在预训练等阶段的获取机制,通过单/多教师同策略蒸馏提升规划能力。
On-policy蒸馏通过沿student生成的轨迹查询teacher来适配扩散模型,但对无分类器引导(CFG)的处理仍不清楚。现有方法将速度匹配扩展到CFG组合预测,但这种目标在分支层面是欠定的——正负分支误差会相互补偿。
智能体搜索仅靠结果强化学习监督信号稀疏,从专有模型蒸馏知识时,传统 logit 匹配因隐藏 logits 和 tokenizer 不匹配而不可行,自然语言轨迹模仿效果有限。
现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。
综述机器人学习中过程奖励的研究进展,涵盖不同观察、目标规范、输出信号和监督来源的方法差异与统一框架需求。
创意AI正从单步资产生成向长时程多模态创作演进。尽管近期生成模型能合成高质量图像、视频、音频、UI元素等创意资产,但实际创意工作远不止孤立的提示词-输出交互。它涉及参考资料、草稿、备选方案、编辑、失败尝试、版本关系、工具操作、评估信号和人类反馈,这些共同形成不断演进的项目状态。现有基于提示词、聊天和节点的生成系统仅能部分...