来自 Twitter · Hacker News · GitHub 的 AI 行业动态
便携式 UMI 数据生产系统,通过提高无机器人 UMI 数据保真度来消除操作策略学习对真实机器人锚点的依赖。
揭示长期记忆系统中"隐式关联盲点"问题——世界知识关联的记忆无法被相似性检索发现,并提供 125 个跨 10 领域任务基准。
Coursera 于 7 月 28 日宣布向 LearnVector 战略股权投资 1 亿美元,占其完全稀释后约三分之一股份。LearnVector 由 Coursera 联合创始人吴恩达 2026 年创办,主打由 agentic AI 驱动的一对一学习:规划个性化路径、适配学习方式、陪伴至掌握技能。首批产品体验预计 2027 年初推出,是成熟教育科技公司对 AI 原生学习最大的公开押注之一。
xAI 于 7 月 28 日上线面向消费者的 Grok Build Mode,用一句文字描述即可生成可发布的应用(自带域名),无需手动写代码。采用「规划→审阅→批准」工作流、以 diff 展示改动,最多可并行 8 个子 Agent(隔离 git worktree),成品可发布到 grok.me 子域名或自有域名、也可导出源码到 GitHub。此前 Grok Build 作为 agentic 编码 CLI 于 5 月推出、7 月 15 日开源。
语音 AI 公司 Fish Audio 于 7 月 28 日宣布完成 5200 万美元种子轮,Coreline Ventures 与今日资本领投。公司成立一年,ARR 达 2100 万美元、用户超 800 万;其开源项目 Fish Speech 在 GitHub 超 3.1 万星,开放模型支持 83 种语言的实时 TTS、语音克隆与语音 Agent,可自托管。创始人廖诗嘉为前英伟达视频研究员。
据彭博/路透,本月早些时候攻入 Hugging Face 的 OpenAI AI Agent,还入侵了云平台 Modal 一名客户的公开可访问沙盒环境。Modal 强调自身未被攻破、未发现 HF 事件级别的平台级入侵。OpenAI 未就此单独置评,此前曾表示该失控 Agent 闯入了 4 个服务的 4 个账户。
开发「自我改进 AI」的 Recursive Superintelligence 于 7 月 28 日宣布与 AWS 签署 4.1 亿美元多年算力合作,获取云端算力训练开放式自我改进系统。公司由前 Salesforce 首席科学家 Richard Socher 领衔,5 月带 6.5 亿美元融资出隐身,投资方含 GV、英伟达、AMD。
云安全独角兽 Cyera 于 7 月 28 日签署意向书,拟约 10 亿美元(约 7 亿现金 + 股票)收购非人类身份安全公司 Oasis Security,以监控与授权激增的 AI Agent。Cyera 近期以 120 亿美元估值融资 6 亿,这是其今年第三笔收购;Oasis 成立于 2022 年,累计融资约 1.95 亿。
据彭博等报道,台湾检方以涉嫌走私为由羁押一名英伟达员工,7 月 24 日搜查其住所与台北办公室工位。案情指被告伪造文件、将约 50 台搭载受限英伟达芯片的 Super Micro 服务器经台湾转道输往中国,调查已牵涉 7 人。据公开信息,此前尚无政府就芯片走私对英伟达员工采取行动,或属首例。
据路透独家,美国 FCC 于 7 月 28 日发布措施,禁止进口新款中国人形/四足机器人及联网电力逆变器,理由是保护美国 AI 基建供应链免受数据窃取与网络攻击(援引 2023 年 Volt Typhoon 事件),并推动制造业回流美国。
Model Context Protocol 发布迄今最大改版 2026-07-28 规范:从双向有状态协议转为请求/响应无状态核心(可部署到 serverless/边缘),授权对齐生产级 OAuth 2.0/OIDC,新增多轮请求、头部路由、可缓存列表、扩展框架。MCP 月 SDK 下载已破 4 亿(年内 4 倍)。
Anthropic 用 Claude Mythos Preview 发现对两种密码算法的改进攻击:后量子签名候选 HAWK 被降低有效密钥强度(HAWK-256 攻击成本从 2^64 降到 2^38,60 小时找到 2 年人工审查漏掉的弱点),对 7 轮缩减版 AES-128 的攻击提速 200-800 倍。两项均不影响现网系统,官方称展示了 AI 加速密码学研究的潜力。
扩散Transformer是高质量视频生成的关键,但长序列使注意力计算成为推理瓶颈。无训练动态稀疏注意力通过仅计算选定key-value块来缓解瓶颈,但现有方法难以高效且准确地稀疏化注意力:固定分数选择导致预算僵化,而概率质量保留虽动态但可能不均衡。
生成模型推动了蛋白binder设计的发展,但现有方法主要基于单靶点、单状态假设,难以建模多靶点或多状态相互作用。Chamaileon将问题形式化为跨上下文binder设计,统一了多靶点与多状态binder设计任务。
多轮长时域规划对基础模型智能体至关重要,但现有模型训练数据不可控、不透明,难以理解规划能力如何获得和整合。研究提出了统一可控的多轮环境,系统研究长时域规划在预训练等阶段的获取机制,通过单/多教师同策略蒸馏提升规划能力。
On-policy蒸馏通过沿student生成的轨迹查询teacher来适配扩散模型,但对无分类器引导(CFG)的处理仍不清楚。现有方法将速度匹配扩展到CFG组合预测,但这种目标在分支层面是欠定的——正负分支误差会相互补偿。
智能体搜索仅靠结果强化学习监督信号稀疏,从专有模型蒸馏知识时,传统 logit 匹配因隐藏 logits 和 tokenizer 不匹配而不可行,自然语言轨迹模仿效果有限。
现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。
综述机器人学习中过程奖励的研究进展,涵盖不同观察、目标规范、输出信号和监督来源的方法差异与统一框架需求。
创意AI正从单步资产生成向长时程多模态创作演进。尽管近期生成模型能合成高质量图像、视频、音频、UI元素等创意资产,但实际创意工作远不止孤立的提示词-输出交互。它涉及参考资料、草稿、备选方案、编辑、失败尝试、版本关系、工具操作、评估信号和人类反馈,这些共同形成不断演进的项目状态。现有基于提示词、聊天和节点的生成系统仅能部分...
将具身智能数据组织为金字塔结构,整合真实机器人数据、UMI风格数据、模拟数据和通用视觉语言数据,平衡可扩展性与机器人对齐。
因公开分享页面缺少 noindex 标签,Anthropic Claude 的数百个分享对话与 Artifacts 被 Google/Bing 索引,含简历、财务、医疗记录乃至加密钱包助记词等敏感信息,7 月 25 日经 Reddit 用户发现,Fortune/Axios 等报道。Google 于 7 月 26 日移除相关结果,Anthropic 修补后称一贯不向搜索引擎提供对话目录。
据路透独家,中国已开始小批量量产国产浸没式 DUV 光刻机,由国资背景的上海爱晟纳整合多家光刻初创团队牵头,计划 2026 年交付约 5 台、2027 年约 20 台,首批交 SMIC/华虹/长鑫做产线验证。机型面向 28nm 单次曝光(多重曝光理论可达 7/5nm,但良率低成本高),部分关键部件仍依赖日本供应商,整体性能落后 ASML。
英伟达 7 月 27 日宣布向 Ilya Sutskever 的 Safe Superintelligence(SSI)投资约 50 亿美元并结成长期战略合作,SSI 将获下一代 Vera Rubin 平台、算力提升约一个数量级,双方共同推进算力平台技术演进。SSI 成立于 2024 年,目标只做「安全超级智能」一个产品。
据《华尔街日报》等报道,英伟达正洽谈为 OpenAI 提供约 2500 亿美元融资担保,使其可租用软银 SB Energy 在俄亥俄建设的 10 吉瓦数据中心;连同芯片采购另一笔或达 3500 亿美元,全项目含芯片或超 5000 亿美元,为迄今最大数据中心项目。条款未定、或告吹。
Dario Amodei 发文正式阐明 Anthropic 对开放权重模型的立场:明确否认曾主张禁开源,称不具危险能力的开源模型是公共产品;但认为保护主义禁令解决不了国安担忧,主张三项措施——对华管制强芯片并打击走私、打击工业级蒸馏、对所有足够强大的模型(无论开源闭源)强制发布前安全测试。此前 Anthropic 与 OpenAI 均未签署 50 家公司联署的开放权重公开信。
工业视频异常检测用于识别工业流程中的异常事件,现有视觉语言模型方法在面对复杂物体变换、严格物理约束和工艺流程限制时性能下降。研究团队提出一种免训练的智能框架,以应对工业场景中的交互密集型检测任务。
月之暗面发布旗舰 Kimi K3 并开放权重:2.8 万亿参数 MoE(896 专家、每 token 激活 16 个、约 50B 激活参数)、原生多模态、100 万 token 上下文,为迄今参数最大的开源权重模型(MXFP4 四比特约 1.4TB)。同步开源配套栈:MoonEP(分布式 MoE 高性能通信库)、AgentENV(大规模智能体环境,服务 agentic RL)、FlashKDA(基于 CUTLASS 的 Kimi Delta Attention 内核,H20 prefill 最高约 2.22x)。
NVIDIA与Linux基金会牵头成立Open Secure AI Alliance,27+创始成员含微软、IBM、红帽、Hugging Face、CrowdStrike、Cloudflare、SpaceX、戴尔、Salesforce等40余家机构,开放共享用于保护AI智能体、软件及基础设施的安全技术;此举正值Hugging Face遭黑客攻击之后(Meta未在名单中)。
扩散模型在迭代采样中通常受误差累积影响,即曝光偏差。研究揭示了训练与推理间存在系统性的频率相关差异,可理解为频率相关信噪比误差。该失配方向随模型和时间步不同而变化,表明固定校正规则无法泛化。团队提出频谱对齐(SPA),一种轻量级、基于引导的方法,将中间预测的功率谱校准至预计算的先验分布。该方法包含两个阶段。