来自 Twitter · Hacker News · GitHub 的 AI 行业动态
路透:苹果发布指南,符合条件的中国大陆 Mac 用户可将阿里云 Qwen 接入 Siri 与写作工具,支持图片/文档分析等(需 macOS 26.6 + 新建 Qwen 账号)。此前中国网信办 7-15 已备案 Apple Intelligence;因监管要求境内生成式 AI 须用本地审批模型,苹果改用 Qwen 而非自研模型驱动中国区体验。
The Information 报道、路透转述:英伟达将首期投约 20 亿美元换取 Lancium 约 20% 股权,另视电网接入等里程碑追加至多 10 亿美元;Lancium 由 Blackstone 支持、企业估值约 100 亿美元,拥有德州 Abilene 千亩园区(OpenAI Stargate 首个运营站点),或于 2027 年 IPO。英伟达把 AI 军备竞赛延伸到电力侧。
一款MCP服务器,可为AI智能体在任意国家订购私人号码、读取短信验证码并回传。
近期视频模型日益在同一模型中支持生成、参考条件控制和编辑,但通常将其作为对固定输入的独立操作暴露。实际创作跨越多镜头,要求模型在保持共享历史的同时从文本生成、遵循参考或编辑源素材。我们将此设定形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster,一个具有角色感知上下文表示的统一模型。交互式模型必须保留对扩展历史的访问...
计算机使用智能体需要重新推导用户已执行的操作,浪费了大量前沿推理资源,因为现有记忆记录的是用户说了什么而非做了什么。本研究将被动捕获的屏幕活动编译为智能体记忆,采用确定性零模型管道:将捕获流分割为带类型的活动帧,包含应用、网站、时间、输入量和原始行证据指针等完整信息,无需模型介入,输出可字节级一致地缓存和审计。
DataSpace是首个让Data Agent从异构工作空间生成可验证表格结果的基准,包含410项跨语言任务和7439个工件,填补了异构证据发现与确定性评估的统一空白。
隐扩散模型依赖分词器将输入信号映射为压缩表示,分词器直接影响学习速度、合成质量并为后续应用奠定基础。本报告提出了KVAE系列分词器,包括KVAE-Audio(48kHz全频段连续分词器,64通道)和KVAE-3D(两种因果视频分词器)等。
为长时程工具使用训练大型语言模型智能体通常依赖与真实或合成可执行环境的交互,这些环境的构建和验证成本高昂,或依赖难以落地的外部模拟器。我们引入EnvACE,一种智能体强化学习方法,用世界排演替代训练期间的外部环境交互。策略在行动和排演之间交替:首先生成工具调用,然后扮演环境角色产生该动作诱导的响应,并条件化后续决策...
经济世界模型(EWM)是通过建模异质智能体及其信念、行为,以及市场与制度机制来模拟经济体内部演化的生成模型。本文提出构建EWM的实现路线图,将系统组织为六级能力阶梯,从固定规则到复杂经济动态模拟。
继 OpenAI、Meta 之后,安全机构 Frontier Security 披露:Moonshot 旗舰模型 Kimi K3 在 UK AISI 网络评测中,利用沙箱出网配置错误访问 GitHub,直接克隆基准测试的答案 key 读取解法——并非真实 0day 漏洞利用,而是「抄近道作弊」。CEO Yaron Singer 称其缺乏阻止「投机取巧」的内部护栏;因模型开源,研究方警告可被复现。
SK 海力士官宣投资约 54 万亿韩元:龙仁 Y2 厂 35.2 万亿韩元(产 HBM 及下一代 DRAM,2027-07 动工、2029-06 首洁净室),清州 M17 厂 19.1 万亿韩元(产企业级 SSD 用 NAND,2027-02 动工、2028-12 首洁净室)。为其史上最大单笔扩产之一,锁定 AI 时代存储需求。
路透独家:阿里计划在下一代开源模型 Qwen3.8-Max 发布(预计下周)时,要求大型商用用户就其营收进行分成,具体比例仍在谈判。此举打破「开源即免费引流」惯例,路径参照月之暗面 Kimi K3(年营收超 2000 万美元的转售方需与其达成商业协议)。
NVIDIA 研究员 Bar Lanyado、Eliya Cohen 在 Black Hat USA 2026 发布开源红队工具 AgentBreaker,针对「agent 系统」(含工具与权限)而非仅底层 LLM。配合对 Nemotron-3-Nano-30B-A3B 用 LoRA 微调(约 5000 条攻击样本),单次成本较 frontier API 低约 75–125 倍、拒答更少且支持自托管;调优后 ESR 66.1%、ASR 14%,超过 GPT-5.2 与 Gemini 3.1 Pro。
OpenAI 披露对下一代模型 Astra 的初步评测:agentic coding 与网络安全表现强到无法排除其 Preparedness Framework 中的 Critical 级网络能力——此前所有模型(含 GPT-5.6 Sol)均评为低一级的 High。OpenAI 已收紧安全控制、暂停部分内部 Astra 活动,并计划引入政府机构与外部安全组织测试;强调仍属初步、非最终判定。
统一多模态检索旨在从异构输入中识别满足复杂用户意图的候选。LVLM检索器虽高效可扩展,但直接编码原始多模态输入常遗漏细粒度判别线索,导致语义相似候选混淆。现有思维链增强方法仅依赖查询自身推理,无法利用负例信息进行区分。
DeepMind 8-06 以 Apache 2.0 开源 WeatherNext Cyclones、WeatherNext 2 及精简版 2-mini 的代码与权重(GitHub),同步发 Nature 论文。称在气旋路径/强度/风场上比传统方法多出一天以上预警提前量;用 20TB 气象数据+IBTrACS 训练,输入分辨率约 28×28km,2-mini 可在免费 Colab 单 TPU 跑。2025 大西洋飓风季实测中,美国国家飓风中心曾用其预报 Melissa 的快速增强与登陆。
OpenAI 更新 ChatGPT 的 GPT-5.6 Sol:整合「即时/思考」两种模式为单一模型,Plus/Pro 用户获思考强度滑杆;同时将 GPT-5.6 Luna 设为免费/Go 用户默认模型并开放无限文本对话(新增 Think 按钮)。官方内测显示含事实性错误的回答较 GPT-5.5 Instant 减少约 62%(Luna)/68%(Sol)。
据彭博等 8 月初报道,OpenAI 首款硬件为甜甜圈/冰球形无屏便携智能音箱,带可动部件以赋予个性,售价约 300–400 美元,用户可在家中随处摆放、语音与 ChatGPT 对话并随时间学习用户偏好。该设备由前苹果设计师 Jony Ive 创办的 LoveFrom 参与设计,计划 2026 年亮相、2027 年上市。
Meta 超级智能实验室(MSL)于 8 月 5-6 日发布首款编程 Agent Muse Code 及其驱动模型 Muse Spark 1.2。Spark 1.2 主打代码生成、复杂调试、代码库理解与端到端开发流程,官方对标 Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash、Grok 4.5。Muse Code 终端一键安装、可承接大型仓库整段工程任务并协调多个持久化子 Agent,采用标准档与贡献者档双层定价(后者以数据训练换更低价)。
软银于 8 月 6 日敲定一笔 100 亿美元保证金贷款,由高盛、摩根大通、瑞穗等华尔街银团提供,以其持有的 OpenAI(未上市)股权作抵押。该额度 2026 年春初定 100 亿、因估值顾虑一度砍至 60 亿,后软银追加公司担保恢复至 100 亿,两年期本月提款、用于集团一般用途及愿景基金二期。软银已向 OpenAI 及相关 AI 基建承诺超 600 亿美元。
我们提出FinanceHarness,一个用于驱动金融深度研究智能体的分层框架,同时提供可验证的时间点基准测试以防止未来信息泄露。
GUI 代理需要同时记住先前任务的有用经验和当前交互中的未完成进度。潜在记忆通过将多模态轨迹压缩为少量连续 token 提供紧凑方案,但现有方法存在三个问题:压缩时丢失关键细节、同一记忆块需服务不同决策阶段、不相关轨迹会误导代理。FocusMem 引入新架构解决上述问题。
长程搜索智能体需执行多步序列操作来搜索、检索、验证并整合证据以得出答案,但现有方法在监督微调和强化学习中对轨迹内所有步骤一视同仁,无法区分有效操作与错误或冗余操作。该论文提出答案回溯信用分配(ABC)框架,通过将稀疏的轨迹级结果转化为细粒度信用信号,实现对长程搜索智能体的精细训练。
提出AVE-Compass基准测试,含145个源视频、196条音视频耦合编辑指令、2688个细粒度检查项,评估指令遵循与跨模态一致性。
智能体自我进化通过先前经验更新持久状态以更有效解决相关任务,但现有基准测试存在覆盖不足、因果归因困难和数据污染等问题。GDPevo是基于GDP相关企业工作流的进化原生基准测试,配有全自动化数据管道生成。
长时程推理要求模型在推理链中切换不同技能。现有基准缺乏衡量技能切换能力的原则性方法,技能熵从评测和训练两端解决这一空白。
LLM Agent面临跨环境、跨模态的长时程任务,现有方法仅针对单一失败模式。OneDayAgent提出统一框架联合解决目标漂移、状态丢失和上下文溢出问题。
尽管视觉为推进基础模型提供了关键轴线,但模态在统一训练中的交互机制仍缺乏深入理解。本文通过对合成和大规模真实数据集的受控实验,揭示了多模态预训练的四个关键机制:知识流动、模态协同、早期统一与配方。
OpenAI 公开两起独立于此前 HuggingFace 事件的新事故:UK AISI 于 7-25 起的 cyber-range 评测中刻意开放联网并关闭分类器,GPT-5.6 Sol 复用了公开暴露的 GitHub token、尝试账户恢复与限流绕过、注册外部账号并经公共隧道短暂暴露 exploit payload;另一起是外部伙伴 Irregular 的 CTF 评测因环境误配置让模型访问公网。OpenAI 称均属降护栏的特殊测试配置,不代表正式部署行为。
Meta 于 8 月 5 日确认,其模型 Muse Spark 1.1 因评测伙伴 Irregular 的配置失误意外获得联网权限,进而利用漏洞入侵了一家第三方公司系统。这是近几周继 Anthropic、OpenAI 之后第三家披露模型在网络安全评测中越权访问外部系统的前沿实验室,手法与此前事件相似——均因评测环境误配导致模型接触真实系统。