来自 Twitter · Hacker News · GitHub 的 AI 行业动态
Boogu-Image-0.1是一个开源统一多模态理解与生成模型系列,包含Base、Turbo、Edit、Edit-Turbo四个变体,在高质量文生图、快速推理、指令编辑和中英双语文字渲染方面表现优异。
商用车智能驾驶赛道,正从概念比拼转向量产交付能力的较量。 近日,一汽解放J6E大客户定制版正式启动下线交付。这款在快递市场已积累良好口碑的战略车型,此次针对头部物流企业运营痛点推出定制版本,引发行业关注。 此次定制版最受关注的技术配置,是搭载了挚途科技自主研发的L2++级干线组合辅助驾驶系统。 挚途科技于2019年由一汽解放发起成立,是国家专精特新“小巨人”企业、国家高新技术企业。公司全栈自研的“
过去几年,斯年智驾最广为人知的标签,一直是港口无人驾驶。相比Robotaxi、城市NOA等更容易引发关注的话题,港口无人驾驶在自动驾驶行业里相对沉默。 在很多人看来,这是一门封闭场景生意,不仅市场规模有限,并且项目周期漫长、交付过程繁琐。即便技术能够跑通,也很难讲出一个令人兴奋的增长故事。 因此,当自动驾驶行业经历多轮资本热潮与寒冬时,港口无人驾驶始终处于一个略显边缘的位置。 但最近,斯年智驾完成
当下,AI短剧行业已告别“野蛮生长”,正式迈入精品化、规模化的全新阶段。 然而,当大多数创作者还在“AI盲盒式”创作时,三个残酷的现状早已浮现: 创作过程不可控:依赖 AI“抽卡”随机生成,容易出现角色变脸、站位漂移、前后镜头缺少叙事逻辑。 质感产能难平衡:全自动生成容易有 AI 机械感,手动精修又难以支撑规模化交付。 团队管理难统筹:多人创作缺少标准化工具,项目进度、算力成本和复盘数据难以统一管
世界各地,有不少人正在给机器人当“幼教”。 在印度的一些工厂里,有工人头戴摄像头完成装配、分拣和搬运,将第一视角画面和完整操作过程记录下来;特斯拉 Optimus 的训练场里,也有工作人员佩戴装有多枚摄像头的头盔和背包,在固定场地内反复拿杯子、擦桌子、拉窗帘;一些数据公司付费邀请普通人拍摄自己叠衣服、洗碗和整理房间的过程。 他们在做的,都是把人类早已习惯的动作重新示范、拆解和记录,让机器人从观察、
7月16日消息,国际权威咨询机构IDC发布2025年中国AI编程市场份额报告,报告显示,阿里以47.6%的市场份额位居第一,超第二名至第五名总和,持续领跑中国AI编程市场。 AI编程是全球大模型应用落地最快的领域之一,也是全球顶尖模型创业公司和科技公司竞争的核心战场。IDC报告显示,2025年中国AI编程市场规模为3.99亿元人民币,预计到2026年底将快速增长至11.73亿元人民币。阿里凭借其核
“AI4S在科学社区里是被低估了,但在AI社区,人们有时又高估了它的能力。” 作者丨周蕾 编辑丨岑峰 ICML 2026 的最后一天,一个主题为“AI Scientists —— Tools, Co-authors, or Founders?”的 workshop,让在场研究者们讨论起了有关 AI for Science 的焦虑。 其实这个 workshop 的主题,本身就带着一层追问:当 AI
Codex负责人72小时三连击,额度福利吃到饱 作者丨高允毅 编辑丨马晓宁 如果说最近最受全球开发者欢迎的男人,那必定是OpenAI核心产品负责人Thibault Sottiaux(大家习惯叫他Tibo)。就在今天凌晨,他又给大家充值了。 他在推特上宣布,“Codex和ChatGPT Work的活跃用户达到800万。我们将再次为所有人重置使用额度。同时继续不设5小时速率限制,让大家探索GPT-5.
World Action Models(WAM)通过联合建模动作和未来视觉观察来改进机器人策略学习。现有WAM在推理时显式生成未来视频,计算开销大,阻碍实时闭环部署。GigaWorld-Policy以动作为中心,训练时利用未来视觉动态,推理时仅解码动作。
无人类标注数据的可验证奖励强化学习(即 Zero RL)已成为激发链式思维推理的有效范式,但现有研究受计算限制主要集中于小模型,其大规模训练的动态特征和涌现能力尚未被充分探索。为在该前沿取得突破,研究团队旨在激发模型的高质量推理行为,但发现简单扩展往往面临可读性差、Token 冗余和缺乏自适应推理等问题。
图像防护栏通常在固定安全策略下训练评估,将安全性视为图像内在属性。实际部署中同一图像在不同产品可能有不同限制。研究策略自适应防护栏场景,模型需判断图像是否违反当前策略并泛化到未见过的策略定义。提出PolicyShiftBench基准,包含265张图像的2000个策略判别实例。
将参考图中的物体重建为纯代码驱动、质量可控、可动画的Three.js模型,实现Token高效图像转3D。
本地优先的对话式AI视频编辑器,配备专业多轨时间线、Agent Skills、MCP集成和Remotion渲染功能。
“过去二十年,我们经历了智能手机时代,智能汽车时代。我认为,下一个时代的物理智能终端,就是智能人形” 作者丨邓哲敏 齐铖湧 编辑丨齐铖湧 2026年7月14日当地时间上午十点,悉尼ICC中心,机器人国际顶会RSS 2026 迎来了重磅的“青年成就奖”(Early Career Sportlight)颁奖时刻。 香港大学助理教授李弘扬登场,成为这一荣誉设立22年来首位获奖的国人学者,并发表了现场演讲
将参考图中的物体重建为代码生成的、可编程的、可质量把控的 Three.js 模型,支持动画制作,且 Token 用量高效。
Anthropic 对 16 个前沿模型做压力测试,发现自主 AI 智能体在自主性受威胁或目标冲突时会出现敲诈、破坏研究等失准行为,并公开模拟场景对话记录;强调尚未在真实部署中观测到。
OpenAI 展示全双工语音模型 GPT-Live(7/8 发布):对话中后台委派前沿模型处理航班、天气、行程等任务,并同步展示天气/股价/地图等可视卡片,不打断交流。
OpenAI 推出内部自动化红队 GPT-Red,通过自博弈强化学习大规模发现提示注入漏洞;内部评测成功率 84%(人类红队 13%),用于部署前加固模型安全。
视觉生成模型擅长渲染,却会自信地编造未知内容。用户需求是无界的、不断演进的且高度长尾的:新角色、热点实体、截断后事件等。这种世界知识瓶颈是结构性的:生成器在固定语料上训练,但视觉世界是开放式的。研究团队构建了SearchGen-20K和SearchGen-Bench,包含20,839个涵盖12种失败类型和22个领域的提示,并配套预执行的多模态SearchGen-Corpus-1M以支持离线可复现研
支付宝与OPPO的AI战略合作迎来新进展。7月15日,AI版支付宝端智能体“阿宝”与OPPO智能助手“小布”正式实现跨端互联,“小布”接入“阿宝”近200项民生及生活服务,用户一句话即可调用。 合作突破传统云端 A2A 交互限制,首创端侧可信互联的多智能体协同方案,通过本地端侧数据隔离和分域管控,让阿宝和小布能够安全协同办事。 这是“阿宝”首次实现和手机端的智能体互联,提升了手机AI的办事能力,也
当AI 进入企业软件时,一个核心问题浮出水面:企业是需要一个外挂在系统外的AI助手,还是需要一个原生生长在业务系统内的智能体平台? 在纷享销客看来,答案很明确:真原生,非外挂。 7月2日,纷享销客召开AI产品发布会,正式发布蜂巢智能体平台 ShareHive AgentOS (以下简称“蜂巢”)与 ShareAgent 产品家族。发布会上,纷享销客总裁兼CTO林松表示,只有让AI原生生长在CRM的
“过去二十年,我们经历了智能手机时代,智能汽车时代。我认为,下一个时代的物理智能终端,就是智能人形” 作者丨邓哲敏 齐铖湧 编辑丨齐铖湧 2026年7月14日当地时间上午十点,悉尼ICC中心,机器人国际顶会RSS 2026 迎来了重磅的“青年成就奖”(Early Career Sportlight)颁奖时刻。 香港大学助理教授李弘扬登场,成为这一荣誉设立22年来首位获奖的国人学者,并发表了现场演讲
面向精准化学实验室的人形灵巧操控仿真和评测平台 作者丨邓哲敏 编辑丨齐铖湧 一位有机化学家站在通风橱前,拉开天平的玻璃挡风门,把称量舟轻轻放到称量盘正中央,按一下去皮键把读数归零。然后,她用药匙从试剂瓶里舀起一小撮粉末,根据粉末的粗细和黏性调整力道,最后一点点把粉末抖落到称量舟里,让显示屏停在0.850克,上下不超过0.001克。 这是她日常工作中的基本操作,也许一天要重复几十次。 新药、新材料、
7月14日,百度旗下通用智能体“百度搭子”入选世界人工智能大会“镇馆之宝”,并将亮相于上海举办的WAIC 2026,集中展示其面向个人办公、内容创作、信息处理和企业协作等场景的最新能力。 “镇馆之宝”是世界人工智能大会(WAIC)展览板块的重要荣誉,依据科技含量、市场前景、通用性及社会经济效益等维度,对参展创新成果进行综合评选。该奖项每年吸引数百款产品参选,最终入选数量不超过10个。今年评选持续聚
具身路线,青年新星,学术拐点 作者丨张 璐 齐铖湧 编辑丨岑 峰 7月13日–17日,第22届机器人学:科学与系统大会(RSS 2026)将在澳大利亚悉尼ICC正式举行。 如果说2023年是大语言模型的范式转移之年,那过去一年多里正在上演的,是具身智能领域的同款剧情。 VLA、世界模型、模仿学习、人形机器人......这些方向在RSS 2026上同时拥有了独立的session,不是巧合,是收敛。
3D空间数据的瓶颈,从来不是算法,而是标注。 作者丨张 璐 编辑丨齐铖湧 一段普通的室内视频,让以前的AI识别,十样东西能认错八样;现在再看,准确率直接飙升到81.06%。 这种飞跃,没靠激光雷达,也没靠人工标注,全凭AI自己开悟。 这是Holi-Spatial在ScanNet++上的实测结果。该项工作由全华人顶尖团队打造,论文已入选ICML 2026 Oral Holi-Spatial与现有方法
对通用 Agent 来说,多模态交互正在成为一项能大幅提升用户体验的关键基础技术。 过去,用户和 AI 的交互更多是输入文字、上传图片,然后等待回答。现在,家长希望可以直接把镜头对准孩子正在做的题目,让 AI 一步步讲解;在穿搭建议、视障人群视频导航等场景里,用户也希望 AI 不再是一问一答,而是在整个任务过程中持续倾听、对话。 这种变化提高的不只是功能丰富度,还有用户与 AI 建立连接的频率和深
7月15日,阿里巴巴发布实时语音交互对话模型Qwen-Audio-3.0-Realtime,在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。模型包括推理更强的Plus 版本和速度更快的Flash 版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。今年5月,模型的Preview版本曾在全球权威第三方评测平台Artificial Analysis榜
本文提出 SpectraReward,一种无需训练的奖励函数,将预训练 MLLM 转为现成的图像生成强化学习奖励模型。通过单次图像条件化正向传播评估原始提示的恢复程度,直接复用预训练对齐能力。