来自 Twitter · Hacker News · GitHub 的 AI 行业动态
Dario Amodei指出,Anthropic长期以来一直倡导前沿AI的透明度要求,因为此前风险尚不够清晰,无法进行精确监管。但他强调,如今仅靠透明度已经不够。
Dario Amodei表示,除透明度要求外,前沿模型应在网络安全、生物武器、失控与自动化研发四类风险方面接受强制性第三方审查,政府应有权阻止或撤销存在灾难性风险的模型部署。
26B 参数基于 Gemma4,支持块级并行去噪,单卡 H200(FP8)吞吐量超 1200 token/s,模型检查点已在 RedHat AI Hub 提供
纪录片首集邀请康多莉扎·赖斯对谈,讲述黄仁勋的韧性与创新历程
Grok Voice 具备先进语音合成性能,可模拟人类节奏和情感,定价极低,详情点击
该代理利用模型和实时数据帮助用户判断市场情绪,详情见链接
他与 Clement Delangue、Dan Jeffries 共同号召开发者参与新项目 Tapestry,详情见链接
Anthropic 的最新长任务模型现已通过 Perplexity Computer 提供,帮助处理复杂工作流,需订阅 Pro 或 Max
新版 /review 本地运行 Bugbot,可在推送前捕获并修复问题,效率与准确性同步提升
他指出 Anthropic 在提示违规时会自行决定使用权限,虽合法但对企业业务连续性构成潜在威胁,呼吁制定相应策略
DiffusionGemma 通过块同步生成与自校正,可实时处理复杂 Markdown,单卡 H200(FP8)吞吐量超 1200 token/s
DiffusionGemma 采用块级同步生成与精炼机制,取代传统逐词预测,生成速度提升四倍,代码采用 Apache 2.0 许可
Anthropic CEO Dario Amodei 论文指出 AI 发展速度超出政策应对能力,公司正推出三大计划以弥补差距
Code with Claude Tokyo 发布,托管 Agent 支持定时运行、安全工具调用及更大任务,Claude Code 动态工作流已普遍可用
Michael Truell 12岁爱上编程,联合创立 Cursor,平台已获大量企业采用,财富500强中逾六成使用
他在文中阐述 AI 进展速度及当前监管缺口,呼吁政策同步加速
Elon Musk 认同 Sowell 的言论,认为相关行为应立即终止
相较Gemini 3 Flash和GPT‑5.5,Fable 5在内容忠实度和语义格式化分别提升至90%与72%,优势明显。
经大量实践,Claude 4.8在界面设计上已足够,Fable 5未展现明显提升。
用户可在搜索中创建婚礼策划、搬家等持续任务的个性化交互界面,随时返回继续推进。
通过Design System避免AI味、分阶段迭代、用Markup局部修改、注意上下文管理、利用Tweaks调风格。
该初创公司利用GPU实现高回报,证明AI推理硬件的商业价值显著。
宇树科技与 BitRobot Network、Lightwheel AI、新加坡理工学院等合作,加入人形机器人 IKEA 组装挑战赛,探索人形机器人在真实场景中的灵巧操作能力。
Result 是一个覆盖创业全流程的平台,帮助用户从创意到产品落地、公司注册、财务管理、报税和营销。Y Combinator 对其正式发布表示祝贺。
GarryTan 表示 Fable 5 是他见过的最大模型能量,但未透露具体参数或性能数据。
OmniCap-IF首个综合基准,用于评估全模态视频描述的指令跟随能力,揭示了多模态推理中显著的性能差距及格式-内容权衡问题。
推出名为CoVEBench的新基准测试,用于评估组合式视频编辑能力,解决了现有模型在处理复杂多步骤编辑任务时保持时空内容方面的局限。
SWE-Explore引入了一个基准测试,通过要求在代码行数限制内提供相关代码区域的排序列表来评估编码智能体的仓库探索能力,结果表明智能体式探索优于传统检索方法。
随着微信正式面向开发者提供AI生态接入能力,滴滴作为首批合作伙伴,已与微信团队合作将核心网约车服务融入微信AI Agent。未来,用户通过微信内AI交互,即可直接唤起滴滴快车、专车、特惠等服务。 当用户在微信中产生出行需求,只需说一句“帮我叫一辆滴滴去机场”,“我要打滴滴回家,要特惠快车或者快车”即可根据行程距离、时效需求与个人偏好,自动推荐最优车型,一键唤起叫车服务,全程不跳转,极速出发。 据了
Agents' Last Exam (ALE) 是一个评估AI智能体的基准测试,聚焦长期、有经济价值的现实世界任务,涵盖13个行业集群、1000+任务,揭示了基准测试表现与实际部署之间存在显著差距。