OPC 中国 · AI 日报
AI实时分身来了,Agent开始干活|2026年9月25日AI日报
26条AI新闻,关注Gemini 3.8 Live实时形象、Opus 5.5网页开发评测、WorkBuddy微信小程序,以及AI工具与产业应用进展。

本期使用AI辅助制作与配音,原始新闻图片与演示均注明来源。
本期目录 · 先国外,后国内
- Gemini 3.8 Live:实时虚拟形象上线
- Claude Tag:接入个人连接器
- Opus 5.5 Max:登顶网页开发榜
- GPT-6 Luna Max:网页开发成绩公布
- 让 Agent 替你换书:难点是理解偏好
- Legacy-Bench:评测老代码维护
- 马斯克谈模型进展:预计还需两三个月
- Sonnet 5.5 社区线索:出现体素作品演示
- Runway 进入达芬奇:生成结果直达时间线
- Chrome 中的 Gemini:扩展音视频理解
- H3 Max Extend:将短片延长至30秒
- ChatGPT Pro Max:出现代码线索
- WorkBuddy:可以生成微信小程序
- TRAE 双节福利:Seed 模型继续1折
- 清言双节福利:登录积分提升10倍
- 千问健康档案:接入个人健康信息
- 腾讯 Hy 翻译 APP:支持33种语言
- 《后西游记》幕后:AI 长剧怎样制作
- 千问创作会员:10元体验7天
- 商汤善惠发布:SenseMart OS
- 豆包再送:30天订阅权益
- 安踏电商 Agent:进入订货与退货流程
- 豆包工作任务升级:增加目标与计划入口
- MiniMax-H3 推理提速:5秒视频仅需1.33秒
- 小米18 Pro 系列:扩展手机 Agent 能力
- Kimi K3.1 线索:配置出现新模型标识
国外新闻
01 / 实时多模态
Gemini 3.8 Live:实时虚拟形象上线
Google 发布 Gemini 3.8 Live with Live Avatar,在 Gemini Enterprise 中提供实时语音与生成式视频形象,可在持续对话时异步调用工具,支持97种语言。
Google 于9月24日发布 Gemini 3.8 Live with Live Avatar。系统同步处理视觉与音频输入,将语音输出与近实时生成的视频形象结合,提供口型、表情和轮流对话能力,应用场景包括客户服务与交互式讲解。
这项功能可以在后台调用工具、获取数据时继续与用户交谈。除预设形象外,企业可用参考图定制形象;自定义创建目前需要加入企业许可名单。Google 表示,生成的音视频包含 SynthID 水印。

原始来源:Google DeepMind ↗
02 / 办公智能体
Claude Tag:接入个人连接器
Claude Tag 测试版支持在 Slack 频道中使用请求者自己的个人连接器,可查询其有权访问的文档、日历等资料,并选择回复发出前先审阅。
Anthropic 于9月24日宣布,Claude Tag 在频道内增加个人连接器支持。请求者可以授权 Claude 使用自己的连接器,获取工作所需的文档与其他上下文,并选择逐次审阅回复或自动处理模式。
个人连接器跟随请求者权限,输出到频道的内容则会被频道成员看到。该模式不用于无人值守任务;定时工作仍使用管理员共享连接。功能先向 Team 推出,Enterprise 随后跟进。


原始来源:site:claude.com ↗
03 / 模型评测
Opus 5.5 Max:登顶网页开发榜
Arena 公布 Claude Opus 5.5 Max 的 Code Arena WebDev 成绩:1818分,排名第一,比 GPT-6 Astra Max 高26分。
Arena 的9月24日结果显示,Claude Opus 5.5 Max 在网页开发评测中以1818分位居第一,同张榜单中的 GPT-6 Astra Max 为1792分。
分场景结果中,Opus 5.5 Max 在品牌营销、参考图驱动开发、分析面板以及模拟与游戏等类别位列第一。这里反映的是 Code Arena 网页开发场景下的对比偏好,供制作网站和交互页面时参考。

原始来源:twitter:arena ↗
04 / 模型评测
GPT-6 Luna Max:网页开发成绩公布
GPT-6 Luna Max 在 Code Arena WebDev 获得1593分、排名第24,较 GPT-5.6 Luna xHigh 高74分,上一代位列第41。
Arena 同日公布了 GPT-6 Luna Max 的网页开发结果:1593分,排名第24。作为对照,GPT-5.6 Luna xHigh 在该榜单排名第41,两者相差74分。
对于使用轻量模型制作网页原型的开发者,这份榜单提供了同一场景下的新旧版本对比。

原始来源:twitter:arena ↗
05 / 智能体研究
让 Agent 替你换书:难点是理解偏好
Anthropic 在201名员工参与的换书实验中发现,代理理解个人偏好的误差,是交易结果损失的主要来源;其两本书之间的偏好判断与人类一致率为61%。
Project Swap 邀请来自六个办公室的201名员工,让 Claude 代理交换各自带来的书。参与者先说明自己的偏好,代理随后通过集中分配或分散协商完成交换,研究者再对照人类排序评价结果。
代理对两本书的偏好判断与人类一致率为61%,高于随机判断的50%。在分散交易实验里,约85%的效率损失来自偏好表达与理解环节,剩余部分才来自代理间的协商。研究提示:把个人目标交给 Agent 前,如何说明自己真正重视什么,是重要的设计问题。

原始来源:Anthropic ↗
06 / 模型评测
Legacy-Bench:评测老代码维护
Factory 将 Legacy-Bench 纳入 Fireworks Specialized Intelligence Index,以 COBOL、Java 7、BASIC、C89、Fortran 和汇编任务比较模型维护老代码的能力。
Legacy-Bench 聚焦企业仍在运行的老代码,考察调试、功能实现和迁移。Factory 于9月24日介绍其加入 Fireworks Specialized Intelligence Index,并公开十个基于 Harbor 的示例任务;完整评测集保持私有。
公布结果中,GPT-5.6 Sol 的通过率为60%,Claude Opus 5 为52%,GPT-6 Astra 为51%,DeepSeek V4.1 Flash 为49%,Kimi K3 为44%,GLM-5.3 为23%。这些是该特定任务集的结果。

07 / 模型路线
马斯克谈模型进展:预计还需两三个月
马斯克在 X 回复用户时表示,他谨慎乐观地预计,SpaceX 会在两到三个月内拥有 Fable / GPT-6 级别的模型。这是其本人对后续进展的预期。
围绕 Grok 的讨论,马斯克于9月24日在 X 回复用户,称自己对 SpaceX 在两到三个月内拥有 Fable / GPT-6 级别模型持谨慎乐观态度。
原帖给出的是马斯克对未来进度的判断,没有附上新模型发布说明、开放日期或评测结果。

原始来源:twitter:elonmusk ↗
08 / 模型进展
Sonnet 5.5 社区线索:出现体素作品演示
社区账号 @notjazii 发布体素作品演示,称其观察到 Sonnet 5 请求路由至 Sonnet 5.5,并认为输出有所提升。当前证据是该账号的测试说法与演示。
9月24日,@notjazii 在 X 分享了体素场景生成演示,声称 Sonnet 5 已有约一周在路由到新模型,并将其称为 Sonnet 5.5。
该帖还作了与 GPT-6 Sol 输出的主观比较。此次取得的是社区原帖和演示视频,没有取得 Anthropic 对该路由变化的正式确认,因此以社区线索呈现。

原始来源:twitter:notjazii ↗
09 / AI视频
Runway 进入达芬奇:生成结果直达时间线
Runway 发布 DaVinci Resolve 插件,支持在剪辑软件内生成与重绘素材并导入时间线。插件免费,需 Resolve Studio 19或以上版本及 Runway 付费计划。
插件将 Runway 生成面板带入 DaVinci Resolve:创作者可以直接输入提示词,生成图片或视频,再将结果送入素材池与时间线。对于已有素材,可使用播放头位置或入出点选择片段。
Edit Studio 支持设置最多五个关键帧,由 Aleph 2.0 按原片时长重绘。插件面向 macOS 和 Windows 免费下载,生成使用现有 Runway 付费计划积分,提交前可查看消耗。

原始来源:site:Runway News ↗
10 / AI应用
Chrome 中的 Gemini:扩展音视频理解
Google 扩展桌面 Chrome 中 Gemini 的音视频理解能力,用户播放网页媒体后,可询问要点与具体内容;同时推出基于当前标签页生成互动测验的学习功能。
Google 的9月24日说明称,Gemini in Chrome 对媒体的理解不再局限于 YouTube,已播放的网页音视频可用于提取重点、查找信息及回答相关问题。官方提醒,需先播放相应媒体内容。
另一项更新是根据当前标签页生成互动测验,首批面向美国和印度的桌面英语用户,之后扩展更多地区与移动端。测验的首发范围与音视频功能分别表述。

原始来源:twitter:Google ↗
11 / AI视频
H3 Max Extend:将短片延长至30秒
fal 上线 H3 Max Extend Video,支持上传最长15秒的视频并续写至30秒,延续原始片段的风格与感觉。
fal 于9月24日在官方 X 账号宣布 H3 Max Extend Video 已上线。用户上传不超过15秒的原片后,模型可将其延长至30秒,官方演示强调续接原片的感觉。
本次新增的是视频延长能力,适合已有镜头需要继续发展的创作环节。官方原帖同时提供了续写效果演示。

原始来源:twitter:fal ↗
12 / 价格与额度
ChatGPT Pro Max:出现代码线索
@btibor91 与 TestingCatalog 分享的页面代码截图出现 ChatGPT Pro Max 相关标识,提示可能正在开发更高档方案;尚无可确认的价格与上线日期。
9月24日,@btibor91 分享了代码搜索截图,表示 OpenAI 正准备更高档 ChatGPT Pro 方案。TestingCatalog 随后以 Pro Max 名称报道该线索,并讨论长时间运行任务的可能需求。
原始证据是代码中的方案标识,无法单独证明最终套餐权益。TestingCatalog 关于价格的提问是猜测,本文不将其写为定价信息。


国内新闻
13 / AI办公与开发
WorkBuddy:可以生成微信小程序
腾讯 WorkBuddy 增加微信小程序生成能力,支持需求描述、生成预览及后端连接。电脑端5.6.1及以上版本可用,绑定自己的小程序账号后可提交体验和审核。
WorkBuddy 官方9月24日介绍,用户进入代码开发中的小程序入口,描述所需功能,即可生成项目并预览。流程支持数据库、身份认证、存储与 AI 能力等后端需求。
已有小程序账号的用户可扫码绑定并上传体验版本,再按微信流程提审。没有账号时可先体验14天试用,但试用小程序不能直接转为正式小程序。


原始来源:公众号:腾讯WorkBuddy ↗
14 / 模型使用权益
TRAE 双节福利:Seed 模型继续1折
TRAE 宣布 TraeCode 中 Seed-2.1-Pro-0915 和 Seed-Evolving 的1折活动延长至10月15日,面向全部用户。
TRAE 于9月24日公布双节活动延长消息:TraeCode 中 Seed-2.1-Pro-0915、Seed-Evolving 两款模型继续提供1折优惠,截止10月15日。
此次优惠属于 TRAE 内的指定模型使用活动,具体消耗按产品内展示执行,不扩写为 Seed 在其他平台的通用 API 降价。

原始来源:公众号:TRAE.ai ↗
15 / AI应用权益
清言双节福利:登录积分提升10倍
智谱清言于9月25日至10月7日提供登录积分10倍及活动消耗100%返还:普通用户每日2000积分,VIP 4000、SVIP 8000;返还积分需在10月8日至31日首次登录领取。
活动从9月25日零点持续到10月7日23:59。每日登录赠送积分按等级分别为2000、4000、8000,赠送积分24小时有效,可用于清言中的相关功能。
活动期间符合规则的消耗积分100%返还,返还上限15万积分。用户需在10月8日至31日首次登录领取,返还积分有效期30天。两种积分的有效期与领取时间不同,使用时需注意。


原始来源:公众号:智谱清言 ↗
16 / AI应用
千问健康档案:接入个人健康信息
千问介绍健康档案功能,支持用户授权连接智能设备或手动补充健康信息,让后续对话与跟进结合个人健康上下文,并提供隐私模式。
千问 APP 于9月24日介绍健康档案:用户可补充既往病史、手术史、过敏等信息,也可按授权连接穿戴设备及血糖设备,减少每次对话重复交代背景的步骤。
健康档案帮助后续对话结合个人背景,用户可以通过隐私模式管理相关信息。


原始来源:公众号:千问APP ↗
17 / AI应用
腾讯 Hy 翻译 APP:支持33种语言
腾讯上线基于 HyMT 2 的 Hy 翻译 APP,支持33种语言,包括五种民族语言与方言,可进行语音、拍照和下载模型后的离线翻译,首批覆盖12个国家和地区。
腾讯混元于9月24日宣布 Hy 翻译 APP 上线,基于 HyMT 2 模型提供多语言交流、拍照识别翻译及离线使用。用户预先下载本地模型后,可在网络不便时翻译。
APP 首批在美国、日本、韩国、新加坡、马来西亚、泰国、越南、缅甸等12个国家和地区提供;官方还介绍了小程序、浏览器插件与电脑端等入口,可搜索“腾讯混元翻译”查看。



原始来源:公众号:腾讯混元 ↗
18 / AI视频
《后西游记》幕后:AI 长剧怎样制作
火山引擎9月24日发布《后西游记》幕后访谈,介绍如何用 Seedance 制作已于8月31日登陆湖南卫视的 AI 长剧,披露团队、分镜与生成流程。
这次新闻是制作访谈,而非该剧首次开播。《后西游记》于8月31日登陆湖南卫视;导演李东珅在火山引擎访谈中介绍,以约百人团队推进制作,采用 Seedance 生成视频,围绕剧本、单帧设计、镜头生成和后期组织流程。
项目规划为60集、每集约40分钟。导演还以动作场景举例比较生成制作与传统拍摄的周期、成本。相关规模与成本是受访团队的披露,不能当作所有 AI 影视项目的统一水平。


原始来源:公众号:火山引擎 ↗
19 / AI创作权益
千问创作会员:10元体验7天
千问创作推出10元7天会员活动,官方海报展示创作积分、模板与图像创作等权益,面向假期修图和内容制作需求。
千问 APP 于9月24日发布“千问创作10元畅享7天会员”活动。官方海报标明10元、7天 VIP,并展示积分及创作权益。
活动面向假期修图和内容创作,具体可使用的积分、模板及模型权益可在产品活动页查看。

原始来源:公众号:千问APP ↗
20 / AI产业应用
商汤善惠发布:SenseMart OS
商汤善惠发布 SenseMart OS,将机器人执行与零售的数据、库存、支付和订单连接。公司披露已在五省六城20余家门店落地,并提出进一步扩展计划。
商汤科技9月24日介绍前一天发布的 SenseMart OS。系统面向零售业务,将机器人硬件、商品和经营数据以及商户业务流程连接起来,尝试让线下执行与后台经营协同。
公司披露当前覆盖五省六城、20余家门店,同时宣布“千城万店计划”。后者是扩展目标,与已经落地的门店规模分别记录。


原始来源:公众号:商汤科技SenseTime ↗
21 / AI应用权益
豆包再送:30天订阅权益
豆包9月24日官方活动宣布再次提供30天免费订阅权益,标题注明所有用户均可领取,配图展示30天免费订阅。
豆包官方发布“所有用户都能免费领,豆包再送30天订阅权益”,活动配图明确展示30天免费订阅权益。
用户可到产品内查看领取入口,以及本次权益与自己现有订阅的衔接规则。

原始来源:公众号:豆包 ↗
22 / AI产业应用
安踏电商 Agent:进入订货与退货流程
火山引擎披露安踏电商 Agent 案例:将四套订货模板处理封装为 Skill,下单决策从半天缩至10—20分钟;TikTok 跨境业务月均自动创建1000余张退货单。
安踏团队用 ArkClaw 将货号转换、品类筛选、翻译与格式对齐等环节封装,处理底层数据约90%重合的四套订货模板。按团队披露,完整下单决策从半天缩短到10—20分钟。
另一个 Agent 从跨境电商平台获取退货数据,按 ERP 模板生成单据并汇总状态,目前在安踏 TikTok 跨境业务中月均创建1000余张退货单。内容团队也用 ArkClaw 和 Seedance 2.0 串联热点拆解与商品短片生成,后续计划向更多品牌复用。

原始来源:公众号:火山引擎 ↗
23 / 办公智能体
豆包工作任务升级:增加目标与计划入口
豆包工作官方更新展示“目标”和“计划”两种任务入口:前者提示用户清楚描述成果,后者在执行前先输出计划。
豆包工作9月23日发布任务模式更新。官方配图展示两种选择:在“目标”入口描述期望成果,在“计划”入口描述任务并先取得执行方案。
用户可根据任务清晰程度选择入口:明确成果后委托执行,或先查看计划再推进。

原始来源:公众号:豆包 ↗
24 / AI视频加速
MiniMax-H3 推理提速:5秒视频仅需1.33秒
Nunchux 在8张 AMD MI355X 上运行 MiniMax-H3,报告5秒视频生成用时1.33秒、15秒片段5.39秒;后者比同硬件 SGLang 基线快26.7倍,计时不含最终 MP4 编码。
Nunchux 技术文章公布1344×768分辨率测试,计时包含文本编码、DiT 去噪及音视频 VAE 解码,不含最终 MP4 编码。8卡环境中,5秒片段用时1.33秒,对比 SGLang 为21.8倍;15秒片段用时5.39秒,对比为26.7倍。
这套方案结合模型优化与推理工程。官方演示还展示了流式生成:播放前一段时继续生成后续片段,用户可修改提示词引导后续内容。MiniMax 官方转发了这一进展;免费体验当时仍在等待名单阶段。

原始来源:twitter:MiniMax_AI ↗
25 / AI应用与硬件
小米18 Pro 系列:扩展手机 Agent 能力
小米18 Pro 系列发布后,现场报道展示超级小爱2.0、AI键与百变背屏等 AI 能力,包括任务辅助、信息整理及生成式背屏应用卡。
智东西在9月23日北京发布会现场报道,小米18 Pro 系列围绕超级小爱2.0、AI键及百变背屏加强 AI 交互。报道介绍了记忆、任务辅助、PPT制作及背屏小应用等使用场景。
现场图片展示了AI生成的背屏应用卡,以及与超级小爱相连的交互入口,提供了系统AI和硬件结合的新场景。



原始来源:智东西 ↗
26 / 模型进展
Kimi K3.1 线索:配置出现新模型标识
社区账号 @MaxForAI 于9月23日分享配置截图,其中出现 k3d1-agent 标识,引发对 Kimi K3.1 的讨论;截图尚不足以确认完整规格和发布时间。
原始截图在 Kimi 配置片段中突出标出了 k3d1-agent。周围还可见 K3、推理强度、上下文和 Agent 相关字段,但这些字段的归属与最终开放方式,不能仅凭局部截图完整确定。
这些线索引发了对Kimi新版本的讨论。月之暗面尚未在本次取得的材料中公布完整规格与发布时间。
