OPC 中国专业的人 让好的工作发生

OPC 中国 · AI 日报

Claude云会话、Gemini语音与29条新动态

· 酷恩 · 29 条新闻 · 14 分 47 秒

29条AI动态:先国外16条,再国内13条。聚焦Claude云会话、Gemini语音、小米稀疏模型研究与智能体工具,附逐条原图与来源。

云端开工 声音升级|OPC中国AI日报 2026.09.24|29条新闻|酷恩02

本节目由酷恩选题与编辑,使用AI配音、酷恩02数字卡通形象,以及逐条标明来源的官方演示、厂商配图、原网页截图或原视频实帧。

本期目录 · 先国外,后国内
  1. Claude 云会话正式开放并赠专用额度
  2. Gemini 新语音模型支持设计专属音色
  3. Meta 展示可实时对话的 Muse 形象
  4. ChatGPT 语音接入插件并扩展到 Work
  5. Claude 帮助发现待研究的 ART 酶系统
  6. Google Vids 开放免费 AI 视频入口
  7. GPT‑6 Sol 网页开发评测排第四
  8. Opus 5.5 新评测揭示任务成本
  9. YouTube 直播自动配音明年试点
  10. Antigravity CLI 修复后台任务等待
  11. Recraft Flash 推出低成本出图档
  12. Altman 在安理会提出 AI 安全机制
  13. Gemini 扩充连接应用,聊天直接调用工具
  14. Mitra 推出电话助手,可随时让人接管
  15. Ollama 明确改档会转入按量计费方案
  16. Google Flow 开放六个创作者工作流工具
  17. 小米公布 HySparse2 长上下文架构论文
  18. 千问语音 3.1 更新五款模型并下调价格
  19. WorkBuddy 企业版接入五款办公产品
  20. H3 Max 用三维预演引导视频生成
  21. 讯飞 Spark-ASR-2.0 开始逐步上线
  22. DeepSeek 今晨性能下降已恢复
  23. 千问 AI 平台扩展智能体服务
  24. Kimi Code CLI 2.1.0 增加全屏模式
  25. Qoder 把项目与智能体讨论接在一起
  26. Qwen3.8 Max Prime 接入 OpenRouter
  27. PixVerse R2 探索实时互动视听世界
  28. Qoder 每日四千积分活动明天结束
  29. ima 提供八类行业二十四条工作流

国外新闻

01 / 编程工具与额度

Claude 云会话正式开放并赠专用额度

Claude Code 云会话退出研究预览,现有 Pro 与 Max 用户分别可领 100、250 美元一次性云会话赠额。需连接 GitHub,太平洋时间 10 月 7 日 23:59 前领取,11 月 4 日 23:59 到期。

Anthropic 宣布 Claude Code 云会话正式退出研究预览,任务运行在其托管基础设施上,用户关闭笔记本后仍可继续执行。现有 Pro 订阅用户可领取 100 美元,Max 用户可领取 250 美元的一次性专用额度;通过领取页面或命令行的 /claim-credit 操作,开始会话前需要连接 GitHub。

赠额只用于云会话,会在启动云任务时自动应用,优先于订阅原有用量消耗;赠额用完后,云会话回到套餐原有限额。官方配图还列明两个不同时间点:须在太平洋时间 10 月 7 日 23:59 前领取,额度于 11 月 4 日 23:59 到期。对需要持续执行的编程任务,这提供了一次有明确金额和期限的云端体验机会。

来源:ClaudeDevs 官方公告配图;领取与使用到期时间均为太平洋时间。
来源:ClaudeDevs 官方公告配图;领取与使用到期时间均为太平洋时间。

原始来源:Anthropic / ClaudeDevs ↗

02 / 模型发布 / 音频

Gemini 新语音模型支持设计专属音色

Gemini 3.8 Flash TTS 支持自然语言音色设计、2,000 多种现成声音及经过同意验证的声音复制;Flash 与 Flash-Lite 均提供逐行表演和双人对白控制,开发者入口开始推出。

Google 于 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS。Flash 面向音色设计和创作,可用自然语言描述角色、口音与声音特点,也提供 2,000 多种现成音色。声音复制使用约 30 秒样本,并要求声音所有者提供匹配的口头同意录音。Flash-Lite 则面向大规模配音和语音代理。

两款模型都支持逐行安排情绪、节奏和舞台提示,从同一份脚本组织双人对话,还能插入笑声和回应,并可生成长篇音频。官方演示展示了文字设计声音和双人对白编辑界面。开发者可通过 Gemini API 与 AI Studio 开始体验;音色混合和企业版 API 尚待推出。Vids 专文将新旁白功能列为即将提供,因此本期按该具体开放范围表述。

来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。
来源:Google 官方音色设计与 Table Read 双人对白演示;画面为官方产品演示。

原始来源:Google ↗

03 / AI 多模态研究

Meta 展示可实时对话的 Muse 形象

Meta 公布 Muse Realtime Avatar,通过共享语音信息流生成同步的声音、口型和动作。官方演示以 448×768、25 帧运行,端到端首字节延迟约 870 毫秒,部分展示角色尚未进入 Muse App。

Meta 研究团队于 9 月 23 日介绍 Muse Realtime Avatar,让参考图像中的人物、插画、动物或物体进入实时对话。语音系统负责理解对话并输出语音信息,头像模型读取同一信息流,生成相应的嘴部、面部、手部和身体动作;连续生成的视频片段保留近期上下文,以维持角色外观和动作一致。

官方给出的展示配置为 448×768 竖屏画面、每秒 25 帧。从用户结束发言,到收到同步语音与视频响应的第一个字节,延迟约为 870 毫秒。博客中的演示体现研究模型能力,角色尚未全部在 Muse App 提供,应用面向十八岁以上用户。对虚拟主持和交互角色,这项研究的看点是连续对话中的动作与声音协同。

来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。
来源:Meta AI Research 官方 Muse Realtime Avatar 研究演示;非本节目生成或实测。

原始来源:Meta AI Research ↗

04 / AI 产品功能

ChatGPT 语音接入插件并扩展到 Work

OpenAI 开始为 ChatGPT Voice 推出插件调用和 Work 网页、移动端支持,可用语音安排文档、表格及浏览器任务。Free 和 Go 按套餐使用插件,Voice in Work 需同时具备 Voice 与 Work 权限。

OpenAI 于 9 月 23 日宣布,ChatGPT Voice 开始支持账户已有的插件与连接应用,并扩展到 Work 的网页和移动端。用户可以通过语音调用邮箱、日历等工具,让 Astra、Sol 或 Luna 处理文档、演示文稿、表格和浏览器任务;通话过程中可阅读文字回复,结束 Work 语音后,未完成的任务还能继续在文字对话中推进。

更新逐步推送,实际可用工具取决于账户原有连接、授权和套餐。Free 与 Go 用户可在 Chat 的语音中调用套餐支持的插件;在 Work 中使用语音则需要同时具备 Voice 和 Work 访问权限。原有用量限制继续适用。本次变化把语音交流与现有工作能力接在一起,让用户能边说边安排具体任务。

来源:OpenAI 本次 Voice 公告所附官方宣传片;插件与 Work 范围依据官方更新说明。
来源:OpenAI 本次 Voice 公告所附官方宣传片;插件与 Work 范围依据官方更新说明。

原始来源:OpenAI / ChatGPT ↗

05 / AI 科学研究

Claude 帮助发现待研究的 ART 酶系统

Anthropic 介绍新生命科学实验室的早期结果:Claude 在噬菌体基因数据中识别 ART 系统的关键关联特征,人类实验观察到短 RNA 表达。成果为预印本,系统功能仍待研究。

Anthropic 于 9 月 23 日公布新生命科学研究团队的早期结果。Claude 在噬菌体基因数据中识别出与逆转录酶相邻的重复 DNA 阵列及伴随蛋白,团队将这一组合称为阵列相关逆转录酶系统,即 ART。底层逆转录酶此前已见于研究,本次新发现集中在系统关联特征及其进一步分析。

研究人员随后进行实验,观察到 ART 阵列会表达一组不同的短 RNA。全部实验室操作由人类科学家完成,论文目前以预印本形式公开,团队仍在研究系统的主要功能。它与 CRISPR 的相似之处涉及重复阵列形态及研究线索,现阶段的成果是提出并初步验证新的生物学问题,后续功能与应用还需要继续实验。

来源:Anthropic 官方生命科学实验室视频及 ART 原始 DNA 图;实验由人类科学家完成。
来源:Anthropic 官方生命科学实验室视频及 ART 原始 DNA 图;实验由人类科学家完成。
来源:Anthropic 官方生命科学实验室视频及 ART 原始 DNA 图;实验由人类科学家完成。
来源:Anthropic 官方生命科学实验室视频及 ART 原始 DNA 图;实验由人类科学家完成。
来源:Anthropic 官方生命科学实验室视频及 ART 原始 DNA 图;实验由人类科学家完成。
来源:Anthropic 官方生命科学实验室视频及 ART 原始 DNA 图;实验由人类科学家完成。

原始来源:Anthropic ↗

06 / AI 视频产品

Google Vids 开放免费 AI 视频入口

Google Vids 向 Google 与 Workspace 账户开放 Gemini Omni 1.1 Flash 基础免费生成入口,增加场景延长、指定时长和 1080p 控制;更多额度随套餐提供,新 TTS 旁白尚待开放。

Google 于 9 月 23 日宣布,拥有 Google 或 Workspace 账户的用户可通过 Vids 使用 Gemini Omni 1.1 Flash 的基础免费视频生成入口。在桌面打开 vids.new,选择创建 AI 视频即可开始。新控制允许延长场景、指定片段时长,并生成 1080p 高清画面或将已有 AI 片段放大,便于与配音和时间线配合。

官方演示展示了参考图、提示词、时长与扩展场景的编辑流程。每段生成视频都会嵌入 SynthID 数字水印。个人用户如需更多生成量,可查看 Google AI 套餐;Workspace 商业及企业方案提供扩展额度与管理能力。专文把 Gemini 3.8 Flash-Lite 语音旁白列为即将提供,当前免费入口的重点仍是视频生成与编辑,基础入口之外的可用额度以套餐为准。

来源:Google Workspace 官方 Vids 演示;含生成设置、参考图和延长场景操作界面。
来源:Google Workspace 官方 Vids 演示;含生成设置、参考图和延长场景操作界面。
来源:Google Workspace 官方 Vids 演示;含生成设置、参考图和延长场景操作界面。
来源:Google Workspace 官方 Vids 演示;含生成设置、参考图和延长场景操作界面。

原始来源:Google Workspace ↗

07 / 模型评测

GPT‑6 Sol 网页开发评测排第四

Arena 的 Code Arena WebDev 新结果将 GPT‑6 Sol Max 排在第四,1689 分,比 GPT‑5.6 Sol xHigh 高 72 分。

Arena 于 9 月 23 日公布 GPT‑6 Sol Max 的 Code Arena WebDev 结果:模型获得 1689 分,位列第四。相较此前 GPT‑5.6 Sol xHigh 的成绩提升了 72 分,两个型号采用的推理档位分别为 Max 和 xHigh。此次更新的核心是模型发布后积累的真实用户投票数据。

官方帖还列出子类别变化:模拟、内容创作和游戏均进入第三名,消费产品与参考设计进入第四名。这些成绩描述网页开发任务中的用户偏好,可为网页制作选型提供参考。同期 Luna 的该榜投票仍在收集中,Arena 尚未在这条更新中给出其最终成绩。

来源:Arena 官方 Code Arena WebDev 排名与成本图;2026‑09‑23。
来源:Arena 官方 Code Arena WebDev 排名与成本图;2026‑09‑23。
来源:Arena 官方 Code Arena WebDev 排名与成本图;2026‑09‑23。
来源:Arena 官方 Code Arena WebDev 排名与成本图;2026‑09‑23。

原始来源:Arena ↗

08 / 模型评测

Opus 5.5 新评测揭示任务成本

Artificial Analysis 的最新性能与成本分析显示,Opus 5.5 在指定配置下获得 58 分,基准任务加权平均成本为 5.98 美元。

Artificial Analysis 于 9 月 23 日更新模型性能与任务成本前沿图,Claude Opus 5.5 在 max with fallback 配置下取得 58 分,成为该图当时最高分模型。其 Intelligence Index 每任务加权平均成本为 5.98 美元,接近此前 Opus 5 Max 的 5.86 美元。

成本拆解显示:新模型 token 用量增加,按旧价格计算会推高至约 10.51 美元;基础价格下调后降至约 8.41 美元,进一步的缓存读取折扣再将其压至 5.98 美元。这些数字来自评测机构固定任务的加权统计,选型时仍应结合自己的任务结构和缓存命中情况。

来源:Artificial Analysis 原始成本瀑布图及性能/成本动画;2026‑09‑22 至 23 日。
来源:Artificial Analysis 原始成本瀑布图及性能/成本动画;2026‑09‑22 至 23 日。
来源:Artificial Analysis 原始成本瀑布图及性能/成本动画;2026‑09‑22 至 23 日。
来源:Artificial Analysis 原始成本瀑布图及性能/成本动画;2026‑09‑22 至 23 日。

原始来源:Artificial Analysis ↗

09 / AI视频与直播

YouTube 直播自动配音明年试点

YouTube 计划在 2027 年初试点直播自动配音,实时翻译主播语音,帮助不同语言的观众收听。

YouTube 在 9 月 23 日的 Made on YouTube 活动中介绍直播自动配音计划。专项官方博客明确,Live auto dubbing 将从 2027 年初开始试点,目标是在主播讲话时实时翻译语音,让观众使用自己偏好的语言收听直播。

平台称,目前超过四成直播观看时长来自主播所在国家以外,跨语言收听因而是扩大观众覆盖的重要方向。此次公告给出了功能目标与试点时间,没有列出完整支持语种、参与主播范围和各地区开放安排。现阶段适合关注并规划跨语言直播内容,具体使用条件仍需等待 YouTube 后续公布。

来源:YouTube 官方博客直播自动配音段落实景;明确写有 early 2027。
来源:YouTube 官方博客直播自动配音段落实景;明确写有 early 2027。

原始来源:YouTube Official Blog ↗

10 / 编程工具

Antigravity CLI 修复后台任务等待

Antigravity CLI 1.2.9 增加对子代理的定向消息,并让无界面任务按设置等待后台工作,最高等待 30 分钟。

Google Antigravity CLI 于 9 月 23 日发布 1.2.9。新版加入 @<subagent> <message> 提示语法,可以直接向指定子代理会话发送消息,自动补全同时列出运行中和已完成的子代理,便于用户继续跟进已经拆分的工作。

本次还修复了脚本使用中的等待逻辑:此前 headless 运行可能在代理闲置约五秒后取消仍在进行的后台任务,如今会等待至 --print-timeout 规定的期限,上限为三十分钟。更新同时处理运行退出后的守护进程残留、并发访问会话数据库时的锁风险,以及部分上下文压缩和流式响应异常,相关变化均以官方发行说明为准。

来源:google-antigravity/antigravity-cli 官方 GitHub 1.2.9 发行页实景。
来源:google-antigravity/antigravity-cli 官方 GitHub 1.2.9 发行页实景。

原始来源:Google Antigravity ↗

11 / 图像模型

Recraft Flash 推出低成本出图档

Recraft V4.1 Flash 上线,面向快速迭代的文生图需求,OpenRouter 标价每张 0.007 美元,输出约 1K 位图。

Recraft V4.1 Flash 于 9 月 23 日上线,OpenRouter 模型页将其定位为 V4.1 家族中强调速度与成本的一档。平台标价每张 0.007 美元,输出约 1K 分辨率位图,并表示适用于原型、快速迭代和较大批量的生成任务。相关速度描述为平台自报,本次没有进行独立生成测速。

功能上,这一档采用文字输入生成图片,不支持图片输入、风格或风格参考;页面列出的可控参数包括色板和背景色,支持多种常见画幅。对创作者而言,它可以用于较低成本地比较早期构图和创意方向。需要按参考图延续品牌风格或编辑现有图片时,则应根据对应能力选择其他模型。

来源:fal 官方 Recraft V4.1 Flash 演示视频及实帧;展示的是厂商生成样例。
来源:fal 官方 Recraft V4.1 Flash 演示视频及实帧;展示的是厂商生成样例。
来源:fal 官方 Recraft V4.1 Flash 演示视频及实帧;展示的是厂商生成样例。
来源:fal 官方 Recraft V4.1 Flash 演示视频及实帧;展示的是厂商生成样例。

原始来源:Recraft / OpenRouter / fal ↗

12 / AI 治理

Altman 在安理会提出 AI 安全机制

Altman 在联合国安理会呼吁建立前沿 AI 标准、事故报告机制和安全信息共享渠道,强调人类监督与各国制度选择。

9 月 23 日,OpenAI 首席执行官 Sam Altman 在联合国安理会就人工智能发言。OpenAI 公布的讲话全文将先进系统的人类控制、权力集中风险和国际合作作为重点,并提出以相互配合的国家与国际标准,衡量能力、评估风险和判断保护措施是否充分。

他还建议建立快速、准确的事故分类与报告机制,让各方从失败中学习;由政府、关键基础设施运营方和技术专家通过安全渠道共享新漏洞与威胁。按照讲话中的设想,共同标准应兼顾开放与封闭模型开发者、新进入者及成熟机构,各国政府决定如何纳入自身法律制度。这些内容属于本次发言提出的治理建议。

来源:联合国 UN Web TV 第 10228 次安理会会议原始录像;画面中为 Sam Altman 现场发言。
来源:联合国 UN Web TV 第 10228 次安理会会议原始录像;画面中为 Sam Altman 现场发言。
来源:联合国 UN Web TV 第 10228 次安理会会议原始录像;画面中为 Sam Altman 现场发言。
来源:联合国 UN Web TV 第 10228 次安理会会议原始录像;画面中为 Sam Altman 现场发言。

原始来源:OpenAI / UN Web TV ↗

13 / AI 产品功能

Gemini 扩充连接应用,聊天直接调用工具

Google 为 Gemini 逐步增加生产力、创意和生活类连接应用,用户可在聊天中调用第三方服务,实际开放以账户和授权情况为准。

Google 9月23日宣布,Gemini 开始逐步接入新一批连接应用。生产力类别包括 Airtable、Linear、monday.com、PandaDoc、Wispr AI 与 Zoho;创意类别包括 Adobe、Picsart、Squarespace 与 Webflow,生活类别则覆盖租房、信用、健身和票务等服务。

用户可在 Gemini 设置里连接应用,或在聊天中使用 @ 提及及直接提出任务。官方将项目管理、素材设计和健身规划列为使用场景,意在减少来回切换工具的步骤。应用正在逐步推出,可见服务与账户、地区及第三方授权有关;实际使用时,可先确认自己常用的服务是否已经出现在连接列表中。

来源:Google Gemini 官方发布视频与公告原图
来源:Google Gemini 官方发布视频与公告原图
来源:Google Gemini 官方发布视频与公告原图
来源:Google Gemini 官方发布视频与公告原图

原始来源:Google Gemini ↗

14 / AI Agent 产品

Mitra 推出电话助手,可随时让人接管

Mitra 发布以电话为入口的个人 AI 助手,官方展示了通话协调、向用户请示和接管流程,并宣布提供 iOS、iPad 与桌面端入口。

Mitra 创始人9月23日宣布产品上线,定位为手机上的个人 AI 助手。官方介绍称,它可用用户自己的号码拨打和接听电话;用户可以实时旁听、悄悄给出指示,也能随时接管。创始人同时宣布提供 iOS、iPad 和桌面端入口,并以订阅方式经营。

发布视频展示了助手在通话中接收延期请求,向用户传递信息,再按用户回复继续协调的过程;另一个场景中,它把需要本人参与的问题带回聊天。官网还介绍预约、短信、邮件、文档和网页任务等能力。这些材料说明了产品设计与交互方式,任务可靠性、地区支持和具体服务条件仍需以实际使用及产品说明为准。

来源:Mitra 创始人官方发布演示实帧
来源:Mitra 创始人官方发布演示实帧
来源:Mitra 创始人官方发布演示实帧
来源:Mitra 创始人官方发布演示实帧

原始来源:Mitra ↗

15 / 订阅与计费

Ollama 明确改档会转入按量计费方案

Ollama 官方明确,变更 Pro/Max 档位或月付、年付账期,会迁移至按 token 计费的方案;回复未公布新的具体单价。

Ollama 9月23日在官方账号回复订阅问题时表示,目前变更套餐档位,包括 Pro 与 Max 之间的调整,或者变更月付、年付账期,都会迁移到按 token 计费的方案。这条回复补充的是订阅变更的触发条件,准备升级、降级或调整付款周期的用户需要关注。

对订阅者来说,比较套餐时应把付款周期、使用档位与计费方式放在一起核对,而不只看月付和年付之间的金额差异。此次回复没有给出新方案具体单价,也没有在这段文字中宣布所有保持原订阅的用户统一迁移。本文范围限于官方明确提到的两类变更操作,实际办理前应核对账户页面所列条件。

来源:Ollama 官方回复原网页存档截图
来源:Ollama 官方回复原网页存档截图
来源:Ollama 官方回复原网页存档截图
来源:Ollama 官方回复原网页存档截图

原始来源:Ollama ↗

16 / AI 创作工具

Google Flow 开放六个创作者工作流工具

Google Flow 发布六个创作者参与设计的具体工具,覆盖音效、字幕、缩略图、材质与动效,支持复制和修改工作流。

Google Labs 9月23日公布六个 Flow 工具,来自声音设计、建筑、影视与数字内容等创作领域。Mondo Sónico 生成环境声、拟音与情境音效,并同步到可编辑的独立轨道;Surface 则生成定制建筑纹理,实时映射到三维墙面、天花板和地板,方便在构思阶段比较材料效果。

其余工具覆盖字幕、缩略图、动态拼贴和动态图形等步骤。官方为工具提供试用入口,用户可复制并修改,也能在 Flow 中描述任务来建立自己的工作流。此次开放的是六个具体工具,使用权限与可消耗的额度仍以 Flow 账户和界面提示为准。

来源:Google Labs 官方动态演示与实帧
来源:Google Labs 官方动态演示与实帧
来源:Google Labs 官方动态演示与实帧
来源:Google Labs 官方动态演示与实帧

原始来源:Google Labs ↗

国内新闻

17 / 模型架构

小米公布 HySparse2 长上下文架构论文

小米 MiMo 团队公布 HySparse2 论文,以两级 KV 共享改善长上下文推理;作者在百万 token 条件下报告预填充计算量和 KV 缓存降低,属于原型研究结果。

小米 MiMo 团队的 HySparse2 论文于9月22日提交 arXiv,作者在9月23日进一步介绍了架构。方案采用两级 KV 共享:跨解码器连接复用已有状态,稀疏层再共享注意力层缓存,并把块级选择细化为 token 级选择,减少长上下文中重复的预填充工作。

论文以总参数80B、激活参数3B的混合专家原型进行实验。作者表示,相比 MiMo-V2.6 的混合滑窗架构,在100万 token 条件下,预填充计算量降至约1/5.02,KV 缓存降至约1/4.5,同时报告长上下文检索与多轮智能体指标改善。这是特定实验条件下的架构研究,作者将其联系到下一代 MiMo;当前公布的成果为论文及原型结果。

来源:HySparse2 作者原帖与论文图表
来源:HySparse2 作者原帖与论文图表

原始来源:小米 MiMo 研究团队 ↗

18 / 语音模型

千问语音 3.1 更新五款模型并下调价格

千问发布 Qwen-Audio-3.1 五款语音模型,分别公布 TTS、Realtime 和 ASR 降价幅度;TTS-Next 可生成综合音频,ASR-Next API 尚待上线。

阿里语音AI于9月23日公布 Qwen-Audio-3.1 系列,覆盖语音识别、音频理解、语音合成、音频创作与实时交互。官方同时调整相应产品价格:TTS 约下降70%,Realtime 约下降85%,ASR 降幅最高95%。这些比例分别对应不同产品,实际成本仍与所用模型及调用量有关。

新版本中,TTS-Next 从单一人声合成扩展为统一生成对白、音效和环境声,可按脚本维持多角色声音并控制时间;Realtime 支持全双工对话与工具调用。官方文章列出四款模型的千问AI平台入口,同时明确 ASR-Next API 即将上线。此次新增信息集中在具体版本、能力与价格,使用时应按各模型的开放状态选择。

来源:阿里语音AI官方发布原图与云栖大会现场照片
来源:阿里语音AI官方发布原图与云栖大会现场照片
来源:阿里语音AI官方发布原图与云栖大会现场照片
来源:阿里语音AI官方发布原图与云栖大会现场照片

原始来源:阿里千问 ↗

19 / 企业智能体

WorkBuddy 企业版接入五款办公产品

腾讯 9 月 23 日宣布 WorkBuddy 企业版套件化升级,首批接入腾讯文档、乐享、网盘、安全与效能运营平台和 Ardot。官方称主订阅价格不变,新增产品会员权益与统一 Credit 池;腾讯网盘企业个人容量由 5GB/人提高至 50GB/人。

腾讯于9月23日宣布 WorkBuddy 企业版套件化升级,首批接入腾讯文档、腾讯乐享、腾讯网盘、安全与效能运营平台和 AI 设计智能体 Ardot。企业购买主订阅后可获得这五款产品的会员权益,官方称订阅价格保持不变,各产品 AI 功能共用企业 Credit 池,管理员统一管理用量。

套件重点在账号、办公记忆与数据衔接:文档及背景可随任务交给 WorkBuddy,设计初稿可在 Ardot 中继续精修和协作,经过确认的成果可回存知识体系。腾讯网盘企业个人容量由5GB/人提升至50GB/人,具体权限与开通条件以企业服务页面和合同为准。

腾讯 WorkBuddy 官方套件与管理界面
腾讯 WorkBuddy 官方套件与管理界面
腾讯 WorkBuddy 官方套件与管理界面
腾讯 WorkBuddy 官方套件与管理界面

原始来源:腾讯 WorkBuddy / 腾讯云 ↗

20 / 视频模型与创作

H3 Max 用三维预演引导视频生成

fal 9 月 23 日宣布 H3 Max 上线 3D-to-Video,可上传最长 15 秒的 Blender 预演,生成写实视频,并用参考图引导人物与环境。源片主要提供布局、镜头运动和动作节奏。

fal 于9月23日宣布 H3 Max 的 3D-to-Video 功能上线。用户可上传最长15秒的 Blender 预演,并加入参考图引导生成结果。平台说明,源视频主要提供场景布局、镜头运动与动作节奏,成片细节和几何形态可能与预演有所不同。官方示例展示了低细节三维海岸场景向写实飞机镜头的转换。

使用成本需结合完整规则计算:页面列出每次0.50美元处理费,视频部分最低按5秒计费,还可能涉及超额输入与自动参考图费用。本条采用官方预演及结果样片展示工作方式;画面属于模型生成案例,效果和速度没有经过本机独立测评。

fal 官方 Blender 预演及 H3 生成样例 · 静音
fal 官方 Blender 预演及 H3 生成样例 · 静音

原始来源:MiniMax / fal ↗

21 / 语音模型

讯飞 Spark-ASR-2.0 开始逐步上线

科大讯飞 9 月 23 日发布 Spark-ASR-2.0,称在中英混说、方言、噪声和文本整理上改进。官方表示 9 月 24 日起逐步上线讯飞输入法,并通过开放平台提供 API;识别表现和推理成本变化为厂商测试口径。

科大讯飞于9月23日发布 Spark-ASR-2.0,并表示从9月24日起逐步上线讯飞输入法,同时通过开放平台提供 API 与体验入口。新版结合非自回归和 LLM 增强自回归、中英文混合文本与声学联合增强、动态上下文注入,重点改善方言、专业术语和复杂声学条件下的识别。

官方还介绍了结合识别历史、修改记录与个性化热词消除歧义,以及精简重复表达、整理文本的能力。随文图表属于讯飞测试口径;公告称2.0相对1.0的整体推理成本增加10%。原文提到的成本下降84%是上一代1.0的历史改进,不能套用到本次升级。

科大讯飞官方评测与技术架构图
科大讯飞官方评测与技术架构图
科大讯飞官方评测与技术架构图
科大讯飞官方评测与技术架构图

原始来源:科大讯飞 ↗

22 / 服务状态

DeepSeek 今晨性能下降已恢复

DeepSeek 官方状态页记录北京时间9月24日06:20开始的新一轮网页/API性能下降,最新于07:08宣布恢复。页面涉及对话服务、V4.1 Flash与V4 Pro API;这是与9月23日下午已结束故障不同的事件。

DeepSeek 官方状态页记录,北京时间9月24日06:20出现新一轮网页/API性能下降,受影响组件包括对话服务、DeepSeek V4 Pro API与V4.1 Flash API。页面在07:08更新为已恢复,本次制作时再次打开原始事件页,仍显示服务已恢复。

事件记录总跨度为48分钟,其中06:40曾标记恢复,06:48重新进入排查,之后持续更新至07:08。这个跨度不能解释为连续48分钟全站不可用。该事件与9月23日下午已结束的故障分别记录,官方暂未在当前事件页说明原因。

DeepSeek 官方状态页 · 制作时实拍
DeepSeek 官方状态页 · 制作时实拍

原始来源:DeepSeek Status ↗

23 / 开发平台

千问 AI 平台扩展智能体服务

千问 AI 平台 9 月 23 日官方发文回顾前一日大会宣布 Agent Studio 企业服务和 API 优速模式,后者宣称 TPS 提升 1.5 至 2 倍。Token Plan 覆盖多家模型,Agent API 仍属即将发布。

阿里云9月23日官方文章回顾前一日云栖大会发布的千问 AI 平台升级:平台从模型服务扩展到 Agent 服务和行业解决方案,企业级 Agent Studio 支持任务路由、持续托管、企业知识数据与外部服务接入。原子 API 覆盖运行环境、长期记忆、工具、会话和部署等环节。

模型服务新增 API 优速模式,官方称切换 model ID 后 TPS 可提升1.5至2倍;Token Plan 以一份订阅覆盖 Qwen、Kimi、GLM、DeepSeek 等模型。吞吐数据属于平台宣传口径。把环境、记忆、工具和部署合为一次请求的 Agent API,以及自进化引擎,仍属于后续发布计划。

阿里云官方 Agent Studio 与模型服务图
阿里云官方 Agent Studio 与模型服务图
阿里云官方 Agent Studio 与模型服务图
阿里云官方 Agent Studio 与模型服务图

原始来源:阿里云千问 AI 平台 ↗

24 / 编程工具

Kimi Code CLI 2.1.0 增加全屏模式

Kimi官方9月23日更新记录发布CLI 2.1.0,加入实验性全屏界面,改善启动与内存表现。文件监听默认关闭,工作区外符号链接访问受限,项目本地配置在工作区受信任后生效。

Kimi Code 官方9月23日更新记录发布 CLI 2.1.0。实验性全屏模式提供独立滚动的 transcript、鼠标选择、折叠块点击展开和跳到底部入口,用户可在设置里的 TUI mode 开启,或修改对应配置后重启。公告同时说明启动时间和内存占用有所改善,没有给出量化测试数据。

这次更新把配置及工作区文件监听设为默认关闭,需要热更新 AGENTS.md、skills 或 MCP 配置时可自行启用 watch。文件工具限制通过符号链接访问工作区外文件,项目本地配置仅在工作区被信任后生效,并新增自动会话标题开关。这是 CLI 更新,与此前浏览器扩展的技能录制功能分别处理。

Kimi Code 官方版本记录实拍
Kimi Code 官方版本记录实拍

原始来源:月之暗面 / Kimi ↗

25 / 编程智能体

Qoder 把项目与智能体讨论接在一起

Qoder 9 月 23 日官方长文发布 Projects 与 Discussion,以 Issue 组织任务并让同事和专业 Agent 在同一讨论中协作。项目、讨论及相关自定义 Agent 功能目前处于 beta,Teams 与 Enterprise 订阅优先体验。

Qoder 于9月23日介绍 Projects 和 Discussion 协作功能。Projects 面向多人研发,将新功能、缺陷与技术改造拆成 Issue,记录负责人、优先级和状态。Discussion 支持同事和专业 Agent 在同一讨论中补充上下文、比较方案,并将已确认的要求标记为关键信息,交给后续执行环节。

团队可按任务定制 Agent,也可让 Agent Team 分工处理复杂任务,产出的代码变更、测试结果或 PR 链接返回任务供人检查。项目、讨论、自定义智能体与智能体团队均处于 beta 阶段,Teams 和 Enterprise 订阅用户优先体验,之后逐步扩大开放。

Qoder 官方云栖大会协作发布图
Qoder 官方云栖大会协作发布图

原始来源:Qoder ↗

26 / 模型服务与定价

Qwen3.8 Max Prime 接入 OpenRouter

OpenRouter 9 月 23 日宣布接入 Qwen3.8 Max Prime,模型页将其列为 Qwen3.8 Max 的更高吞吐独立SKU。支持百万Token上下文、文本图像视频输入、工具调用及结构化输出,页面输入输出价为每百万Token 4/12 美元。

OpenRouter 于9月23日宣布接入 Qwen3.8 Max Prime,模型页将其列为 Qwen3.8 Max 的更高吞吐版本,作为单独 SKU 以更高价位提供。页面说明它支持1M Token上下文、文本和图像及视频输入、文本输出,并支持工具调用、结构化输出和可配置推理。

本次读取时,OpenRouter 页面输入与输出标价分别为每百万Token 4美元、12美元,缓存读取另有计价。平台上的平均实付统计可能因缓存等因素而低于标价。本条介绍渠道与吞吐档位的变化,未进行速度实测,也不据此推断通用能力比 Max 更强或其他渠道采用相同价格。

OpenRouter 原始模型与价格页
OpenRouter 原始模型与价格页

原始来源:阿里千问 / OpenRouter ↗

27 / 视频与世界模型

PixVerse R2 探索实时互动视听世界

PixVerse 9 月 22 日官方博客介绍 R2 实时世界模型,以文字、参考素材、音频与动作持续驱动视听世界。博客称其世界体验已向用户开放,具体交互质量仍需后续独立实测。

PixVerse 于9月22日发布 R2 实时世界模型介绍,强调文字、参考素材、音频和动作可以持续参与视听生成。官方展示的交互世界涵盖人物移动、车辆、滑雪与不同艺术风格场景,另一个示例则展示在屏幕中与角色交谈,输入会影响后续体验。

官方博客称相关世界体验已向用户开放。本期采用该页面原始演示及实帧呈现产品方向,明确属于厂商生成样例。连续画面质量、输入响应延迟和复杂任务下的稳定性尚未由本节目独立验证,不能仅凭官方剪辑样片推导实际使用表现。

PixVerse R2 官方互动世界与角色样例 · 静音
PixVerse R2 官方互动世界与角色样例 · 静音

原始来源:PixVerse ↗

28 / 活动与额度

Qoder 每日四千积分活动明天结束

Qoder9月21日官方公众号宣布,个人版及企业版付费用户在9月21日至25日每天12:00可领取4000 Credits,全部用于Sonus模型。每轮资源次日12:30失效,最后一轮到9月26日12:30失效;CLI可用/claim领取。

Qoder 9月21日公布的节前活动持续至9月25日:个人版及企业版付费用户每天12:00可领取4000 Credits,全部用于 Sonus 模型,每个账户每轮限领一次。Qoder、IDE与JetBrains插件可在用量面板领取,CLI 可使用 /claim。官方也向部分非付费用户发出定向额度提醒,是否获得以客户端通知为准。

当期资源包在次日12:30失效,未用完的额度不会累计,错过领取也不补发。最后一轮于9月25日开放,9月26日12:30失效。本条作为活动截止提醒收录,并非9月24日新发布的产品功能;使用前应留意 Sonus 的积分消耗情况。

Qoder 官方 Sonus 积分活动图
Qoder 官方 Sonus 积分活动图

原始来源:Qoder ↗

29 / 办公智能体

ima 提供八类行业二十四条工作流

ima 9 月 23 日官方文章按八类行业列出每类三条工作流,涵盖资料整理、教育、内容创作等场景。它提供可直接选择的行业流程示例;实用效果仍需具体用户验证。

腾讯 ima 9月23日官方文章介绍24条行业工作流,按通用、教育、金融、内容创作、互联网、政务、市场营销与法律八类组织,每类三条,覆盖调研报告、教案、选题、竞品分析等常见任务。详情页提供同行使用案例,帮助用户判断与自己的工作是否匹配。

使用入口在 ima 的用量统计页:进入行业工作流活动,选择行业,在详情页点击“试试同款工作流”,预填指令会进入 copilot 对话。用户可根据实际任务补充材料和要求。模板降低了起步成本,涉及专业判断的产物仍需核对来源、事实与适用条件。

腾讯 ima 官方行业工作流界面
腾讯 ima 官方行业工作流界面
腾讯 ima 官方行业工作流界面
腾讯 ima 官方行业工作流界面
腾讯 ima 官方行业工作流界面
腾讯 ima 官方行业工作流界面

原始来源:ima.copilot ↗

← 返回日报归档