OPC 中国 · AI 日报
2026年10月1日AI日报:Gemini Argon测试登榜,豆包出行升级
18条AI消息,涵盖测试模型、开发工具、出行服务、语音识别和开源基础设施。保留原文日期、来源与适用限制。

数字卡通主持人与AI配音;新闻图片/演示来自对应原始出处。豆包出行使用本期授权的官方原图方案;不把媒体内测消息当正式上线。
本期目录 · 先国外,后国内
- Gemini 4 Argon 长任务推理新模型
- Gemini Skills 重复任务一键复用
- GPT-6.1 Sol 新评测 成绩与成本一起看
- AI 视频榜升级 统一1080p评审
- Cloudflare Auto Router 按任务自动挑模型
- HeyGen Video 面向企业的视频模型
- Creatify Boreal-H3 让广告画面更一致
- OpenClaw Enterprise 企业 Agent 控制面
- Databricks ai_decide 直接返回结构化决策
- AStudio 国庆积分 打卡福利有领取条件
- DeepSeek × 昇腾 基础组件与实践开源
- 豆包出行升级 对话订票、打车、导航
- Spark-ASR-2.0 语音识别 API 上线
- Index-Translate 35B 多语翻译模型预览开源
- Ling 3.1 Flash 限时免费体验
- 千帆国庆优惠 两类权益分开看
- DeepSeek DSec 大规模 Agent 沙盒
- 媒体消息:小豆 个人助手仍在内测
国外新闻
01 / 模型发布
Gemini 4 Argon 长任务推理新模型
Google 宣布新前沿模型 Gemini 4 Argon,输出上限从64K提升至100万 Token,主攻编程、知识工作和网络安全防御。当前通过 Fairwind Program 向可信防御者和测试者开放,并未全面上线。官方公布未来推出时的入门价格为输入2美元、输出10美元/百万Token;入门期结束后为4美元和20美元,缓存输入优惠95%。随后优先扩展至付费API客户与Google AI Ultra订阅者。
Google 宣布新前沿模型 Gemini 4 Argon,输出上限从64K提升至100万 Token,主攻编程、知识工作和网络安全防御。当前通过 Fairwind Program 向可信防御者和测试者开放,并未全面上线。官方公布未来推出时的入门价格为输入2美元、输出10美元/百万Token;入门期结束后为4美元和20美元,缓存输入优惠95%。随后优先扩展至付费API客户与Google AI Ultra订阅者。
谷歌官方将输出容量扩大与长任务推理联系起来,并列举大型代码迁移、企业知识工作和安全防御的内部应用。原文给出的入门价为每百万输入 Token 2美元、输出10美元,入门期结束后为4美元和20美元,缓存输入享95%价格减免。开放对象和后续上线进度应以官方实际发布为准。


原始来源:Google DeepMind ↗
02 / 产品更新
Gemini Skills 重复任务一键复用
Gemini 对话开始推出可复用、可叠加的 Skills,可用斜杠调用并附文本、PDF或图片。官方脚注限定Google AI订阅档、目前18岁以上;Workspace客户将在未来几周扩展。个人账户的Gems从11月起自动迁移,Workspace企业等为2027年3月、教育为6月。Opal和Labs Gems同期关闭,Labs Gems不会自动迁移。分享、Drive文件与Notebook整合仍属即将加入。
Gemini 对话开始推出可复用、可叠加的 Skills,可用斜杠调用并附文本、PDF或图片。官方脚注限定Google AI订阅档、目前18岁以上;Workspace客户将在未来几周扩展。个人账户的Gems从11月起自动迁移,Workspace企业等为2027年3月、教育为6月。Opal和Labs Gems同期关闭,Labs Gems不会自动迁移。分享、Drive文件与Notebook整合仍属即将加入。
Workspace 商业、企业、非营利及教育客户将在后续数周获得相关功能。个人 Gems 从2026年11月开始移除,Workspace 商业、企业和非营利客户从2027年3月开始,教育客户从2027年6月开始。普通 Gems 自动迁移,Google Labs Gems 的迁移安排不同。

原始来源:Google Gemini ↗
03 / 独立评测
GPT-6.1 Sol 新评测 成绩与成本一起看
Arena在9月30日公布GPT-6.1 Sol Max进入WebDev第3、1759分,比GPT-6 Sol Max高70分。ARC Prize同日公布ARC-AGI-3:标准Harness为52.7%、成本约7600美元;供应商适配Harness为96.4%、约4400美元。两套运行方式不同,不能只截96.4%与别的标准Harness作横比。
Arena在9月30日公布GPT-6.1 Sol Max进入WebDev第3、1759分,比GPT-6 Sol Max高70分。ARC Prize同日公布ARC-AGI-3:标准Harness为52.7%、成本约7600美元;供应商适配Harness为96.4%、约4400美元。两套运行方式不同,不能只截96.4%与别的标准Harness作横比。
Arena 原帖报告1759分、排名第3,并提供混合每百万 Token 8美元的评测成本口径。ARC Prize 原帖分别给出标准框架52.7%、约7600美元和提供商适配框架96.4%、约4400美元,两组数字不能交叉组合成单一成绩。


原始来源:Arena / ARC Prize ↗
04 / 独立评测
AI 视频榜升级 统一1080p评审
Artificial Analysis公布新视频评测方法:刷新提示词、覆盖10类用途及10类能力,并按1080p高码率评审;有声榜超过6.8万票、无声榜超过4.7万票。新有声榜Wan3.0第1、Seedance2.5第2、MiniMaxH3第3且与Seedance统计并列、FLUX3第4。H3原生768p,评审统一分辨率不代表模型全部原生1080p。
Artificial Analysis公布新视频评测方法:刷新提示词、覆盖10类用途及10类能力,并按1080p高码率评审;有声榜超过6.8万票、无声榜超过4.7万票。新有声榜Wan3.0第1、Seedance2.5第2、MiniMaxH3第3且与Seedance统计并列、FLUX3第4。H3原生768p,评审统一分辨率不代表模型全部原生1080p。
官方介绍有声评测首轮汇集1000条提示词及超过68000个人类偏好投票,无声评测覆盖500条提示词及超过47000票。投票者来自美国和英国的私有评审群体。统一评审输出规格与各模型原生生成规格应分别理解。

05 / 开发工具
Cloudflare Auto Router 按任务自动挑模型
AI Gateway新增cloudflare/auto,按任务、难度、模型能力和价格路由,并考虑缓存切换成本及故障模型。公测期路由服务免费,底层模型推理仍收费。内部知识工作测试成功率86.6%,不同于Opus的96.6%;官方称部分内部工作最多省30%,不能等同无损降价保证。
AI Gateway新增cloudflare/auto,按任务、难度、模型能力和价格路由,并考虑缓存切换成本及故障模型。公测期路由服务免费,底层模型推理仍收费。内部知识工作测试成功率86.6%,不同于Opus的96.6%;官方称部分内部工作最多省30%,不能等同无损降价保证。
路由会先筛选支持请求格式、执行模式且符合权限、认证和预算限制的模型,再进行任务分类及质量价格评估。官方报告的节省比例来自内部使用,并不是对所有客户的统一节费保证。

原始来源:Cloudflare ↗
06 / 视频模型
HeyGen Video 面向企业的视频模型
HeyGen官方宣布HeyGen Video,基于MiniMax H3再训练,定位企业制作。官方帖写10月50%优惠期间起价0.01美元/秒。价格是起价而非所有规格统一价格;本阶段核对了官方发布帖,尚未实际生成或测过中文口播效果。
HeyGen官方宣布HeyGen Video,基于MiniMax H3再训练,定位企业制作。官方帖写10月50%优惠期间起价0.01美元/秒。价格是起价而非所有规格统一价格;本阶段核对了官方发布帖,尚未实际生成或测过中文口播效果。
HeyGen 的官方发布帖明确说明模型基于 MiniMax H3,并提供开发者模型目录入口。此次口径为2026年10月限时五折、起价0.01美元/秒;未将起价解释为所有规格的统一费用。

原始来源:HeyGen ↗
07 / 视频模型
Creatify Boreal-H3 让广告画面更一致
Creatify官方发布Boreal-H3,基于MiniMax H3进行广告专项后训练,以评估、数据收集、强化学习和推理优化组成改进循环。厂商自测称参考一致性85.3%、简报达成率28%升至50%、人物一致性83%升至94%。MiniMax官方确认合作。不是独立第三方证实的‘全球最强’。
Creatify官方发布Boreal-H3,基于MiniMax H3进行广告专项后训练,以评估、数据收集、强化学习和推理优化组成改进循环。厂商自测称参考一致性85.3%、简报达成率28%升至50%、人物一致性83%升至94%。MiniMax官方确认合作。不是独立第三方证实的‘全球最强’。
Creatify 原帖披露参考一致性85.3%、简报成功率由28%到50%、身份匹配由83%到94%等内部评估结果。它将发布描述为持续改进系统的一次阶段成果,相关数字均按厂商评估归因。

原始来源:Creatify / MiniMax ↗
08 / 开源平台
OpenClaw Enterprise 企业 Agent 控制面
9月29日原始公告宣布OCE,提供多租户、安全边界、权限、治理与审计,可用docker-compose开发、Kubernetes内部部署。项目起于OpenAI后捐赠独立基金会,与Red Hat及NVIDIA协作;当前适合内部试点,1.0预计今年后续发布,不是9月30日‘正式1.0上线’。
9月29日原始公告宣布OCE,提供多租户、安全边界、权限、治理与审计,可用docker-compose开发、Kubernetes内部部署。项目起于OpenAI后捐赠独立基金会,与Red Hat及NVIDIA协作;当前适合内部试点,1.0预计今年后续发布,不是9月30日‘正式1.0上线’。
原项目由 OpenAI 发起后捐赠给 OpenClaw Foundation,现作为独立项目与 Red Hat、NVIDIA 等组织协作。当前定位是内部试点工作负载,不能把开源先行版本描述为已经正式发布的1.0。


09 / 开发工具
Databricks ai_decide 直接返回结构化决策
Databricks推出原生AI Function ai_decide,面向受治理数据的分类、模型路由、文档审查与Agent评估,可通过SQL批量运行或REST实时调用。决策模型返回概率、命名选项或尺度评分,针对结构化决定而非长文本生成。速度与成本优势为厂商描述,尚未本机实测。
Databricks推出原生AI Function ai_decide,面向受治理数据的分类、模型路由、文档审查与Agent评估,可通过SQL批量运行或REST实时调用。决策模型返回概率、命名选项或尺度评分,针对结构化决定而非长文本生成。速度与成本优势为厂商描述,尚未本机实测。
此功能以决策模型为基础,可返回问题对应的概率、命名类别或有序尺度评分。文章给出评论分类、模型路由、回答评判及实时应用等例子,当前开放状态为 Beta。


原始来源:Databricks ↗
国内新闻
10 / 活动与价格
AStudio 国庆积分 打卡福利有领取条件
10月1至7日每日在AStudio打卡可领5000星火X2.5积分,七天累计35000;官方称最高相当于10亿Token,换算因任务而异。需升级3.4.4并点活动弹窗,赠额至10月31日。另有X2.5 API10月三折:输入0.96元、输出3.6元、缓存0.14元/百万Token。积分活动和收费API是两种权益。
10月1至7日每日在AStudio打卡可领5000星火X2.5积分,七天累计35000;官方称最高相当于10亿Token,换算因任务而异。需升级3.4.4并点活动弹窗,赠额至10月31日。另有X2.5 API10月三折:输入0.96元、输出3.6元、缓存0.14元/百万Token。积分活动和收费API是两种权益。
赠送权益适用于星火X2.5,实际 Token 换算随任务类型略有差异。AStudio 已有语音输入和历史搜索等功能更新;活动性质、版本条件和期限与产品能力分开说明。


原始来源:科大讯飞 ↗
11 / 开源基础设施
DeepSeek × 昇腾 基础组件与实践开源
华为官方9月30日确认DeepSeek面向昇腾开源DeepGEMM、FlashMLA、TileKernel、DeepSelect及DeepEP等基础组件,并给出CANN社区训练、推理和AgenticRL实践。吞吐数字基于offline纯模型,不含Serving调度与框架均衡开销,不能直接当作线上服务速度。
华为官方9月30日确认DeepSeek面向昇腾开源DeepGEMM、FlashMLA、TileKernel、DeepSelect及DeepEP等基础组件,并给出CANN社区训练、推理和AgenticRL实践。吞吐数字基于offline纯模型,不含Serving调度与框架均衡开销,不能直接当作线上服务速度。
华为官方文章给出基于昇腾950与超节点的联合优化,并链接通信编程、CANNBot-DSL、推理、低精度训练及 Agentic RL 等实践。性能数据基于 Offline 模式,排除 Serving 调度与负载均衡影响,并注明128K上下文及投机接受率条件。

原始来源:DeepSeek / 华为 ↗
12 / 产品更新
豆包出行升级 对话订票、打车、导航
豆包9月30日官方图文宣布出行服务升级,合作航班管家、高铁管家,覆盖查询、比价、预订与订单管理;合作曹操出行等提供打车,并支持导航。原始图片中的打车示例保留用户确认,不能播成无需确认替你下单;示例航班日期和价格是演示不是当前票价。
豆包9月30日官方图文宣布出行服务升级,合作航班管家、高铁管家,覆盖查询、比价、预订与订单管理;合作曹操出行等提供打车,并支持导航。原始图片中的打车示例保留用户确认,不能播成无需确认替你下单;示例航班日期和价格是演示不是当前票价。
豆包官方图文展示航班查询、比价、预订与订单管理,以及火车票、打车和导航入口。出行服务中的购买动作仍需用户确认,演示截图中的2026年9月日期和票价不作为国庆当天可售票价。




原始来源:豆包 ↗
13 / 模型与API
Spark-ASR-2.0 语音识别 API 上线
讯飞官方宣布Spark-ASR2.0 API已在开放平台上线,结合非自回归和LLM增强、动态上下文,改善中英混合、专业词、噪声与小音量等。官方称可免切换识别202城市方言,并把口语整理为流畅文本;推理成本比1.0高约10%,不是降价84%的旧模型数据。效果对比为厂商测试。
讯飞官方宣布Spark-ASR2.0 API已在开放平台上线,结合非自回归和LLM增强、动态上下文,改善中英混合、专业词、噪声与小音量等。官方称可免切换识别202城市方言,并把口语整理为流畅文本;推理成本比1.0高约10%,不是降价84%的旧模型数据。效果对比为厂商测试。
讯飞披露相较Spark-ASR-1.0,新版本推理成本增加约10%,并展示通用、复杂声学、上下文及文本规范性能力。支持全国202个城市方言免切换识别的说法按厂商发布归因,本期不声称已独立跑完这些测试。


原始来源:讯飞开放平台 ↗
14 / 开源模型
Index-Translate 35B 多语翻译模型预览开源
B站发布Index-Translate35B总参/3B激活MoE预览,基于Qwen3.5,支持150语言翻译及术语、格式、风格等指令,Apache2.0许可。官方模型卡提供vLLM与OpenAI兼容服务示例。低资源、多条件任务仍有误差,报告得分不能泛化为所有翻译优于商业模型。
B站发布Index-Translate35B总参/3B激活MoE预览,基于Qwen3.5,支持150语言翻译及术语、格式、风格等指令,Apache2.0许可。官方模型卡提供vLLM与OpenAI兼容服务示例。低资源、多条件任务仍有误差,报告得分不能泛化为所有翻译优于商业模型。
该35B-A3B模型基于Qwen3.5,采用混合专家结构,翻译指令包括术语、JSON与其他结构、风格、上下文和输出长度。模型页同时标注预览性质,并提供vLLM部署与OpenAI兼容客户端示例。模型页更新时间不冒称精确首发时刻。


15 / 模型发布
Ling 3.1 Flash 限时免费体验
百灵新模型Ling3.1Flash约560B总参数、每Token激活25B,计划付费后开放1M上下文并同步开源,目前不是已开源。Vercel官方确认AI Gateway提供262K窗口、免费至10月13日;带-free的模型ID活动后停止服务,普通ID会开始计费。国内报道免费期为256K口径,平台额度和上下文需区分。
百灵新模型Ling3.1Flash约560B总参数、每Token激活25B,计划付费后开放1M上下文并同步开源,目前不是已开源。Vercel官方确认AI Gateway提供262K窗口、免费至10月13日;带-free的模型ID活动后停止服务,普通ID会开始计费。国内报道免费期为256K口径,平台额度和上下文需区分。
官方入口同时支持inclusionai/ling-3.1-flash和inclusionai/ling-3.1-flash-free。Vercel 页面仅明确2026年9月30日这个日期,没有精确首发时间;本期使用独立日期纠偏记录。活动结束后的行为取决于所选模型ID,网关当前上下文与其他宣传的更大容量分开理解。


原始来源:蚂蚁百灵 / Vercel ↗
16 / 活动与价格
千帆国庆优惠 两类权益分开看
百度智能云宣布至10月7日23:59:59,TokenPlan企业版的DeepSeekV4.1Flash、V4Pro0813与GLM5.3统一0.2抵扣系数、不区分忙闲时。另一个Token福利包为6至7折、最低35元、购买后一个月有效。不是所有模型全价两折,也不是免费送额度,实际规则以下单页为准。
百度智能云宣布至10月7日23:59:59,TokenPlan企业版的DeepSeekV4.1Flash、V4Pro0813与GLM5.3统一0.2抵扣系数、不区分忙闲时。另一个Token福利包为6至7折、最低35元、购买后一个月有效。不是所有模型全价两折,也不是免费送额度,实际规则以下单页为准。
企业Token Plan以席位和共享积分池管理额度,活动仅列明三款模型的0.2抵扣系数;另售的Token福利包有五档月度额度、最低35元、购买后一个月有效。实际采购规则以下单页为准,本期不代用户购买或领取。


原始来源:百度智能云 ↗
17 / 技术披露
DeepSeek DSec 大规模 Agent 沙盒
量子位经知乎授权转载DeepSeek完整技术长文,披露DSec多后端沙盒、可组合镜像、按需加载、高密度资源及可恢复Agent状态。从V4.1起执行循环迁入沙盒,GPU训练被抢占时仍保留进度。它是技术公开,并非今天新上线面向公众的DSec云服务;目前容器快照主要为磁盘级。
量子位经知乎授权转载DeepSeek完整技术长文,披露DSec多后端沙盒、可组合镜像、按需加载、高密度资源及可恢复Agent状态。从V4.1起执行循环迁入沙盒,GPU训练被抢占时仍保留进度。它是技术公开,并非今天新上线面向公众的DSec云服务;目前容器快照主要为磁盘级。
DSec文章描述FnCall、Container、MicroVM和Full VM四种后端,以及EROFS分层、3FS按需读取、高密度资源管理和状态保留等设计。中文来源为知乎内容的授权转载,性能及规模数字均来自公开技术报告和作者的生产环境说明。


原始来源:DeepSeek / 知乎授权转载 ↗
18 / 产品传闻
媒体消息:小豆 个人助手仍在内测
9月30日媒体援引消息称豆包AI个人助手计划独立App、名为小豆。尚无官方发布、下载入口或上线日,不能说今天发布可用,也不能将它与已确认的豆包出行升级混为一件事。
9月30日媒体援引消息称豆包AI个人助手计划独立App、名为小豆。尚无官方发布、下载入口或上线日,不能说今天发布可用,也不能将它与已确认的豆包出行升级混为一件事。
IT之家2026年9月30日报道援引《读佳》消息,称产品名字今年暑期确定、仍在内部测试,一切以官方发布为准。本期保留用户选入,但仅以媒体消息、内测规划的明确归因报道,不制造今天上线或已经可下载的结论。


原始来源:字节跳动 / 媒体报道 ↗