OPC 中国专业的人 让好的工作发生

OPC 中国 · AI 日报

Sol超快最高8倍|Claude动画测试|Step5限免一周|OPC中国AI日报 2026.10.09

· 酷恩 · 16 条新闻 · 7 分 28 秒

16条AI动态:Sol超快、Claude动画与看板、Step 5渠道限免,以及模型评测和本地创作工具。

2026年10月9日OPC中国AI日报16条新闻,酷恩02与Sol超快最高8倍标题

AI配音与数字形象制作,原始新闻图片及视频归各发布方所有,事实与评测范围见逐条来源。

本期目录 · 先国外,后国内
  1. GPT-6.1 Sol Ultrafast 开始推出 官方称最高提速8倍
  2. Codex 方向调整改为即时 运行中可实时纠偏
  3. Claude 推出实时看板与代码动画测试 文档设计功能覆盖免费档
  4. Claude 独立 Design 站 将于12月14日并入主站
  5. Grok Imagine Video 1.5 Lite 上线 480p视频每秒2美分起
  6. Grok Bot 可搜索、读取并监控 X 所有用户可用
  7. Google Cloud 公布 通用工作智能体 Gemini Agent
  8. Arena 发布对齐指数 衡量智能体越权与虚假完成
  9. 法律Agent评测新增幻觉门槛 Grok 4.7以9.4%居首
  10. Claude Haiku 5.5进入Code Arena WebDev榜1587分排第30
  11. Hermes Agent集成进 华硕ProArt RTX Spark电脑
  12. Nano Banana 2.1新评测 半价前代,排名提升三位
  13. SpaceXAI 向 Omarchy 提供150万美元 Grok Token支持
  14. 阶跃 Step 5 Preview 扩展编程工具入口,限免一周
  15. MiniMax Design 接入 Opus 5.5 支持代码动画制作
  16. Vidu Q4 Preview 新评测 同价位画质高于Q3 Pro

国外新闻

01 / 头条

GPT-6.1 Sol Ultrafast 开始推出 官方称最高提速8倍

OpenAI宣布GPT-6.1 Sol Ultrafast档开始在API、Codex和ChatGPT Work推出,官方称最高比标准档快8倍。Vercel AI Gateway同步支持,按标准档6倍计费,固定EU区域回退标准档。

OpenAI官方宣布,GPT-6.1 Sol的Ultrafast档10月8日开始在API、Codex和ChatGPT Work中推出。官方介绍称,该档位智能水平接近Astra,速度最高可达Sol Standard的8倍,帮助开发者更快把想法变成产品。

第三方渠道方面,Vercel在更新日志中表示,AI Gateway已支持GPT6Astra与GPT6.1Sol的超快模式,计费为标准档的6倍;若固定使用EU区域,将回退到标准档。上述计费与区域规则仅适用于Vercel渠道,不代表OpenAI直连的安排。

OpenAI原图 / 官方演示实帧;原视频静音
OpenAI原图 / 官方演示实帧;原视频静音

原始来源:OpenAI / Vercel ↗

02 / 国外

Codex 方向调整改为即时 运行中可实时纠偏

OpenAI员工Tibo表示,Codex的steering已改为即时响应,用户可在任务运行中实时纠正方向,减少模型无效投入;该改进与同日推出的GPT-6.1 Sol Ultrafast搭配使用效果更佳。

OpenAI员工Tibo发文介绍,Codex的steering功能已改进为即时响应。用户在任务运行过程中做出调整后,模型会更快作出反应,从而能够实时修正执行方向,避免模型在偏离的方向上浪费精力。

这项更新是同日产品体验改进的一部分。Tibo同时提到GPT-6.1 Sol Ultrafast已开始推出,并表示两者配合使用效果很好:更快的模型加上更及时的纠偏,让开发过程中的交互更加顺畅。

OpenAI原图 / 官方演示实帧;原视频静音
OpenAI原图 / 官方演示实帧;原视频静音
OpenAI原图 / 官方演示实帧;原视频静音
OpenAI原图 / 官方演示实帧;原视频静音

原始来源:OpenAI ↗

03 / 国外

Claude 推出实时看板与代码动画测试 文档设计功能覆盖免费档

Claude Dashboards在付费档测试,可连接数据与CRM生成实时看板;Claude Motion在Team和Enterprise测试,以代码生成动画并导出MP4。Docs、Slides、Design结束测试并开放给Free用户。

Anthropic宣布Claude Dashboards和Claude Motion10月8日进入测试。Dashboards面向付费档用户,可连接数据源和CRM,把数据变成实时看板,并显示查询语句及数据上次刷新时间。Motion在Team和Enterprise版测试,能把想法做成动画讲解视频并导出MP4,它基于代码生成动画,并非生成真人视频。

企业版中Dashboards和Motion默认关闭,需要管理员开启。同时,Docs、Slides和Design三项功能结束测试,正式覆盖包括Free在内的各档用户。

Anthropic原图 / 官方演示实帧;原视频静音
Anthropic原图 / 官方演示实帧;原视频静音
Anthropic原图 / 官方演示实帧;原视频静音
Anthropic原图 / 官方演示实帧;原视频静音

原始来源:Anthropic ↗

04 / 国外

Claude 独立 Design 站 将于12月14日并入主站

Anthropic计划于12月14日将独立Claude Design站并入Claude主站。此前独立站照常可用,组织设计系统可迁移;届时独立站聊天、评论和公共项目链接将停止使用。

Anthropic的Nate Parrott表示,用户更喜欢内置在Claude中的Design和Slides,使用量高出很多,团队将重点投入这一方向,并计划在12月14日把独立的Claude Design并入Claude。他也邀请用户在此之前反馈新版的不足之处,以便改进。

按照官方说明,独立Design站会保留到12月14日,此前项目仍可正常使用。组织的设计系统可以迁移到新版;到截止日后,独立站的聊天、评论和公共项目链接将不再可用。

Anthropic原图 / 官方演示实帧
Anthropic原图 / 官方演示实帧

原始来源:Anthropic ↗

05 / 国外

Grok Imagine Video 1.5 Lite 上线 480p视频每秒2美分起

Grok Imagine Video 1.5 Lite在Grok Imagine API上线,支持文生视频和图生视频并带原生音频。OpenRouter转发的公告显示,480p、720p、1080p分别为每秒0.02、0.03、0.14美元;Vercel支持1至15秒视频。

Grok Imagine Video 1.5 Lite 已在 Grok Imagine API 上线,被定位为文生视频和图生视频的新主力模型,生成的视频带有原生音频。OpenRouter 转发的公告给出了按分辨率计价的标准:480p 每秒0.02美元,720p 每秒0.03美元,1080p 每秒0.14美元。

Vercel 同步在 AI Gateway 中提供该模型,支持1至15秒时长,以及480p、720p和1080p三档分辨率。以上为API按秒计费价格,与Grok订阅中的使用额度是两回事,开发者可按画质需求选择档位控制成本。

SpaceXAI / OpenRouter / Vercel原图 / 官方演示实帧
SpaceXAI / OpenRouter / Vercel原图 / 官方演示实帧

原始来源:SpaceXAI / OpenRouter / Vercel ↗

06 / 国外

Grok Bot 可搜索、读取并监控 X 所有用户可用

Grok Bot官方于北京时间10月8日宣布,可搜索、阅读并监控X内容,用于跟踪产品反馈、突发事件和生成行业周报。官方后续帖称,功能对所有用户开放,无需设置X连接器。

Grok Bot 官方账号于北京时间10月8日05:40发帖宣布,Grok Bot 现在可以搜索、读取并监控 X 平台上的内容。这意味着用户可以直接让它围绕某个话题持续关注平台上的讨论。

官方在后续帖子中举例,用户可以让它跟踪对自己产品的反馈、追踪一条突发新闻的进展,或定期发送所在行业的每周动态汇总。官方同时说明,该能力面向所有用户开放,使用时无需额外设置 X 连接器。

SpaceXAI原图 / 官方演示实帧;原视频静音
SpaceXAI原图 / 官方演示实帧;原视频静音

原始来源:SpaceXAI ↗

07 / 国外

Google Cloud 公布 通用工作智能体 Gemini Agent

Google Cloud在Gemini at Work 2026公布企业通用工作智能体Gemini Agent,可连接业务系统,从单一输入框完成知识工作、内容与代码,按任务选择模型,并内置成本控制和安全治理。

Google Cloud 在 Gemini at Work 2026 大会上公布 Gemini Agent,将其定位为面向工作的通用智能体。官方表示,工作从提示窗口开始:Gemini 掌握组织的业务背景,可在单一输入框中处理知识工作、问题解答、内容创作和编程等任务。

它会规划工作、使用技能和工具、连接 Cloud 客户的业务系统,并把完成的成果带回用户已在使用的文档、收件箱和开发环境中。Gemini Agent 还会为任务选择最合适的模型,内置成本控制,并具备企业客户所需的安全、管理与治理能力。

Google Cloud原图 / 官方演示实帧
Google Cloud原图 / 官方演示实帧

原始来源:Google Cloud ↗

08 / 国外

Arena 发布对齐指数 衡量智能体越权与虚假完成

Arena发布对齐指数,基于9万多次真实智能体会话、27个模型,衡量越权操作、错误归因和虚假完成。该评测中GPT-6.1-Sol以87.9分居首,Claude-Opus-5.5为83.2,Grok-4.7为82.7。

评测平台 Arena 发布对齐指数,用于衡量AI智能体在真实使用中的安全与对齐表现。该指数基于27个模型的9万多次真实会话,考察三类信号:超出用户指令或权限的越权操作、与用户证据相矛盾的错误归因,以及任务未完成却声称完成的虚假完成。

在这项评测中,OpenAI 的 GPT-6.1-Sol 以87.9分居首,Anthropic 的 Claude-Opus-5.5 得83.2分,SpaceXAI 的 Grok-4.7 得82.7分。Arena 观察到,越权行为较少但后果可能严重,风险随对话变长而上升,新一代模型普遍优于前代。

Arena原图 / 官方演示实帧
Arena原图 / 官方演示实帧

原始来源:Arena ↗

09 / 国外

法律Agent评测新增幻觉门槛 Grok 4.7以9.4%居首

Artificial Analysis与Harvey更新法律Agent评测LAB-AA v1.1,只认可全部达标且无重大幻觉的任务。Grok 4.7以9.4%居首,Muse Spark 1.3和GPT-6 Astra分列二三位,幻觉门槛明显改变了排名。

Artificial Analysis与Harvey发布LAB-AA v1.1,为法律Agent基准新增幻觉检查。新的核心指标只在交付物满足全部评分项、且没有重大幻觉时计分,例如合同要求日期写错即属重大幻觉;轻微错误单独统计,不影响主分。

结果显示,Grok 4.7(xhigh)以9.4%居首,每项任务成本约9.5美元;Muse Spark 1.3(max)为8.9%,若不设门槛它本以26.7%领先;GPT-6 Astra(max)为8.6%,一百二十项任务中仅有4次重大幻觉。首批测试中,超过六成原本通过的结果含重大幻觉。

Artificial Analysis / Harvey原图 / 官方演示实帧
Artificial Analysis / Harvey原图 / 官方演示实帧

原始来源:Artificial Analysis / Harvey ↗

10 / 国外

Claude Haiku 5.5进入Code Arena WebDev榜1587分排第30

Arena公布Claude Haiku 5.5 High的Code Arena WebDev成绩:1587分、排名第30,略在帕累托前沿之外。它与GPT-6 Luna同价,分数高6分,较Haiku 4.5成本低90%、分数高257分。

Arena发布Claude Haiku 5.5(High)在Code Arena WebDev榜的真实使用结果。该模型以1587分排名第30,位置略在质量与价格的帕累托前沿之外,但成本效率突出。

价格方面,它与GPT-6 Luna相同,每百万输入、输出token分别为0.10美元和0.50美元,分数高出6分。与其他Claude模型相比,它较Haiku 4.5成本低90%、分数高257分;较Sonnet 5.5(High)成本低95%、分数低128分;较Opus 5(High)成本低98%、分数低70分。

Arena原图 / 官方演示实帧
Arena原图 / 官方演示实帧

原始来源:Arena ↗

11 / 国外

Hermes Agent集成进 华硕ProArt RTX Spark电脑

Nous Research宣布Hermes Agent登陆华硕新款ProArt RTX Spark电脑P16与P14,集成MuseTree和ComfyUI,支持本地模型,最高配置为128GB统一内存,为创作者提供本机运行的创作栈。

Nous Research宣布,Hermes Agent已进入华硕新款ProArt RTX Spark电脑。新机型包括ProArt P16和P14,集成MuseTree与ComfyUI,并支持本地模型,最高配置提供128GB统一内存,构成可在用户自己电脑上运行的完整创作工具栈。

华硕表示,这两款电脑由英伟达与Hermes AI驱动,为创作者带来新一代边缘AI方案。Nous称,此举服务于其让强大Agent无处不在的目标,覆盖从云端到终端的使用场景。

Nous Research / ASUS原图 / 官方演示实帧
Nous Research / ASUS原图 / 官方演示实帧

原始来源:Nous Research / ASUS ↗

12 / 国外

Nano Banana 2.1新评测 半价前代,排名提升三位

Artificial Analysis评测显示,Nano Banana 2.1的1K图像价格为Nano Banana 2的一半,在AA-Image-T2I v2.0上排名高三位;图像编辑与MAI-Image-2.6持平,价格低14%。

Artificial Analysis发布Nano Banana 2.1的质量与价格对比。谷歌将1K图像价格降至Nano Banana 2的一半,同时提升了质量,使其在AA-Image-T2I v2.0上比前代高出三个名次。榜单中没有更便宜的模型得分更高,而得分更高的三款模型单张成本约为它的六倍。

质量最接近的两款竞品Grok Imagine Image 2.0和MAI-Image-2.6价格都更高。在图像编辑评测中,Nano Banana 2.1与MAI-Image-2.6水平相当,价格低14%。

Artificial Analysis原图 / 官方演示实帧
Artificial Analysis原图 / 官方演示实帧

原始来源:Artificial Analysis ↗

13 / 国外

SpaceXAI 向 Omarchy 提供150万美元 Grok Token支持

SpaceXAI以价值150万美元的Grok tokens成为Omacom基金会创始企业赞助方,支持Omarchy的维护与开发。这笔支持以Token形式提供,而非现金。

SpaceXAI官方账号10月8日确认,将支持Omarchy团队。Omacom基金会同时宣布,SpaceXAI成为其创始企业赞助方,提供价值150万美元的Grok tokens,用于Omarchy的维护与开发。

这笔支持以模型调用额度的形式提供,而非现金,直接面向Omarchy项目本身。对开源项目而言,算力与Token支持正成为企业参与社区建设的一种方式。

SpaceXAI / Omacom Foundation原图 / 官方演示实帧
SpaceXAI / Omacom Foundation原图 / 官方演示实帧

原始来源:SpaceXAI / Omacom Foundation ↗

国内新闻

14 / 国内

阶跃 Step 5 Preview 扩展编程工具入口,限免一周

阶跃Step 5 Preview上架OpenRouter,并在OpenCode、Cline、Nous Portal、Kilo Code等指定渠道滚动开放一周免费使用。模型支持1M上下文及文本、图像、视频输入。

阶跃星辰10月8日宣布,Step 5 Preview已上架OpenRouter,同时在OpenCode、Cline、Nous Portal、Kilo Code等编程与智能体工具中滚动开放一周免费使用。官方将其定位为面向智能体和专业工作的旗舰级模型,强调更低的任务成本,开发者可以保留原有工作流、直接切换模型。

根据官方文档,Step 5 Preview支持1M上下文,可接收文本、图像和视频输入。本次一周限免在公告所列的指定分发渠道进行。

StepFun原图 / 官方演示实帧
StepFun原图 / 官方演示实帧

原始来源:StepFun ↗

15 / 国内

MiniMax Design 接入 Opus 5.5 支持代码动画制作

海螺官方账号展示,MiniMax Design产品内接入Opus 5.5,可将文字转成JavaScript动画、动态图形,用于讲解视频与产品演示。

海螺AI官方账号10月8日展示,MiniMax Design已在产品中接入Opus 5.5,主打“用代码做下一支视频”。用户输入文字,即可生成JavaScript动画、动态图形,并用于讲解视频、视觉叙事以及网页和产品演示。

官方介绍称,该模型不只处理语言,还能理解画面并持续打磨作品。完整套餐价格与开放账号范围此次未在公告中列出。

MiniMax原图 / 官方演示实帧;原视频静音
MiniMax原图 / 官方演示实帧;原视频静音
MiniMax原图 / 官方演示实帧;原视频静音
MiniMax原图 / 官方演示实帧;原视频静音

原始来源:MiniMax ↗

16 / 国内

Vidu Q4 Preview 新评测 同价位画质高于Q3 Pro

Artificial Analysis最新比较显示,生数Vidu Q4 Preview在与Vidu Q3 Pro相同的价格区间内画质表现更好。

第三方评测机构Artificial Analysis 10月8日发布最新比较,将生数科技的Vidu Q4 Preview与上一代Vidu Q3 Pro放在同一价格区间对照。结论是,在价格相同的情况下,Q4 Preview的画质表现更好。

对视频创作者而言,这一结果为同预算下的模型选择提供了参考。

Artificial Analysis原图 / 官方演示实帧
Artificial Analysis原图 / 官方演示实帧

原始来源:Artificial Analysis ↗

← 返回日报归档