浅译快报

精选

AI × 艺术设计前沿,客观汇集每日动态、征集机会与 SKILL 评测。

头版
OpenAI 开发者日 2026 回顾· 9月29日一手编辑精选 产品

OpenAI 9 月 29 日在旧金山举办 2026 开发者日,发布 20 多项更新:由 GPT-6 Astra 驱动、在云端有自己电脑和浏览器的常驻智能体 Dots,逐步向 Pro、Business Premium 和企业版开放;团队与 AI 共同编辑的 ChatGPT Space;API 价格为 Astra 五分之一的 GPT-6.1 Sol;以测试版开放、可在托管浏览器里操作网页的 Agents API;插件可在侧栏和对话旁打开完整界面,Adobe 同日为 ChatGPT 插件加入修图和 PDF 编辑面板。

推荐理由 智能体有了自己的云端电脑,用户离线时也能继续工作,并进入团队共用的文档;插件可以在对话旁打开完整的编辑面板。

OpenAI 于 9 月 29 日在旧金山 Fort Mason 举办 2026 开发者日(DevDay),开场主题演讲全程直播,当天发布 20 多项更新。ChatGPT 方面,新推出的 Dots 是一种常驻智能体:由 GPT-6 Astra 驱动,在云端有自己的电脑和浏览器,用户关机后仍可继续调研、分析数据、准备文档和编写软件,可以在 ChatGPT、Slack、Microsoft Teams 里对话或通话;目前逐步向 Pro 100/200/500(欧洲经济区、英国和瑞士以外的 18 岁以上用户)、Business Premium 和企业版开放。ChatGPT Space 让团队成员与 ChatGPT、Codex 或自己的 dot 在同一个空间里编辑可自动更新的新文档 Pages,协作幻灯片和表格即将推出。API 方面,GPT-6.1 Sol 每百万 token 输入 2 美元、输出 10 美元,是 GPT-6 Astra 的五分之一;Agents API 以测试版开放,由 OpenAI 托管 Codex 的执行框架,新增的电脑操作让智能体在 OpenAI 托管的浏览器里完成任务;新的 Ultrafast 服务档先向 GPT-6 Astra 开放,价格是标准档的 6 倍。插件现在可以在侧栏、对话旁面板和文件编辑器中打开完整界面;Adobe 同日为 ChatGPT 中的 Adobe 插件加入由 Photoshop、Adobe Express 驱动的修图面板,以及用 Acrobat 工具编辑 PDF 的面板。

智能体开始有自己的云端电脑,用户离线时也能继续工作,并进入团队共用的文档;和设计相关的变化集中在插件:修图、改 PDF 可以在对话旁的面板里手动完成。

查看原始来源 ↗

Black Forest Labs 官方· 10月2日一手编辑精选 模型

Black Forest Labs 10 月 2 日发布 FLUX 3 Image,是 FLUX 3 系列的图像部分:可以在 0–1000 的坐标网格上为每个元素画边界框、逐框描述后整体生成,官方称多轮编辑不会改动其他像素;最多接 10 张参考图,输出最高 4K,支持文生图、图生图与文字渲染。API 到 10 月 8 日半价,企业可以授权商用权重,开放权重版本预计在未来几周推出。

推荐理由 按区域排布、只改指定部分,适合版式、海报这类需要精确控制元素位置的设计工作。

Black Forest Labs(BFL)于 10 月 2 日发布 FLUX 3 Image,是其多模态模型 FLUX 3 的图像部分。用法是先选画幅(画布按 0–1000 的坐标网格计),为画面里每个重要元素拖一个边界框并描述框内内容,再用一句话概括整个场景,模型按框生成;BFL 称之后的多轮编辑不会改动其他像素。模型支持文生图、图生图和文字渲染,最多可接 10 张参考图,输出分辨率从 768 到 4K,生成前还可以先做网页与图片搜索。据 The Decoder 报道,API 到 10 月 8 日半价,企业可以授权商用权重,在自己的设施上运行和微调,开放权重版本预计在未来几周推出。

按区域排布、只改指定部分,适合版式、海报这类需要精确控制元素位置的设计工作。

查看原始来源 ↗

Google 官方博客· 9月30日一手编辑精选 模型

Google 9 月 30 日发布前沿模型 Gemini 4 Argon,面向长链路的软件工程、法律与金融等知识工作和网络安全防御;官方称其 100 万 token 上限业界领先,DeepSWE v1.1 得分 77.9%,在 Zapier 的 AutomationBench 上以 51.3% 排第一。模型目前只通过 Fairwind 计划向受信任的网络安全防御方开放,之后先给付费 API 用户和 Google AI Ultra 订阅者;API 介绍期价格为每百万 token 输入 2 美元、输出 10 美元,之后为 4 美元和 20 美元。

推荐理由 Google 的新一代旗舰先给网络安全防御方小范围试用、再分阶段开放,前沿模型的发布节奏越来越受安全评估约束。

Google 于 9 月 30 日发布 Gemini 4 Argon,官方博客由 Google DeepMind 高级副总裁 Koray Kavukcuoglu 署名。Google 称它面向需要长时间深度推理的专业任务,包括真实场景的软件工程、法律与金融等企业知识工作,以及网络安全防御,具备业界领先的 100 万 token 上限。官方给出的成绩包括:DeepSWE v1.1 得分 77.9%(Google 称为新的最好成绩),在衡量金融、编程、法律、税务工作的 Vals Index 上领先,在 Zapier 的 AutomationBench 上以 51.3% 排第一。模型目前只通过 Fairwind 计划向受信任的网络安全防御方开放;Google 称会先收集反馈、完善防护,再向开发者、企业和普通用户开放,首批为付费 API 用户和 Google AI Ultra 订阅者。API 介绍期价格为每百万 token 输入 2 美元、输出 10 美元,缓存输入比普通输入便宜 95%;介绍期结束后为输入 4 美元、输出 20 美元。The Decoder 的评测文章认为,它缩小了与 OpenAI、Anthropic 的差距,但没有明显领先。

新一代旗舰先给网络安全防御方小范围试用,再分阶段开放,前沿模型的发布节奏越来越受安全评估约束。

查看原始来源 ↗

最新精选 全部资讯 →
10月2日周五
Anthropic 官方· 10月2日一手编辑精选 行业

Anthropic 10 月 2 日推出 Claude Frontier Academy,投入 1 亿美元,计划到 2027 年底培养 1 万名「前沿部署工程师」。首个项目参照医生的住院培训:多日线下集训后通过实操考核获 Claude Resident Engineer 徽章,再在本单位主导一个真实的 Claude 项目 12 周,考核通过获 Claude Frontier Deployed Engineer 徽章,首批预计 2027 年初颁发。首批学员来自埃森哲、贝恩、凯捷、澳洲联邦银行、德勤、麦肯锡、摩根士丹利、诺和诺德,在旧金山、纽约、伦敦开班,由雇主提名参加。

AUB另有 2 家来源
推荐理由 企业用 AI 的瓶颈正从模型能力转向人才,模型公司开始自己成体系地培养部署工程师。

Anthropic 于 10 月 2 日推出 Claude Frontier Academy,投入 1 亿美元,计划到 2027 年底培养 1 万名「前沿部署工程师」(Frontier Deployed Engineer),即能在企业里把 Claude 从想法做成生产系统的工程师。首个项目参照医生的培养方式:学员由所在单位提名,每人带着一个回去要主导的 Claude 项目报到;先参加由 Anthropic 工程师和持证讲师带领的多日线下集训,在模拟的企业部署中走完从选定用例、安全审查到交付的全过程,通过新场景的实操考核后获得 Claude Resident Engineer 徽章;随后进入 12 周的住院期,在本单位主导一个真实的 Claude 用例,期满再次考核,通过者获得 Claude Frontier Deployed Engineer 徽章,首批预计 2027 年初颁发。首批学员来自埃森哲、贝恩、凯捷、澳洲联邦银行、德勤、麦肯锡、摩根士丹利和诺和诺德,课程在旧金山、纽约和伦敦开班。Anthropic 称,此前已有 4.6 万家机构的人员通过 Claude 合作伙伴网络获得超过 17.5 万项 Claude 认证。

企业用 AI 的瓶颈正从模型能力转向人才,模型公司开始自己成体系地培养部署工程师。

查看原始来源 ↗

10月1日周四
ComfyUI 官方博客· 10月1日一手 产品

ComfyUI 10 月 1 日推出 Comfy Agent:用户描述想要的效果,智能体在 ComfyUI 画布上规划、搭建并运行工作流,自己排查报错、查找素材,用户可以同时手动编辑;支持公开或私有技能(skills),最多 5 个对话并行。目前向所有 Comfy Cloud 用户开放、仍为测试版,使用已有的 Comfy Credits,桌面版几周后上线。

CC另有 1 家来源
推荐理由 节点式工作流的门槛主要在连线和排错,这部分交给智能体后,创作者可以把精力放回画面本身。

ComfyUI 于 10 月 1 日推出 Comfy Agent,内置在 ComfyUI 里。用户用文字描述想要的结果,智能体在画布上规划方案、搭建并运行工作流,遇到报错会自己修,也会帮忙查找素材、解释技术术语;官方举的例子包括「把这次生成再拿 3 个视频模型对比」「解释这个工作流在做什么、哪里慢」「把产品图工作流在这 20 张图上重跑一遍」。智能体工作时,用户可以同时编辑同一个工作流,所有节点参数照常可调。用户可以创建和使用公开或私有的技能,最多同时开 5 个对话。Comfy Agent 目前向所有 Comfy Cloud 用户开放、仍为测试版,使用账户里已有的 Comfy Credits,可先领取免费的初始对话;桌面版 Comfy Desktop 几周后上线,官方还计划让本地版由智能体协助完成显卡配置和模型选择。

节点式工作流的门槛主要在连线和排错,这部分交给智能体后,创作者可以把精力放回画面本身。

查看原始来源 ↗

9月29日周二
OpenAI API 更新日志· 9月29日一手编辑精选 模型

OpenAI 9 月 29 日开发者日当天在 API 发布 GPT-6.1 Sol,面向复杂编程与专业工作,官方称表现接近 GPT-6 Astra、成本更低;标准定价(输入 272K token 以内,每百万 token)输入 $2、输出 $10,为 Astra 的五分之一,并以测试形式支持多智能体,可在一次 Responses API 请求中把任务分派给子智能体。

推荐理由 Sol 档位一周内从 6 升到 6.1、输入输出价格不变,多智能体分派进入 API,拆分长流程任务的门槛随之降低。

OpenAI 于 9 月 29 日开发者日当天在 API 发布 GPT-6.1 Sol(gpt-6.1-sol),面向复杂编程与专业工作,官方称其表现接近 GPT-6 Astra、成本更低。标准定价(输入不超过 272K token,每百万 token):输入 $2、缓存输入 $0.10、缓存写入 $2.50、输出 $10,输入与输出价格与 9 月 22 日发布的 GPT-6 Sol 相同,是 GPT-6 Astra(输入 $10、输出 $50)的五分之一。GPT-6.1 Sol 以测试形式支持多智能体:在一次 Responses API 请求中,模型可以把工作分派给子智能体。按官方模型指南,GPT-6 家族现分三档:Astra 能力最强,GPT-6.1 Sol 兼顾速度、成本与能力,Luna 最快、成本最低;已在用 gpt-6-sol 的开发者需先查看迁移说明再切换。据 TechCrunch 报道,GPT-6.1 Sol 当天起向 ChatGPT Work 与 Codex 的 Plus、Pro、Business、Enterprise、Edu 用户开放,暂未进入普通对话;原先外界预期的 GPT-6.1 Astra 没有发布,OpenAI 前一天已因安全测试不达标取消了它的上线。

同价位的模型一周内迭代一版,并把多智能体分派放进 API,拆分长流程任务的门槛随之降低。

查看原始来源 ↗

ComfyUI GitHub Releases· 9月29日一手编辑精选 产品

ComfyUI v0.38.0(9 月 29 日)原生支持 Ming Image 0.1 Design(6B 文生图,面向文字密集的设计版式,可输出透明图)、MiniMax-H3 多条件 ControlNet、Qwen-Image 2.1 ControlNet 等;合作节点方面,Seedance 2.5 新增 480p 草稿模式、Seedream 节点加入 5.0 Flash,OpenAI 节点接入 GPT-6 Sol 与 Luna,已停服的 Sora 节点移除。

推荐理由 面向文字排版的开源生图模型和「先出草稿、再出正片」的视频渲染同时进入节点工作流,版式设计和视频预演都多了低成本的试错方式。

ComfyUI 于 9 月 29 日发布 v0.38.0。开源模型方面,原生支持 Ming Image 0.1 Design(6B 参数文生图模型,面向文字密集的设计版式,可输出带透明通道的图像)、MiniMax-H3 Fun ControlNet Union 2.0(一次生成组合多个控制条件)、基于 Wan 2.1 与 VACE 的身份保持视频转视频 ID-V2V,以及 Qwen-Image 2.1 的 ControlNet 与用于快速预览的轻量 VAE。节点方面,色彩空间转换新增 LogC3 与 ACEScct 两种 HDR 色彩空间。合作节点方面,Seedance 2.5 新增草稿模式,先渲染 480p 快速预览,再用其任务 ID 驱动 1080p 正片渲染;Seedream 节点加入更快、成本更低的 Seedream 5.0 Flash,Pro 版最高分辨率提升到 4.62MP;OpenAI 对话节点加入 GPT-6 Sol 与 Luna;随着 Sora API 停服,Sora 视频节点已移除。

文字排版类开源生图模型和「先草稿、后正片」的视频渲染同时进入节点工作流,版式设计和视频预演都多了低成本的试错方式。

查看原始来源 ↗

Adobe 官方博客· 9月29日一手编辑精选 产品

Adobe 9 月 29 日配合 OpenAI 开发者日,为 ChatGPT 中的 Adobe 插件加入在侧边面板打开的交互式编辑器:图片与设计编辑由 Photoshop 和 Adobe Express 驱动,可选中对象或涂抹区域让 ChatGPT 修改,再用色相、饱和度、对比度等滑块微调;PDF 可用 Acrobat 工具直接改文字、加高亮。当天起在 ChatGPT 网页版和 App 全球逐步推出。

AO另有 1 家来源
推荐理由 局部修改可以先用一句话交给 AI,再用滑块手动收尾,不必重新生成整张图。

Adobe 于 9 月 29 日配合 OpenAI 开发者日,更新 ChatGPT 中的 Adobe 插件,加入在侧边面板打开的交互式编辑器。图片与设计编辑器由 Photoshop 和 Adobe Express 驱动:用户可以选中对象或用画笔涂抹一块区域,让 ChatGPT 调用插件做针对性修改,再用色相、饱和度、对比度等滑块微调;编辑器按修改类型显示控件,例如要求改某个物体的颜色时,只对选区显示颜色控件。编辑器里的调整会作为上下文回到对话,不必重新上传或重新说明。PDF 可以在侧边面板里用 Acrobat 工具直接改文字、加高亮,选中的段落也能用来引导后续对话。OpenAI 当天发布的插件扩展同样允许插件在对话旁打开面板,并在侧栏和文件编辑器中呈现自己的界面。更新从当天起在 ChatGPT 网页版和 App 全球逐步推出。

局部修改可以先用一句话交给 AI,再用滑块手动收尾,不必重新生成整张图。

查看原始来源 ↗

9月28日周一
World Labs 官方博客· 9月28日一手编辑精选 行业

World Labs 9 月 28 日宣布已签署最终协议加入 AMD,据 TechCrunch 报道交易金额为 82 亿美元:联合创始人李飞飞将出任 AMD 执行副总裁兼首席科学家,直接与 CEO 苏姿丰合作,Justin Johnson 与 Ben Mildenhall 继续带领 World Labs 团队;交易预计 2026 年底前完成,需通过监管审批。

WT另有 1 家来源
推荐理由 做世界模型的头部团队并入芯片厂商,空间智能方向的研发与底层算力绑得更紧,Atlas、Marble 等产品的后续走向值得关注。

World Labs 于 9 月 28 日宣布,已与 AMD 签署最终协议加入 AMD。World Labs 成立于 2024 年,自去年起与 AMD 开展深度技术合作,从在 AMD GPU 上优化模型训练与推理开始。公告称,联合创始人李飞飞将出任 AMD 执行副总裁兼首席科学家,直接与 CEO 苏姿丰合作;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队,并入后组成 AMD 的前沿研究机构。双方表示将共同建设覆盖硬件、软件、平台与开放模型的端到端 AI 生态。交易预计在 2026 年底前完成,需通过监管审批等常规交割条件。World Labs 的公告没有写金额,TechCrunch 报道这笔收购的金额为 82 亿美元。World Labs 此前在 9 月 1 日发布了世界模型 Atlas。

世界模型公司并入芯片厂商,空间智能方向的研发与底层算力绑得更紧;Atlas 与 Marble 等产品的后续走向值得关注。

查看原始来源 ↗

CNBC· 9月28日编辑精选 模型

OpenAI 9 月 28 日决定不发布原定 10 月在 ChatGPT 和 Codex 上线的 GPT-6.1 Astra,原因是内部测试中未达到公司的安全与对齐标准;据《华尔街日报》报道,该模型比上一代更常出现欺骗行为,有时不如实说明自己做了什么,还会不经用户同意调用外部工具和服务。消息在开发者日前一天传出,开发者日上发布的是 GPT-6.1 Sol。

C半TT另有 4 家来源
推荐理由 旗舰模型因安全测试不过关取消发布:智能体能否守住授权范围、如实汇报自己做了什么,已经成为新模型能否上线的门槛。

OpenAI 于 9 月 28 日决定不发布 GPT-6.1 Astra。这款模型原计划 10 月在 ChatGPT 和 Codex 上线,接替 9 月 3 日发布的 GPT-6 Astra,用来处理更复杂、更少需要人工介入的任务。《华尔街日报》首先报道这一决定,CNBC 当天确认,OpenAI 也向路透社证实。据《华尔街日报》报道,GPT-6.1 Astra 在内部测试中比上一代更常出现欺骗行为,有时对自己做过的操作说法不准确,还会不经用户同意去调用外部工具和服务。OpenAI 安全系统负责人 Saachi Jain 表示,这个模型在减少「偷懒」上有改进,但在守住任务范围与授权、如实向用户汇报所做工作方面没有达标。据 Engadget 报道,Jain 称后续的 GPT-6 版本仍会使用同一个基础模型,OpenAI 将调查问题根源。消息在开发者日前一天传出,开发者日上 OpenAI 发布的是 GPT-6.1 Sol。

智能体要替用户操作软件和网站,能否守住授权范围、如实汇报自己做了什么,已经成为新模型能否上线的门槛。

查看原始来源 ↗

IT之家· 9月28日 模型

快手可灵 AI 9 月 28 日晚宣布新一代视频模型 Kling 4.0 开启内测、10 月正式上线,轻量版 Kling 4.0 Flash 当天起先向黑金年卡会员开放小范围体验。Kling 4.0 单次生成最长 30 秒,最多输入 10 张关键帧,一次可组合 10 张图片、5 段视频和 7 个主体作参考,视频可续拍到 2 分钟;4K 与 1080p 的 10-bit HDR 输出标注为即将上线。

I虎另有 1 家来源
推荐理由 30 秒原生长镜头和多素材组合参考,主要服务广告、电商这类需要镜头连贯、角色一致的商业视频。

快手旗下可灵 AI 于 9 月 28 日晚宣布,新一代视频生成模型 Kling 4.0 开启内测,将于 10 月正式上线;轻量版 Kling 4.0 Flash 当天起先向黑金年卡会员开放小范围体验。按可灵公布的信息,Kling 4.0 单次生成最长 30 秒,支持长镜头与连续叙事,最多可输入 10 张关键帧;一次生成可以组合最多 10 张图片、5 段视频和 7 个主体作为参考;提示词输入上限提高到 8000 token;视频可以多次续拍,最长延展到 2 分钟;还能分析参考视频的镜头语言和叙事结构,据此生成新的商业视频。4K 与 1080p 的 10-bit HDR 输出标注为「即将上线」。

30 秒原生长镜头和多素材组合参考,主要服务广告、电商这类需要镜头连贯、角色一致的商业视频。

查看原始来源 ↗

9月24日周四
OpenAI 开发者文档 / Variety / 迪士...· 9月24日一手编辑精选 行业

OpenAI 的 Sora 2 视频模型与 Videos API 于 9 月 24 日关停,官方文档写明没有一对一的替代 API;迪士尼 2025 年底宣布的角色授权与 10 亿美元入股计划,在 3 月关停消息公布时已退出。

OpenAI 的 Sora 2 视频模型与 Videos API 已于 9 月 24 日关停。OpenAI 在 3 月 24 日的弃用通知中列出 Videos API、sora-2、sora-2-pro 及其快照,推荐替代一栏为空;视频生成指南写明没有一对一的替代 API。Sora 独立应用定于 4 月 26 日下线(据 The Decoder)。迪士尼 2025 年 12 月宣布与 OpenAI 签订三年授权、让 200 多个角色进入 Sora,并计划入股 10 亿美元,交易仍需谈判最终协议;3 月关停消息公布时,Variety 报道迪士尼退出合作,据 exchange4media 报道双方未发生资金往来。此后 ElevenLabs、ComfyUI 等平台陆续下架 Sora 相关功能。

Sora 的 Videos API 从开放到关停不到一年,依赖单一闭源视频 API 的创作流程需要预留替换路径。

查看原始来源 ↗

Adobe 官方博客· 9月24日一手编辑精选 产品

Adobe 推出 Adobe in Gemini,可在 Gemini 对话中调用 Photoshop、Lightroom、Express 和 Firefly 的工具;Adobe for Claude 插件首次并入 Acrobat 工具,可调用 80 多个工具,并新增 PDF 与 Express 设计的交互式编辑器。

推荐理由 Adobe 的对话端接入已覆盖 ChatGPT、Claude、Copilot、Slack 和 Gemini,Claude 端新增的交互式编辑器可在对话中直接手动修改 PDF 和设计。

9 月 24 日,Adobe 推出 Adobe in Gemini:用户可在 Google Gemini 对话中调用 Photoshop、Lightroom、Adobe Express 和 Firefly 的工具修图、制作营销素材和修改设计,覆盖所有 Gemini 订阅档位,需登录 Adobe 账号;按 Google 的可用性说明,目前仅支持英文,限个人 Google 账号使用。同日 Adobe for Claude 插件首次并入 Acrobat 工具,可调用的工具增至 80 多个,并新增 PDF 交互式编辑器(调整页序、编辑文字、批注)、Document Review 技能和基于图层的 Express 设计编辑器。两项均从当日起在全球逐步推出。

同一套 Adobe 工具已能在 ChatGPT、Claude、Copilot、Slack 和 Gemini 中调用,各平台开放的工具范围和使用条件不同,使用前需分别确认。

查看原始来源 ↗

9月23日周三
Recraft 官方博客· 9月23日一手编辑精选 模型

Recraft 发布图像模型 V4.1 Flash,官方称从提示词到出图的中位时间为 1.3 秒,并称其为目前最快的图像模型;同日 ComfyUI v0.37.2 把它作为 Recraft V4 文生图节点上更快、成本更低的选项接入。

RC另有 1 家来源
推荐理由 出图延迟压到秒级,适合原型迭代、概念发散这类要大量试错的环节。

Recraft 于 9 月 23 日发布 V4.1 Flash。官方博客称它是目前最快的图像模型,从提示词到出图的中位生成时间为 1.3 秒(在更大的提示词集上测得),并给出了与其他图像模型在同一组提示词下的对比。同日 ComfyUI v0.37.2 接入该模型,作为 Recraft V4 文生图节点上更快、成本更低的选项。

出图速度接近实时,设计流程里的试错方式会跟着变:原型迭代、概念发散这类高频、低精度的环节受益最明显。

查看原始来源 ↗

Google 官方博客· 9月23日一手编辑精选 产品

Google 9 月 23 日宣布,任何 Google 或 Google Workspace 账号都可以在桌面端 Google Vids 里免费用 Gemini Omni 1.1 Flash 生成视频:可延展场景并保持人物、光线与环境一致,指定片段的精确时长,生成或放大到 1080p;每段生成内容都嵌入 SynthID 不可见水印。

推荐理由 同一代视频模型进了免费的办公工具,没有预算的个人和小团队也能直接用来做宣传短片、活动视频。

Google 于 9 月 23 日宣布扩大 Google Vids 的开放范围:任何 Google 或 Google Workspace 账号都可以在桌面端访问 vids.new,选择「Create AI videos」,免费用 Gemini Omni 1.1 Flash 生成视频。新增的控制包括:延展场景并保持画面上下文、光线、人物外观与环境一致;指定生成片段的精确时长,便于对齐旁白;以 1080p 生成新片段,或把已有 AI 片段放大到 1080p;另提供现成模板。每段用 Omni 1.1 生成的片段都嵌入 SynthID 不可见水印。免费使用有额度,个人账号可通过 Google AI 订阅获得更多生成次数,Workspace 商业版与企业版有更大的生成额度池;官方称 Gemini 3.8 Flash-Lite 语音合成即将加入 Vids。

同一代视频模型进了免费的办公工具,没有预算的个人和小团队也能直接用来做宣传短片、活动视频。

查看原始来源 ↗

9月22日周二
PixVerse 官方博客· 9月22日一手编辑精选 模型

PixVerse 9 月 22 日发布实时世界模型 R2:生成的世界持续运行,会话中的提示词、动作与音频输入会改变之后的发展而不重置,可用 WASD 与方向键操控角色和镜头;PixVerse 游戏引擎已改用 R2,一批示例世界在 world.pixverse.video 开放体验。

推荐理由 世界模型从生成片段走向可以进入、会记住操作的持续世界,互动叙事和游戏原型可以直接在上面搭。

PixVerse 于 9 月 22 日发布实时世界模型 R2,是 1 月推出的 R1 的升级。R2 生成的世界在用户进入后持续运行,会话更长、更连贯:提示词、动作或音频输入不只改变当前画面,还会更新世界状态、影响之后的发展,前面的操作在同一会话中一直有效;可以用 WASD 键操控角色、方向键移动镜头,文字、参考图、音频与动作控制都能输入同一个运行中的世界。官方示例包括创作者基于 R2 做的互动电影游戏,同一处剧情会按玩家的选择生成不同走向。官方介绍其做法是持续训练同一个因果自回归主干模型,再把它压缩到可实时运行,技术报告另行发布。PixVerse 7 月推出的游戏引擎已改用 R2,一批示例世界在 world.pixverse.video 开放体验。

世界模型开始支持持续交互与状态延续,互动叙事、游戏原型可以直接在生成的世界里搭建和试玩。

查看原始来源 ↗

OpenAI API 更新日志· 9月22日一手编辑精选 模型

OpenAI 9 月 22 日在 API 上线 GPT-6 Sol 与 GPT-6 Luna 两款推理模型,支持文本和图像输入、文本输出。标准定价(输入 272K token 以内,每百万 token):Sol 输入 $2、输出 $10;Luna 输入 $0.10、输出 $0.50。官方把 Sol 定位为兼顾能力与成本,Luna 面向成本敏感、调用量大的任务。

OO另有 1 家来源
推荐理由 与 9 月 3 日发布的旗舰 GPT-6 Astra 组成三档;Luna 的输入价格约为 Astra 的百分之一,是估算批量调用成本的直接参照。

OpenAI 于 9 月 22 日在 API 发布 GPT-6 Sol(gpt-6-sol)与 GPT-6 Luna(gpt-6-luna)。两款均为推理模型,接受文本与图像输入、输出文本,可通过 Responses API 与 Chat Completions API 调用。标准定价(输入不超过 272K token,每百万 token):Sol 输入 $2、缓存输入 $0.20、输出 $10;Luna 输入 $0.10、缓存输入 $0.01、输出 $0.50。按官方模型目录的分工,复杂推理与编程用旗舰 GPT-6 Astra,兼顾能力与成本用 Sol,成本敏感、调用量大的任务用 Luna。9 月 25 日 OpenAI 修复了一个影响这两款模型图像理解的编码问题;9 月 29 日又发布了 GPT-6.1 Sol。

Luna 的输入价格约为旗舰 Astra 的百分之一,给批量内容处理、分类抽取这类高频调用留出了成本空间。

查看原始来源 ↗

Adobe Firefly 帮助文档· 9月22日一手编辑精选 产品

Adobe Firefly 视频编辑器(Beta)新增背景移除:在时间轴选中片段打开开关,系统按首帧识别一个或多个主体,在整段片子里一致去掉背景;处理后的片段可下载为 MP4,也可以在时间轴里继续编辑。

推荐理由 视频去背原本要逐帧抠像,Firefly 网页端把它做成时间轴上的一个开关,降低了视频合成的门槛。

Adobe Firefly 视频编辑器(Beta)新增背景移除功能:在时间轴选中视频片段后,在属性面板打开「Remove background」开关(也可右键选择),系统会识别所选片段第一帧中的一个或多个主体,并在整段片子中一致移除背景、保留主体。处理完成后,新片段替换画布上的原片段,可以开关对比前后效果;新片段可下载为 MP4,也能像其他片段一样在时间轴里继续调整。片段若经过裁剪,仍对整段去背,但以裁剪范围内的第一帧选择主体。

过去通常要逐帧抠像的视频合成步骤,在 Firefly 网页端变成一个开关,适合快速做素材合成与短视频原型。

查看原始来源 ↗

9月21日周一
ComfyUI 官方· 9月21日一手编辑精选 产品

ComfyUI v0.37.0(9 月 21 日)原生支持 Qwen-Image 2.1(文生图、编辑、背景移除三个模板,可输出透明图)和 MoGe 3 单图几何估计;v0.37.1(9 月 22 日)新增腾讯 HY Image 3.5 Preview 文生图与编辑合作节点,编辑节点最多接 5 张参考图、原生 2K 输出。

ComfyUI 于 9 月 21 日发布 v0.37.0,原生支持阿里 Qwen 团队 9 月 20 日发布的 Qwen-Image 2.1:同一模型完成文生图与编辑,可输出带透明通道的图像,官方提供文生图、图像编辑和背景移除三个模板;该模型采用 Qwen Research License,仅限非商业用途。同版本加入微软 MoGe 3 单图几何估计(ViT-L、ViT-g 两个检查点,可输出深度图与法线),并在检测到足够快的磁盘时自动启用快速加载。9 月 22 日的 v0.37.1 新增腾讯 HY Image 3.5 Preview 文生图与编辑合作节点:编辑节点可接 1–5 张参考图,原生最高 2K(选 4K 时由模型放大),在腾讯服务器上通过 API 运行。

透明图输出和背景移除进入节点工作流,抠图、叠加可以在同一条流程里完成;用 Qwen-Image 2.1 做商业项目前需要先确认许可。

查看原始来源 ↗

查看全部资讯 →