浅译快报

精选

AI × 艺术设计前沿,客观汇集每日动态、征集机会与 SKILL 评测。

头版
OpenAI官方/Fortune/CNBC· 9月3日一手 模型

OpenAI正式发布GPT-6(Project Astra),新增Computer Use能力,官方演示包括操控3D建模软件和CAD程序执行多步骤设计任务

OpenAI于9月3日正式发布GPT-6(内部代号Project Astra),核心新能力为Computer Use(计算机操控):模型可理解屏幕内容、控制浏览器和桌面应用、执行多步骤操作任务。官方演示场景包括操控3D建模软件和CAD程序,将AI能力从”内容生成”扩展至”工具操控”。GPT-6在多模态指令遵循和长上下文任务链方面有显著提升,沿用GPT-5.6架构基础进行工程优化。

Computer Use能力标志着AI从”生成助手”向”操控代理”的功能延伸,在设计和工程领域,AI直接操控专业软件执行任务的可能性正在从研究阶段走向产品落地。

查看原始来源 ↗

OpenAI官方/The Verge/TechCrunch· 9月9日一手 行业

OpenAI Sora API将于2026年9月24日终止服务,独立app已于4月下线,与迪士尼约$10亿规模的AI视频合作随之流产

OpenAI宣布Sora API将于2026年9月24日正式关停。Sora独立应用此前已于4月26日下线。与此同时,此前报道中规模约$10亿的Sora与迪士尼AI视频战略合作也随Sora产品线关停而终止。2024年2月发布时引爆行业想象力的旗舰AI视频产品,在不到两年内完成从里程碑到退出的完整周期。开源阵营(FLUX 3 Video、LTX-2.5、MiniMax H3)及国产视频模型(Wan 3.0、Seedance 2.5、Kling 3.5)在此期间已具备替代能力。

Sora从2024年全球最具关注度的AI视频到2026年关停,是AI商业化复杂性的典型案例;$10亿迪士尼协议流产将成为AI与传统内容产业合作中商业风险的重要参照案例。

查看原始来源 ↗

arXiv(arXiv:2609.11638)+ 生数...· 9月15日一手 模型

生数科技发布 Vidu S2,包含实时 720p 数字人生成与无中断流式视频风格编辑两个子模型,在线演示同步开放。

生数科技(Shengshu Technology)于9月15日发布 Vidu S2,包含两个子模型:Vidu S2-Avatar 支持实时生成 720p 数字人,可在对话中动态替换参考图、跟随舞蹈等复杂肢体指令;Vidu S2-Editing 实现流式实时视频风格编辑,包括风格渲染、换装、换人、换背景,整个过程无需中断视频流。论文同时展示了 VR 空间中的实时视频生成与编辑能力,配套在线演示已开放(vidu.com/vidu-stream),对应论文为 arXiv:2609.11638。

实时流式视频编辑能力让换装、换背景等操作接近「直播即生成」,对影视、时尚设计与数字人方向的创作工具链影响直接,VR 空间扩展亦值得关注。

查看原始来源 ↗

最新精选 全部资讯 →
9月3日周四
Runway官方研究博客· 9月3日一手 模型

Runway发布通用世界模型第二代GWM Worlds 2,持续生成720p/24fps视频并响应用户实时文字操控指令,世界从当前状态延续而非重置

Runway于9月3日发布通用世界模型第二代GWM Worlds 2,核心特性为持续生成720p/24fps视频与48,000Hz原生音频,并在不重置世界状态的前提下响应用户实时文字操控指令。与此前AI视频”提示词→固定片段”的生成模式不同,GWM Worlds 2的世界在用户每次输入操控指令后从当前状态延续,支持自由文本动作指令寻址角色或场景整体,以及持续的摄像机运动控制。官方定位覆盖互动娱乐、虚拟角色、机器人训练与具身Agent仿真,目前为研究预览阶段。

GWM Worlds 2标志着AI视频生成从”内容输出”向”可实时导演的连续世界”的范式跃迁,持续响应式世界模型为互动叙事和AI驱动场景仿真开辟了新的可能。

查看原始来源 ↗

9月1日周二
Anthropic官方· 9月1日一手 模型

Anthropic更新Fable 5.1和Mythos 5.1,缓存读取(cache read)成本降低75%,输出token价格维持不变

Anthropic于9月1日发布模型版本更新:Fable 5.1(快速推理优化版)与Mythos 5.1(增强推理版)同步上线,核心变化为缓存读取(prompt cache read)成本降低75%,输出token定价维持原有水平不变。缓存降价主要面向通过API大规模调用Claude的开发者场景,对频繁重复使用相同系统提示词的应用(如AI工具链、内容处理流水线)有直接成本影响。模型能力方面本次无重大突破,以工程优化和版本维护为主。

缓存读取成本的大幅下降使基于Claude API构建的AI工具在规模化运营时的边际成本显著降低,对有持续API调用需求的学术与应用开发场景有实质性的经济影响。

查看原始来源 ↗

8月27日周四
Google DeepMind官方· 8月27日一手 模型

Google发布Gemini Omni 1.1 Flash,支持40秒视频生成、首尾帧双重锁定、4K输出及$0.03/秒的Draft快速模式

Google DeepMind于8月27日发布Gemini Omni 1.1 Flash视频生成模型,在上一代基础上引入四项升级:最长单次生成时长从15秒延伸至40秒;新增首帧+尾帧双重锁定功能,用户可同时指定视频开头和结尾的画面,模型负责填充中间的运动过渡;原生输出分辨率升至4K;并推出Draft Mode,以$0.03/秒的定价大幅降低快速预览成本,正式模式仍维持原价。

Gemini Omni 1.1 Flash的首尾帧双锁定是AI视频生成向精确叙事控制迈进的关键功能,结合40秒时长和4K输出,覆盖了从快速原型到可交付成品的完整创作链路。

查看原始来源 ↗

8月24日周一
阿里巴巴官方/TechCrunch· 8月24日一手 模型

阿里巴巴Wan3.0全球发布,支持最长30秒视频生成、PDF/PPT/Word文档直接转视频,定价$0.05–$0.20/秒

阿里巴巴于8月24日正式向全球发布Wan3.0视频生成模型,主要规格:最长单次生成30秒,较上一代翻倍;新增多模态文档输入支持,用户可直接上传PDF、PPT或Word文件,模型将文档内容转化为视频叙事;API定价区间为$0.05至$0.20/秒,根据分辨率和质量档位浮动。Wan3.0同步开放了ComfyUI原生节点,支持与现有工作流无缝集成。与Seedance 2.5、Kling 3.5共同构成2026年国产AI视频模型的主流选项。

Wan3.0将文档作为原生视频输入格式,是AI视频生成从”纯创意工具”向”学术与工作场景实用工具”延伸的代表性进展。

查看原始来源 ↗

8月18日周二
MIT CSAIL/Nature Communicat...· 8月18日一手 论文

MIT CSAIL发表于《Nature Communications》的研究显示,AI图像生成的多步骤变换机制导致训练数据归因信号快速衰减,使版权追责在技术层面趋于不可能

MIT CSAIL发表于《Nature Communications》的研究提出”归因衰减”(Attribution Decay)理论:AI图像生成模型在多步骤扩散变换过程中,训练数据的可识别痕迹快速减弱,导致从生成图像反向追溯到特定训练图像的技术难度呈指数级上升。研究证明,即使已知模型的完整训练集,在实际生成场景下精确归因特定版权作品在计算上趋于不可能。这一结论对当前各国基于”相似度比对”的AI版权诉讼框架形成了直接挑战。

归因衰减理论将AI版权争议的核心从”法律判定”推向”技术举证”,意味着现行版权追责框架在面对扩散模型时可能需要从根本上重建。

查看原始来源 ↗

8月13日周四
MiniMax官方Blog / MarkTechPost· 8月13日一手 模型

MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个「产品级」AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。

MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个”产品级”AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。

MiniMax H3(视频)已是SEEN加更条目

查看原始来源 ↗

8月11日周二
Lightricks 官方 / VentureBeat· 8月11日一手 模型

Lightricks 于 2026-08-11 开源 LTX-2.5(HuggingFace `Lightricks/LTX-Video-2.5`):10 秒 720p 视频生成仅需 6.8 秒(单 RTX 4090),支持 4K 输出、同步音频、原生多镜头(multi-shot)叙事;ComfyUI 发布当日 day-0 官方支持(含节点与工作流模板);商业营收 $10M ARR 以下完全免费。

Lightricks 于 2026-08-11 开源 LTX-2.5(HuggingFace Lightricks/LTX-Video-2.5):10 秒 720p 视频生成仅需 6.8 秒(单 RTX 4090),支持 4K 输出、同步音频、原生多镜头(multi-shot)叙事;ComfyUI 发布当日 day-0 官方支持(含节点与工作流模板);商业营收 $10M ARR 以下完全免费。是目前开源视频模型中速度与质量综合最优选择。

6.8 秒/10 秒生成速度达到「课堂当场出片」级别,大幅降低 AI 视频教学摩擦

查看原始来源 ↗

8月6日周四
OpenAI 官方· 8月6日一手 模型

OpenAI 全量发布 GPT-5.6 Luna,面向所有 ChatGPT 用户开放免费无限制使用,SOL 逻辑推理与数学问题求解能力较前版本显著提升。

OpenAI 在 ChatGPT 中全量发布 GPT-5.6 Luna,向所有免费用户开放无使用次数限制,不再要求订阅 ChatGPT Plus;重点改进 SOL(Standard of Logic)推理能力,在数学解题、多步逻辑分析和代码推理任务上优于同期基准;模型延迟与响应速度也有明显改善。Luna 是 GPT-5.6 系列的标准版本,与更早发布的 GPT-5.6 Full 形成高/标准双档并行格局。

GPT-5.6 Luna 向免费用户全量开放,是 OpenAI 在国产 AI 集中发力后的竞争性回应,也意味着高校师生无需任何订阅即可接触到当前最先进的对话式 AI 推理能力。

查看原始来源 ↗

8月5日周三
Anthropic官方 / No Film School· 8月5日一手 产品

Anthropic发布「Claude for Creative Work」专项功能集,将Claude深度接入Adobe、Canva、Blender、Autodesk等六款以上创意软件,并与三所艺术学校开展课堂测试合作,标志着AI助理进入「内嵌于设计师日常工具」阶段。

Anthropic发布”Claude for Creative Work”专项功能集,将Claude深度接入Adobe、Canva、Blender、Autodesk等六款以上创意软件,并与三所艺术学校开展课堂测试合作,标志着AI助理进入”内嵌于设计师日常工具”阶段。

直接命中高校艺设课堂——Anthropic首次以”创意工作者+艺术院校”为目标群体发布定向产品线

查看原始来源 ↗

Google Developers Blog / Ge...· 8月5日一手 模型

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

视频时长×15(8s→120s)是AI视频从”片段”到”短片”的门槛跨越

查看原始来源 ↗

Black Forest Labs 官方 / Vent...· 8月5日一手 模型

Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。

Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。前序:FLUX 3 统一多模态框架 2026-07-23 发布(图像+视频+音频同权重),本次为视频 GA 里程碑。

FLUX 生态是视频 GA 使无需更换工具链

查看原始来源 ↗

7月7日周二
机器之心 / arXiv· 7月7日编辑精选 论文

TryOnCrafter提出首个支持自由视角的视频虚拟试衣DiT框架,引入4D试衣代理机制,入选ECCV 2026,机器之心与arXiv双源确认。

TryOnCrafter是一个基于扩散Transformer(DiT)的视频虚拟试衣框架,提出了首个支持自由视角的4D试衣代理机制,可从多个视角对服装穿着效果进行视频级生成与评估。研究成果入选ECCV 2026计算机视觉领域顶级会议,由机器之心及arXiv于2026年7月7日报道发布。与既有方法相比,TryOnCrafter在视角自由度与时序一致性上有系统性改进。

自由视角的视频级虚拟试衣能力在电商、数字服装及AI辅助设计等场景中有直接应用价值,ECCV 2026的入选也为该方向的学术认可度提供了参照。

查看原始来源 ↗

同济DF· 7月7日一手编辑精选 论文

同济大学设计创意学院11项研究成果入选CHI 2026,其中2篇获最佳论文提名,研究聚焦AI与交互设计、可及性及教育技术的交叉应用。

2026年7月7日,同济大学设计创意学院(D&I)官方发布消息,本届CHI 2026(ACM人机交互领域顶级学术会议)共收录该院11项研究成果,其中2篇入围最佳论文提名,研究方向集中于AI辅助的交互设计、无障碍可及性及教育技术应用。CHI是计算机与人机交互领域国际最具影响力的学术会议之一。

同济设创在CHI 2026的集中收录,代表国内设计院校在AI辅助交互设计领域的学术产出正在获得国际顶级会议的认可,对该方向的学术研究路径有参考价值。

查看原始来源 ↗

Meta 官方 / TechCrunch / CNBC...· 7月7日一手编辑精选 模型

Meta Superintelligence Labs 发布首个自研图像生成模型 Muse Image,采用 Agent 式架构(调用搜索与代码工具自我修正),已上线 Meta AI 应用、Instagram Stories 及 WhatsApp,并将接入广告系统 Advantage+,多指标超越 Google Nano Banana 2

7 月 7 日,Meta Superintelligence Labs(由 Alexandr Wang 领导)正式发布 Muse Image,这是 Meta 首个完全自主研发的图像生成模型。模型采用 Agent 式生成架构,可调用搜索与代码工具对输出进行自我修正,支持文生图、图像编辑、多参考图合成及以 Instagram 公开图片为参考源等功能;已在 Meta AI 应用、Instagram Stories(美国)及 WhatsApp(部分地区)上线,并计划接入广告投放系统 Advantage+。在多项第三方评测中,Muse Image 超越 Google Nano Banana 2,仅略低于 OpenAI 最新 GPT Image 模型;Muse Video 版本即将推出。消息由 Meta 官方及 TechCrunch、CNBC、Bloomberg、Axios 等 7 个以上信源同步报道。

更新(7 月 10 日):其中「@提及公开账号生成」功能因采用 opt-out 默认机制、允许参考任意公开 Instagram 账号历史图像,遭 SAG-AFTRA 与 CAA 联合声讨后由 Meta 下架,模型本体仍在运行。详见后续报道。

Meta 以 Agent 式架构切入图像生成并直接整合社交与广告分发渠道,标志着图像生成模型进入「生成即分发」的平台化阶段,对 AI 视觉生成在商业内容生产及社交平台工作流中的渗透路径有直接参考意义。

查看原始来源 ↗

7月6日周一
量子位 / TechTimes / AI Weekly...· 7月6日编辑精选 案例

独立电影人群体正悄然转向字节Seedance 2.5,AI视频生成成本约$9/分钟较传统摄制$24/分钟大幅压低,量子位、Variety等多源报道证实这一趋势正在专业创作圈扩散。

量子位、TechTimes、AI Weekly及Variety等多源报道显示,字节旗下AI视频生成工具Seedance 2.5正在好莱坞独立电影人群体中加速渗透。核心驱动因素在于成本差距:AI视频生成约$9/分钟,较传统专业摄制的$24/分钟降低约62%,价差推动部分独立电影人将其纳入正式制作流程,而非仅用于概念验证。相关加更长文已于2026-07-08写就。

AI视频工具从创意探索进入专业制作采购决策的转折,标志着成本驱动的替代逻辑开始在影视产业链中实际生效,对AI视频生成商业化进程及国内竞品格局具有直接参照价值。

查看原始来源 ↗

IT之家 / 量子位 / 36氪 / 雷锋网 / 新浪科技· 7月6日编辑精选 模型

字节跳动即梦旗下 Seedance 2.5 视频生成模型公布:主打多镜头跨场景人物一致性与专业运镜控制;公测尚未正式面向全体用户开放,具体上线时间以官方为准

字节跳动旗下即梦(Dreamina)公布新一代视频生成模型 Seedance 2.5,核心能力包括多镜头叙事场景下的跨片段人物/场景一致性保持,以及专业级运镜控制(推拉摇移跟等镜头语言),在连贯性与画面质量上均有提升。公测尚未正式面向全体用户开放,具体开放时间与范围以官方公告为准。

多镜头一致性与运镜控制是 AI 视频从「单段生成」走向「可导演式叙事视频」的关键门槛,值得关注其后续公测节奏。

查看原始来源 ↗

查看全部资讯 →