Google Gemini Robotics-ER 1.6
Gemini Robotics-ER 1.6 是 Google DeepMind 面向机器人领域的 Embodied Reasoning 升级模型,专注视觉与空间理解、任务规划和成功检测,可作为机器人的高层推理层,并原生调用 Google Search、VLA 等外部工具。相较 1.5 版本,其在 pointing、计数与成功检测上表现更好,新增仪表读数能力,安全策略遵守度也进一步提升。开发者可通过 Gemini API 与 Google AI Studio 使用。
2026年4月13日 Vidu viduq3
viduq3 是 Vidu(生数科技)Q3 系列的标准版视频生成模型,2026 年 4 月 13 日随参考生视频能力上线。该模型支持智能切镜与音画同出,多机位一致性更出色;参考生模式下可上传 1 至 7 张参考图,生成 3 至 16 秒、最高 1080p 的视频,默认同步输出音频,适合短剧、漫剧等叙事内容创作。
2026年4月13日 Vidu viduq3-mix
viduq3-mix 是生数科技 Vidu 于 2026 年 4 月在参考生视频接口新增的 ViduQ3 系列视频生成模型,可基于 1-7 张参考图生成保持主体一致性的视频。官方将其定位为均衡性最强的通用档位,支持音画同出与智能切镜。规格上,时长默认 5 秒、最长 16 秒,分辨率最高 1080p,帧率 24fps,画面比例支持 16:9、9:16 与 1:1。
2026年4月13日 ByteDance Seeduplex
Seeduplex 是字节跳动 Seed 团队推出的原生全双工语音大模型,突破半双工轮流发言的固有范式,实现真正的“边听边说”。依托海量语音数据预训练与强化学习(RL),模型在复杂声学场景下具备精准抗干扰与动态判停能力,判停延迟降低约 250ms,误回复率与误打断率减半。目前已在豆包 App 全量上线,为上亿用户提供更自然的实时语音交互体验。
2026年4月9日 Meta Muse Spark
Muse Spark 是 Meta Superintelligence Labs 的 Muse 系列首个模型,原生多模态推理架构,支持 tool-use、visual chain of thought 与多智能体编排。其 Contemplating mode 并行调度多个推理智能体,在 Humanity's Last Exam 取得 58%、FrontierScience Research 取得 38%。预训练栈经重构,达到同级能力的算力开销较 Llama 4 Maverick 低一个数量级以上。模型现已上线 meta.ai 与 Meta AI app,并向部分用户开放 API 私有预览。
2026年4月8日 Zhipu AI GLM-5.1
GLM-5.1 是智谱面向 agentic engineering 的新一代旗舰模型,编码能力较前代 GLM-5 显著增强,在 SWE-Bench Pro 上以 58.4 分取得 state-of-the-art。它能在数百轮迭代与数千次 tool call 中持续自我优化,擅长 long-horizon 任务,权重以 MIT License 开源,可配合 Claude Code 等 coding agent 使用。
2026年4月7日 Grok grok-imagine-image-quality
grok-imagine-image-quality 是 xAI 在 Grok Imagine API 中面向企业开发者提供的图像生成与编辑 Quality Mode(高质量档),主打更高真实感、更强文字渲染与更细的创作控制,在独立图像排行榜上位居前列。适合产品渲染、营销素材、UGC 风格内容等场景,从电影感画面到 UI 图标均可覆盖。
2026年4月3日 Grok grok-imagine-image-quality-20260403
grok-imagine-image-quality-20260403 是 xAI 图像模型 Grok Imagine 的 Quality Mode 快照版本,通过 Grok Imagine API 向企业开发者和团队提供图像生成与编辑能力。官方称其在真实感、文字渲染和创作控制上均有提升,并在独立排行榜中位居前列。适合产品可视化、营销素材、UGC 风格内容等场景,也可与视频生成能力搭配使用。
2026年4月3日 Qwen Wan2.7-Image-To-Video
Wan2.7-Image-To-Video 是通义万相的图生视频模型,2026年4月3日上线阿里云百炼。模型支持首帧生视频、首尾帧生视频与视频续写,可输出 720P/1080P、2 到 15 秒的 30fps MP4 视频,并具备有声视频与声画同步能力。官方称这一代演绎能力全面升级,文戏情感细腻、动作戏拳拳到肉,镜头切换更具戏剧性与节奏感。
2026年4月3日 Qwen Wan2.7-Reference-To-Video
wan2.7-r2v(万相2.7-参考生视频)是阿里云百炼的参考生视频模型,支持最多5个图/视频混合参考并可为每个主体指定音色,更稳定地保持角色、道具与场景一致。还能以多宫格故事板为参考生成多镜头有声视频,输出720P/1080P,适合单角色表演与多角色互动等创作场景。
2026年4月3日 Qwen Wan2.7-Text-To-Video
Wan2.7-Text-To-Video(万相2.7文生视频)是阿里云的文生视频模型,基于文本提示词生成流畅视频,支持 720P/1080P 分辨率和 2 至 15 秒时长,可自动生成配套音频。演绎能力全面升级,文戏情感细腻、动作戏拳拳到肉,并支持用自然语言控制多镜头切换。
2026年4月3日 Qwen Wan2.7-Video-Edit
Wan2.7-Video-Edit 是阿里云百炼 2026 年 4 月发布的万相视频编辑模型。它通过自然语言指令对已有视频进行局部或全局编辑,支持元素增删改、背景与光照调整、风格转换,以及角色台词等内容的二次创作;也可参考图像替换服饰、道具等元素,并复刻参考视频的动作、运镜与特效,输出支持 720P 与 1080P。
2026年4月3日 Google Gemma 4
Gemma 4 是 Google 开源模型系列第四代,与 Gemini 3 同源技术构建,面向高级推理与 agentic 工作流,提供 E2B、E4B 端侧型号及 26B MoE、31B Dense 两个大尺寸,上下文最高 256K。31B 在 Arena AI 文本榜单居开源模型第三,官方称其可胜过 20 倍体量的模型。系列以商用友好的 Apache 2.0 协议开源,支持 140+ 语言,适合端侧推理、编程助手与私有化部署。
2026年4月2日 Zhipu AI GLM-5V-Turbo
GLM-5V-Turbo 是智谱的多模态视觉编码 Turbo 档模型,以更小的模型规模原生理解图像、视频、设计稿与文档版式,提供 200K context window 和最高 128K 输出。官方称其在多模态编码、工具调用与 GUI Agent 核心 benchmark 上表现领先,AndroidWorld、WebVoyager 等 GUI 实测同样强劲,可与 Claude Code、OpenClaw 协同覆盖前端还原、GUI 自动化与代码调试。
2026年4月2日 Qwen Qwen3.6-Plus
Qwen3.6-Plus 是阿里云通义 Qwen3.6 原生视觉语言系列的 Plus 档模型,官方称其性能与当前顶尖前沿模型相媲美,较 3.5 系列显著提升。它支持图像、文本、视频输入和 1M token 上下文,在 Agentic coding、前端编程等代码能力与多模态万物识别、OCR、物体定位上明显增强。
2026年4月1日 Qwen Qwen3.6-Plus-2026-04-02
Qwen3.6-Plus-2026-04-02 是阿里云百炼上 Qwen3.6 原生视觉语言系列 Plus 档模型的 2026 年 4 月 2 日快照版本。官方称其性能比肩当前顶尖前沿模型,较 3.5 系列显著提升,Agentic coding、前端编程等代码能力与多模态识别、OCR、物体定位明显增强。模型支持 1M token 上下文窗口,可输入文本、图像与视频,快照版行为固定,适合生产环境稳定调用。
2026年4月1日 Qwen Wan2.7-Image-Generator-Edit
Wan2.7-Image-Generator-Edit 是阿里云通义万相 2.7 图像生成与编辑模型的标准档,2026 年 4 月 1 日上线阿里云百炼。它支持文生图、文生组图、图生组图、图像编辑、多图参考生成与交互式编辑,输出 1K/2K 分辨率,在文字渲染、主体一致性与复杂指令遵循上表现更强,生成速度快于旗舰版,适合组图创作与图像编辑类需求。
2026年4月1日 Qwen Wan2.7-Image-Generator-Edit-Pro
Wan2.7-Image-Generator-Edit-Pro 是阿里云万相(Wan)系列于 2026 年 4 月发布的图像生成与编辑旗舰版模型,覆盖文生图、组图生成、图像编辑与交互式编辑。它提供品牌色调色盘,文生图最高 4096x4096 分辨率,编辑支持最多 9 张参考图,在文字渲染与主体一致性上表现更强,适合品牌设计与多图一致性创作。
2026年4月1日 Google Gemini 3.1 Flash Live
官方发布,详细介绍即将补充。
2026年3月26日 PixVerse PixVerse V6
PixVerse V6 是 PixVerse 旗舰视频生成模型的最新版本,在运镜控制、角色表情连贯性与物理交互真实感上改进明显,可用单条 prompt 生成画面与 native audio 同步的多镜头短片,并支持在画面中渲染中英文等多语言文字。新版还提供 CLI 接入,可嵌入 Claude Code、Cursor 等 agentic 工作流。
2026年3月26日