Google | Gemini Omni 1.1 Flash Google DeepMind 推出的生成式视频模型,隶属 Gemini Omni 系列,已通过 Gemini API 在 Google AI Studio 提供生产级能力。scene extension 支持引用最长 10 秒前置上下文(前代仅最后一秒),可按 10 秒增量将视频延展至累计 40 秒,还能引用最多 3 秒视频作为参考输入以保持画面一致。360p 草稿模式较 720p 快最多 60%、成本约三分之一,并支持 1080p 与 4K upscaling。 | 2026年8月27日 | |
Midjourney | V8.2 Edit Model Midjourney 于 2026 年 8 月 27 日开放测试其首个 V8.2 image edit model。该模型支持按文字指令编辑图像,可用最多 4 个 image reference 生成图像以替代 omni-reference,并提供 inpainting 与 outpainting 实现局部修改与画布扩展,personalization、moodboard 和 sref 也可在编辑流程中使用。用户可在 midjourney.com 网页端使用,或通过 Discord 的 --edit 命令调用。 | 2026年8月27日 | |
Midjourney | V8.2 image edit model Midjourney 首个 V8.2 image edit model 已开放全体用户测试,定位为图像编辑模型。它支持按文字指令编辑图片、以最多 4 张参考图生成图像(取代此前的 omni-reference),并提供 inpainting 局部重绘与 outpainting 画布扩展能力,同时兼容 personalization、moodboards 与 srefs。可在网页端 attach to prompt、lightbox 的 edit 入口或 Discord 的 --edit 参数使用。 | 2026年8月27日 | |
Zhipu AI | GLM-5.3-Flash GLM-5.3-Flash 是智谱 GLM-5 系列首款原生多模态模型,总参数 320B、激活参数 18B,首次在 GLM 系列中采用 sparse 与 linear attention 混合架构,context window 最高 1M token。它以约十分之一的价格在各 benchmark 上超越 GLM-5.2,coding 与 agentic 能力接近 Claude Opus 4.8,Artificial Analysis Intelligence Index 得分 57。模型面向高强度编码、agent 工作流以及文档、图表等视觉理解场景,权重已在 Hugging Face 开放。 | 2026年8月27日 | |
Hunyuan | hy4-preview Hy4 preview 是腾讯混元团队开源的新一代 MoE 旗舰大模型,总参数 770B,每 token 激活 49B,context window 达 1M,并内置 MTP 层支持投机解码。模型面向软件工程、办公分析、游戏开发与科研等生产力场景,在 203 个真实工程任务的内部盲测中略优于 GLM 5.3 与 Kimi K3。权重以 Apache 2.0 协议开放,另提供 FP8 量化版本。 | 2026年8月26日 | |
Qwen | Qwen3.8-Flash Qwen3.8-Flash 是通义千问推出的多模态大模型,兼顾理解生成能力与响应速度,原生支持百万级 context window,可一次处理超长文档与复杂对话。它面向编程辅助、智能体协作和图文理解场景,兼容 OpenAI 与 Anthropic 接口协议,推理成本具备竞争力,适合高并发应用。 | 2026年8月25日 | |
OpenAI | GPT‑5.6 GPT‑5.6 是 OpenAI 最新的旗舰模型系列,包含 Sol、Terra、Luna 三个变体,现已集成到软件开发智能体 Kiro 中。该系列以更低成本实现更强性能,并按需提供处理复杂任务的能力,在 Kiro 中用于以需求、代码库和团队标准为基础的长时间开发任务。在 Terminal-Bench 2.1 测试中,GPT‑5.6 Terra 在 Kiro 中完成任务的成本降低约 82%。 | 2026年8月24日 | |
DeepSeek | DeepSeek-V4-Flash-Vision-Exp DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 推出的实验性多模态模型,文本能力与 V4-Flash 持平,覆盖 agents、reasoning 与世界知识。在多模态 agent benchmark 上较 V4-Flash 显著提升,接近 Opus-4.8 水平。图片按每张最多 384 tokens 计费,沿用 V4-Flash 定价,支持 base64、URL 或 Files API 传入,适合视觉理解结合工具调用的 agent 工作流。 | 2026年8月21日 | |
ElevenLabs | Eleven v3 Conversational Eleven v3 Conversational 是 ElevenLabs 面向实时场景的最具表现力 TTS 模型,以约 280ms 的低 latency 输出情感丰富、自然逼真的语音。它支持 70+ 种语言,并提供 audio tags 做细粒度风格控制,适合客服 voice agents、AI 助手与互动角色等实时对话场景,经 Text to Dialogue WebSocket 调用。 | 2026年8月20日 | |
Qwen | Wan3.0-Video-Prime Wan3.0-Video-Prime 是阿里云万相视频生成优速版模型,能力对齐 Wan3.0-Video 标准版,端到端生成速度显著提升。它支持文本、图像、视频、音频输入,统一实现文生视频、图生视频与参考生视频,可输出 480P 至 1080P、30fps 视频,最长 30 秒。 | 2026年8月20日 | |
OpenAI | GPT-5.6 Luna GPT-5.6 Luna 是 OpenAI GPT-5.6 系列中速度更快、极具性价比的档位,与旗舰 Sol、均衡型 Terra 并列。它以不到 GPT-5.5 一半的预估成本提供接近的综合能力,在 Artificial Analysis Coding Agent Index 上超过 Claude Opus 4.8,耗时约其三分之一。API 每百万 Token 输入 1 美元、输出 6 美元,2026 年 7 月 30 日又降价 80%,适合日常任务与成本敏感场景。 | 2026年8月19日 | |
Zhipu AI | GLM-5.3 GLM-5.3 是智谱 Z.ai 的旗舰编程大模型,与 GLM-5.2 共用同一 base model,提升全部来自 post-training 规模化。官方称其为最强的 open-weights 编程模型,在 Terminal Bench 3.0、Agents' Last Exam 等公开 benchmark 上达到开源 SOTA,自测的 Z.ai Code Bench 较前代提升 50%。漏洞挖掘能力随训练规模涌现,在 CyberGym 上以 84.5% 取得 state of the art。权重于发布两周后开源,适合在 ZCode、Claude Code 等编程 agent 中承担复杂编码与长时程任务。 | 2026年8月18日 | |
Qwen | Qwen3.8-27B Qwen3.8-27B 是通义千问 Qwen3.8 系列的 27B Dense 视觉语言模型,原生支持图像与视频理解。相较 Qwen3.6-27B,它重点提升了文本与视觉模态下的编程和办公能力,在 SWE-bench Pro、OSWorld 等 benchmark 上进步明显。原生 context window 为 256K token,可扩展至 1M,适合编程、专业办公与长程 agent 任务。 | 2026年8月17日 | |
DeepSeek | DeepSeek-V4-Pro-0813 DeepSeek-V4-Pro-0813 是 2026 年 8 月 13 日上线的 DeepSeek V4 Pro 文本模型正式版,重点强化 Agent 能力,官方称生产环境表现提升显著。模型支持 low/high/max 三档 reasoning effort,原生兼容 OpenAI Responses API,并为 Codex 提供一键配置。Terminal Bench、DeepSWE 等 Agent benchmark 较 V4-Pro-Preview 明显进步,API 同步引入峰谷分时定价,闲时半价。 | 2026年8月13日 | |
Google | Gemini 3.7 Flash Google 于 2026 年 8 月 13 日发布的 Flash 系列新模型,定位为面向 coding 与 agents 场景的智能 workhorse 型号。相较 Gemini 3.6 Flash,其在 FrontierCode 1.1 Main(43.6% 对 34.4%)、DeepSWE v1.1 等 benchmark 上提升明显,并能参照截图或设计系统生成网页界面。介绍期定价为每百万 input tokens $0.75、output tokens $3.75,现已上线 Gemini API、Google Antigravity 与 AI Studio。 | 2026年8月13日 | |
Google | sign-language-to-text (SL2T) SL2T 是 Google DeepMind 与 Android 联合研发的大规模多语言手语到文本翻译模型,可将手语实时转为流式文本,让用户在手机上以手语代替打字。模型基于超过 100,000 小时、覆盖 50 余种手语的数据训练,首发支持 American Sign Language (ASL) 到英语的翻译,并在 FLEURS-ASL 基准上取得 70 BLEURT 的 zero-shot 成绩。目前已在 Pixel 11 的 Gboard 与 Live Transcribe 中免费上线,服务聋人及重听用户的手语输入与日常沟通。 | 2026年8月12日 | |
Qwen | Qwen3.8-2.4T-A95B Qwen3.8-2.4T-A95B 是通义千问旗舰系列的开源版本,2026 年 8 月发布。模型采用稀疏 MoE 架构,总参数 2.4 万亿、每步激活约 950 亿,配合混合注意力机制,支持 100 万 Token 上下文。核心 benchmark 成绩为 GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1 与 BabyVision 82.0,CodeArena 排名全球第 4。 | 2026年8月12日 | |
Microsoft | MAI-Code-1.1-Flash MAI-Code-1.1-Flash 是微软推出的小型高效代码模型,已在 GitHub Copilot 中投入生产。相较 6 月 Microsoft Build 发布的 1.0 版本,它生成代码的质量更高,token 效率提升 25%,价格仅为四分之一;Terminal-Bench 2.1 成绩提高 22%,.NET 任务提升 15%。该模型面向 IDE 与 CLI 编码场景,流式输出速度也提高了 25%。 | 2026年8月11日 | |
NVIDIA | Nemotron 3.5 Lightning (30B A3B) NVIDIA Nemotron 3.5 Lightning 是面向长期运行 agentic AI 工作负载的开源 MoE 模型,总参数 30B、激活约 3B(A3B)。官方数据显示其输出速度最高达同级模型的 4 倍,agentic 任务完成快约 30%,并在 PinchBench 中保持 frontier 级准确率。模型提供 NVFP4 量化版本,可在 RTX PC、DGX Spark、DGX Station 与 Jetson 等设备上本地运行,适合代码审查、工具调用等高频专项任务,并支持用 NeMo 在自有数据上后训练。 | 2026年8月11日 | |
Meta | Muse Glimmer-30B Muse Glimmer-30B 是 Meta 以 Apache 2.0 许可开源的 30B 参数 agentic 模型,面向单张消费级 GPU 上的本地 agent 工作流,量化后 24GB 显存内即可运行。它支持精确工具调用、长程多步推理、图文多模态输入与失败恢复,覆盖 100 余种语言。官方评测显示,其在 SWE-Bench、τ-Bench 等 benchmark 上与 Gemma4-31B、Qwen3.6-27B 相比于同级别中表现强劲,适用于本地 agent、function calling 与 LLM-as-a-judge 评测等场景。 | 2026年8月10日 | |