Qwen Qwen3.7-Max-2026-05-17
Qwen3.7-Max-2026-05-17 是 Qwen3.7 系列中规模最大、综合能力最强的 Max 模型预览版的日期快照,仅支持思考模式,开放纯文本能力。模型主要面向通用对话场景优化,适合知识问答、指令跟随与创意写作。输入 12 元/百万 token、输出 36 元/百万 token,单次请求输入上限 1M token。
2026年5月19日 Qwen Qwen3.7-Max-Preview
Qwen3.7-Max-Preview 是阿里巴巴通义 Qwen3.7 系列中规模最大、综合能力最强的 Max 模型预览版,仅支持思考模式,当前开放纯文本能力供体验。它主要优化面向用户的通用对话场景,例如知识问答、指令跟随、创意写作等。上下文长度 1,000,000 tokens,在阿里云百炼的定价为输入 12 元、输出 36 元每百万 tokens。
2026年5月19日 Google Antigravity 2.0
Google Antigravity 2.0 是 Google 推出的 agent-first 独立桌面应用,支持 macOS、Linux 与 Windows,由最新的 Gemini 模型驱动,不再捆绑 IDE。新版引入 Dynamic subagents、异步任务管理、JSON hooks 与 Scheduled Tasks 定时调度,可在 agent 产出的 artifacts 上直接反馈。它面向软件开发与更广泛的知识型工作,官网提供下载,并有 CLI、SDK 与 API 配套。
2026年5月17日 Google Gemini Omni
Google Gemini Omni 是 2026 年 5 月发布的原生多模态生成模型系列,支持以图像、音频、视频与文本组合作为输入并生成高质量视频,可通过多轮自然语言对话持续编辑,角色一致性与物理效果保持稳定。系列首发模型 Gemini Omni Flash 已面向 Google AI Plus/Pro/Ultra 订阅用户推出,可在 Gemini app 与 Google Flow 中使用,生成视频均嵌入 SynthID 水印,开发者 API 后续开放。
2026年5月17日 Google Gemini 3.5
Google 发布的 multimodal 模型系列,主打 agentic 工作流,首发 Gemini 3.5 Flash,3.5 Pro 随后推出。3.5 Flash 在 Terminal-Bench 2.1、MCP Atlas、GDPval-AA 等 coding 与 agentic benchmark 上超越 Gemini 3.1 Pro,输出 token 速度约为其他 frontier 模型的 4 倍,成本常不足其一半。适合长程 agent 任务与开发场景,可通过 Gemini app、Search AI Mode、Google AI Studio 的 Gemini API 及 Gemini Enterprise 使用。
2026年5月15日 OpenAI GPT-5.5-Cyber
OpenAI 推出的网络安全向受限预览模型,面向守护关键基础设施的防御者。它在 GPT-5.5 基础上经专门训练,对授权安全任务采取更宽容的策略,并配套更严格的身份核验与账户级管控,支持授权红队测试、渗透测试与受控验证等工作流。模型通过 Trusted Access for Cyber(TAC)计划提供,个人可在 chatgpt.com/cyber 完成身份验证后使用。
2026年5月7日 OpenAI new realtime voice models
OpenAI 在 Realtime API 发布三款语音模型。GPT-Realtime-2 首次将 GPT-5 级推理带入实时对话,支持并行工具调用、128K 上下文与可调 reasoning effort;GPT-Realtime-Translate 将 70 余种输入语言实时译为 13 种输出语言;GPT-Realtime-Whisper 提供低延迟流式语音转写。三者适合语音助手、多语言客服与实时字幕等场景,按 token 或分钟计费。
2026年5月7日 Mistral AI Mistral Medium 3.5
Mistral Medium 3.5 是 Mistral AI 首个融合指令遵循、推理与编码的 128B 稠密旗舰模型,配备 256k 上下文窗口,以开放权重发布。它在 SWE-Bench Verified 达到 77.6%,超越 Devstral 2 与 Qwen3.5 397B A17B,最少四张 GPU 即可自托管。该模型现为 Mistral Vibe 与 Le Chat 的默认模型,面向 vibe coding、云端远程 coding agent 与长时程生产力任务,API 定价为每百万输入 token $1.5、输出 $7.5。
2026年4月29日 Hunyuan hunyuan-image-v3.0-v1.0.5
混元图像 3.0 是腾讯混元的原生多模态图像生成模型,采用自回归统一架构与 MoE 设计,总参数 80B、每 token 激活 13B。2026 年 4 月末官方平台完成 Plus 升级,支持多轮交互,文本渲染更精准,写实美感更佳。权重以 Tencent Hunyuan Community License 开源,适合文生图及海报类含文字视觉创作。
2026年4月28日 Xiaomi MiMo-V2.5-Pro
MiMo-V2.5-Pro 是小米 MiMo 系列迄今最强的旗舰模型,采用总参数 1.02T、激活 42B 的 MoE 架构,主模型 context window 达 1M tokens。它面向 agentic 编程与 long-horizon 任务,可稳定完成上千次 tool call 的工作流,在 ClawEval 上取得 64% Pass^3。模型权重已以宽松许可证在 Hugging Face 完全开源,适合接入 Claude Code 等编程工具链。
2026年4月27日 Qwen HappyHorse-1.0-R2V
HappyHorse-1.0-R2V 是阿里云百炼推出的参考图生视频(Reference-to-Video)模型,支持最多 9 张参考图像,配合文本提示词将图像中的主体角色融合生成流畅视频,主体与场景参考更加稳定,可精准保持创作意图。生成时长 3 至 15 秒,分辨率最高 1080P,支持 16:9、9:16 等多种宽高比。
2026年4月26日 Qwen HappyHorse-1.0-Video-Edit
HappyHorse-1.0-Video-Edit 是阿里云百炼推出的视频编辑模型,通过自然语言指令对已有视频执行风格转换、元素替换等编辑操作,支持参考最多 5 张图片对视频元素进行局部或全局修改,并能精准复刻原视频的动态过程。模型输出 720P 或 1080P 的 MP4 视频,时长 3 至 15 秒,适合对既有素材做风格化改写和定向内容替换。
2026年4月26日 Qwen Wan2.7-Image-To-Video-2026-04-25
阿里云百炼万相2.7图生视频(wan2.7-i2v)的2026年4月25日快照版本,版本固定,适合需要稳定复现的生产场景。支持首帧生视频、首尾帧生视频和视频续写,可生成720P/1080P、2至15秒、30fps的有声MP4视频。演绎能力全面升级,文戏情感细腻自然,动作戏激烈拳拳到肉,镜头切换更富戏剧性和节奏感。
2026年4月26日 Qwen Wan2.7-Text-To-Video-2026-04-25
Wan2.7 文生视频是阿里云通义万相的视频生成模型,此为 2026 年 4 月 25 日快照版本。它依据文本提示词生成电影级多镜头有声视频,支持文本与音频输入、声画同步;文戏情感细腻自然,动作戏激烈,镜头切换更具戏剧性与节奏感。支持 720P/1080P、2 至 15 秒时长、30fps MP4 输出。
2026年4月26日 ByteDance Seed3D 2.0
Seed3D 2.0 是 ByteDance Seed 推出的新一代 3D 生成大模型,将图生 3D 资产质量推向生产可用。模型采用两阶段 DiT 几何生成与统一 PBR 纹理合成,支持部件级生成与关节建模,可输出 URDF 格式并兼容 Isaac Sim 等物理仿真引擎。在约 200 个用例、对比六个主流模型的两两盲评中,其几何与纹理材质生成均达 SOTA,纹理偏好率超 69%,API 已上线火山方舟(Doubao-Seed3D-2.0)。
2026年4月23日 DeepSeek DeepSeek-V4-Flash-0423
DeepSeek-V4-Flash 是 DeepSeek 2026 年 4 月随 V4 Preview 开源的快速高性价比档模型,MoE 架构,总参数 284B、激活仅 13B。其推理能力接近 V4-Pro,简单 Agent 任务与之持平,响应更快、API 定价更低。支持 1M context window 与 Thinking/Non-Thinking 双模式,已集成 Claude Code、OpenCode 等编码 Agent。
2026年4月23日 DeepSeek DeepSeek-V4-Flash-Max
DeepSeek 于 2026 年 4 月发布 V4 Preview,同步推出旗舰 V4-Pro 与快速档 V4-Flash。快速档采用 MoE 架构,总参数 284B、激活 13B,提供 1M context window,推理能力接近旗舰,简单 agent 任务与 V4-Pro 持平,且响应更快、API 定价更经济,适合对话、agent 与编码等高性价比场景。
2026年4月23日 DeepSeek DeepSeek-V4-Pro-Max
DeepSeek-V4-Pro-Max 是 DeepSeek V4 系列的旗舰开源文本模型,1.6T 总参数 / 49B 激活参数,依托 DSA 稀疏注意力与 Token-wise compression,默认提供 1M context window。官方 benchmark 显示其 Agentic Coding 达到开源 SOTA,数学、STEM 与代码能力领先现有开源模型,世界知识仅次于 Gemini-3.1-Pro。支持 Thinking / Non-Thinking 双模式,适合 agentic coding 与长上下文推理场景。
2026年4月23日 OpenAI GPT-5.5
GPT-5.5 是 OpenAI 于 2026 年 4 月发布的旗舰模型,面向智能体工作,提供 GPT-5.5 Thinking 与 GPT-5.5 Pro 档位。它以与 GPT-5.4 持平的单 token 延迟带来更强智能,Terminal-Bench 2.0 达 82.7%,OSWorld-Verified 达 78.7%,且 token 消耗更低。适用于智能体编程、知识型工作与科研分析,API 定价为每百万输入 token $5、输出 $30,支持 1M 上下文窗口。
2026年4月23日 Qwen Qwen-Image-2.0-Pro-2026-04-22
Qwen-Image-2.0 系列满血版图像模型,融合图片生成与图片编辑,具备 2.0 系列最强的文字渲染能力与真实质感,文字渲染支持 1k token 指令,语义遵循能力更强。本版本为 2026-04-22 固定快照,与 qwen-image-2.0-pro 能力相同,适合需要稳定输出的生产调用。输出总像素 512*512 至 2048*2048,单次最多 6 张。
2026年4月23日