跳过主要内容

新 AI 模型

各大实验室发布的每一个重要新 AI 模型,按时间倒序排列,整理自官方公告。按厂商与模型类型筛选,看清谁发布了什么、何时发布。

厂商
类型

共 698 条发布第 4 / 35 页

厂商模型名称发布时间链接
Hunyuan

hy3

Hy3 是腾讯混元推出的推理与智能体模型,采用 MoE 架构,总参数 295B、激活参数 21B,context window 为 256K。官方称其效果比肩参数规模 2~5 倍的旗舰模型,在软件开发、办公生产、金融建模等生产力任务上表现出色。模型已基于 Apache 2.0 协议开源,并通过腾讯云 API 提供服务。

2026年7月3日
Qwen

Wan2.7-Reference-To-Video-2026-06-12

Wan2.7-Reference-To-Video 是阿里通义万相 2.7 系列的参考生视频(R2V)模型,提供更稳定的角色、道具与场景参考,支持最多 5 个图/视频混合参考与音频音色参考,输出 720P/1080P、时长 2 至 15 秒的视频,适用于单角色表演与多角色互动场景。该版本为 2026 年 6 月 12 日快照,版本固定,适合对稳定性要求高的生产调用。

2026年7月1日
Qwen

Wan2.7-Text-To-Video-2026-06-12

通义万相 2.7 文生视频(wan2.7-t2v)的 2026-06-12 快照版本,基于文本提示词生成流畅视频,适合重视输出稳定的生产场景。演绎能力全面升级,文戏情感细腻,动作戏拳拳到肉,镜头切换更具戏剧性与节奏感。支持 720P/1080P 与 2 至 15 秒时长,可传入音频,或由模型自动生成配乐与音效。

2026年7月1日
Anthropic

Claude Sonnet 5

Claude Sonnet 5 是 Anthropic 于 2026 年 6 月 30 日发布的均衡档模型,官方称其为迄今 agentic 能力最强的 Sonnet,兼顾编码与日常专业工作。它在推理、工具调用、编码与知识工作上较 Sonnet 4.6 全面提升,在 BrowseComp、OSWorld-Verified 等 agentic 评测中接近 Opus 4.8 水平而价格更低,适合多步软件工程、自主计算机操作与业务自动化等场景。

2026年6月30日
Google

Gemini Omni Flash

Gemini Omni Flash 是 Google 推出的高性能多模态视频生成与编辑模型,Flash 为速度优先档位,2026 年 6 月 30 日以 gemini-omni-flash-preview 开启公开预览。它同时理解 text、image、audio、video 输入,可经 Interactions API 把文本或静态图片转成 3 至 10 秒带音频的视频,并以自然语言对话迭代编辑,支持视频延展、分辨率上采样与首尾帧插值。

2026年6月30日
Google

Nano Banana 2 Lite

Nano Banana 2 Lite(模型代码 gemini-3.1-flash-lite-image)是 Google 图片生成系列的轻量档,端到端延迟低于 2 秒、计算成本大幅降低,面向大批量交互式开发场景与实时消费级应用。它原生支持文本与图片交织生成,针对 1K(1024x1024px)分辨率优化,可快速完成换色、贴纸制作、背景调整等多轮局部编辑,输出默认带 SynthID 水印。

2026年6月30日
Grok

grok-4.5

Grok 4.5 是 xAI 迄今最智能的模型,主打 coding、agentic tasks 与知识型工作。它以 80 TPS 速度提供服务,token 效率约为同级旗舰的两倍,API 定价为每百万输入 $2、输出 $6。现已上线 Grok Build、Cursor 与 xAI API,并同样擅长 Excel、Word 等 Office 工作。

2026年6月29日
Kling

Kling 3.0

Kling 3.0 是快手可灵的视频生成标准版模型,基于统一的多模态训练框架,将文生视频、图生视频、参考生成等任务整合进单一模型。单次生成最长 15 秒(3 至 15 秒灵活可选),新增 Multi-Shot 多镜头叙事与 Element 一致性控制,Native Audio 支持中英日韩西五语及方言口音,提示词遵循与画面真实感同步增强。典型场景包括多镜头影视叙事、多角色对白与电商广告。

2026年6月29日
Kling

Kling 3.0 Omni

Kling 3.0 Omni 是快手可灵 Kling 3.0 系列的全能视频生成模型,由 VIDEO O1 升级而来,基于统一多模态训练框架实现原生音画一体输出。它支持 Native Audio 与 Multi-Shot 叙事,单次可生成 3 至 15 秒视频,并对每个镜头的时长、景别与运镜做逐镜控制;Element 能力支持视频与声音参考,在长片中保持角色形象和声音一致,适合广告、短剧等叙事创作。

2026年6月29日
Kling

Kling Image O1

Kling Image O1 是可灵推出的 reasoning 图像生成模型,依托知识库与多模态推理能力精准理解综合创作意图。它支持从最多 10 张参考图提取主体、元素与色调并保持跨图一致,也能用文字指令完成细节修改与风格迁移,保留原图光影质感。官方评测中,其指令编辑与多图参考任务综合胜率领先 Nano Banana 等同类模型,适合 IP 角色设计与品牌视觉创作。

2026年6月29日
OpenAI

GPT-5.6 Sol

GPT-5.6 Sol 是 OpenAI 的旗舰模型,与均衡档 Terra、快速经济档 Luna 组成新系列,2026 年 6 月 26 日启动有限预览。它支持 max 推理强度和调用子智能体的 ultra 模式,在 Terminal-Bench 2.1 上刷新 SOTA,并在 GeneBench v1 以更少 Token 超越 GPT-5.5。预览期经 API 和 Codex 向部分伙伴开放,每百万 Token 输入 5 美元、输出 30 美元。

2026年6月26日
Qwen

Qwen-Image-2.0-Pro-2026-06-22

Qwen-Image-2.0-Pro-2026-06-22 是 Qwen-Image-2.0 系列满血版模型的最新快照版本,2026 年 6 月 25 日上线阿里云百炼,融合图片生成与图片编辑能力。相较 4 月快照,文字渲染进一步增强,支持最长 1k token 指令输入,写实场景的质感与细节刻画更细腻,语义遵循更强。固定版本号便于生产环境锁定复现。

2026年6月25日
ByteDance

Seed2.1

Seed2.1 是字节跳动 Seed 团队发布的 agentic 生产力模型,提供 Pro 与 Turbo 两个尺寸。它在 general agent 与代码工程方向均有明显提升,可端到端完成需求理解、编码、调试与验证,并强化视觉理解、空间推理与长上下文处理,在多个视频理解 benchmark 上达到 SOTA,适用于办公自动化与真实开发流程。

2026年6月23日
OpenAI

GPT-5.5 Instant

GPT-5.5 Instant 是 OpenAI 更新的 ChatGPT 默认模型,逐步向所有用户推出,并在 API 中以 chat-latest 提供。相比 GPT-5.3 Instant,它在医学、法律、金融等高风险提示上的幻觉性陈述减少 52.5%,视觉推理、数学与科学评测成绩同步提升。回答更简洁自然,图像上传分析与 STEM 问答能力改进,还能更好利用过往聊天、文件和 Gmail 上下文实现个性化。

2026年6月18日
Qwen

Fun-ASR-Flash-2026-06-15

Fun-ASR-Flash-2026-06-15 是阿里云百炼上架的百聆(Bailing)系列大模型 ASR 快照版本,对应 2026 年 6 月更新,适合需要稳定输出的生产调用。模型覆盖 30 个语种与汉语七大方言体系,可转写 5 分钟以内音频,标点预测与文本归一化经过优化,数字、日期、金额自动转为标准格式,并对中文古诗词识别做了专项优化。按音频时长计费,0.00022 元/秒起。

2026年6月17日
Zhipu AI

GLM-5.2

GLM-5.2 是智谱面向长程任务的旗舰开源模型(MIT 许可),提供稳定的 1M token context window。编码能力较 GLM-5.1 明显提升,Terminal-Bench 2.1 得 81.0、SWE-bench Pro 得 62.1,为最强开源模型,FrontierSWE 上仅次于 Claude Opus 4.8。支持多档 thinking effort,适合编码 agent 等长程工程任务。

2026年6月17日
Qwen

HappyHorse-1.1-I2V

HappyHorse-1.1-I2V 是阿里云百炼的图生视频(I2V)模型,可将单张首帧图像转化为 3 至 15 秒的有声视频,支持 480P、720P、1080P 与 24fps 输出。模型能更精准地理解输入图像并延续创作意图,在人物皮肤质感、ID 跨片段保持、动作流畅度及音画同步上均有改善,输出细节丰富、一致性高的视频。

2026年6月16日
Qwen

HappyHorse-1.1-R2V

HappyHorse-1.1-R2V 是阿里云百炼推出的参考图生视频(R2V)模型,最多支持 9 张参考图像配合文本提示词生成视频。相较上一代,模型进一步提升了主体、场景风格与画面一致性的稳定保持,在人物、场景、风格和镜头表现上带来更强的可控性与表现力。生成视频时长为 3 至 15 秒,分辨率支持 480P、720P 与 1080P。

2026年6月16日
Qwen

HappyHorse-1.1-T2V

HappyHorse-1.1-T2V 是阿里云百炼的文生视频模型,输入文本提示词生成视频。其文本语义理解、镜头调度与动态生成表现进一步提升,在人物动作、场景氛围与物理运动上画面更流畅自然、一致性更高。支持 480P/720P/1080P 分辨率与 3 至 15 秒时长,适用于短剧制作、电商广告、品牌营销与游戏 CG 等内容生产场景。

2026年6月16日
Moonshot AI

Kimi K2.7 Code

Kimi K2.7 Code 是 Moonshot AI(月之暗面)基于 Kimi K2.6 推出的编码 agentic 模型,采用 MoE 架构,总参数 1T、激活参数 32B,context window 256K。模型针对真实 long-horizon 编码任务强化端到端完成能力,thinking token 消耗较 K2.6 降低约 30%,并在 Kimi Code Bench v2 等 benchmark 上较前代明显提升。模型权重以 Modified MIT License 开源,可通过 OpenAI/Anthropic 兼容 API 调用或使用 vLLM、SGLang 部署。

2026年6月12日

如何追踪新 AI 模型

四种读法,每一种都把新 AI 模型的发布时间线变成清晰的答案。按你的问题选一个视角。

01

先看最新发布

榜单把新 AI 模型按发布时间倒序排列,第一行永远是最新发布的那一个,无论来自哪家。每行都链接到官方公告,一次点击直达源头。日期为模型首次公开发布的日期。

02

追踪单一厂商

在厂商筛选里选定一家。OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen 等 20+ 厂商各有专属视图。用它读懂一家厂商的发布节奏:多久发一次、押注哪类模型。

03

对比模型类型

按类型筛选:文本/LLM、多模态、图像生成、视频生成、音频/语音。类型分布能看出行业的发力方向:文本模型数量领先,图像与视频模型则成波次密集发布。逐月观察这个比例的变化。

04

补齐错过的发布

向前翻页回溯时间线。有的月份有几十个模型发布,存档可以回溯到 2017 年。这是一个完整的发布历史,而不只是新 AI 模型的当日动态。几次滚动就能还原任何一家厂商的全年动态。

新 AI 模型常见问题

榜单追踪什么、数据从哪来、怎么读。

榜单按发布时间倒序排列,第一行永远是最近一次发布,无论来自哪家。近几个月的新 AI 模型来自 OpenAI、Anthropic、Google、Qwen、智谱等实验室。每行都链接到官方公告,附确切发布日期。

目前覆盖 29 家厂商:OpenAI、Anthropic、Google、Meta、微软、亚马逊、NVIDIA、Mistral AI、DeepSeek、Qwen、月之暗面、智谱、字节跳动、xAI 等。海外与中国厂商在同一张榜单上,海外发布当天就能看到。

五类:文本/LLM、多模态、图像生成、视频生成、音频/语音。文本模型占发布数量的最大份额,图像与视频模型则成波次密集发布。类型筛选可以单独查看任意一类。

几乎不间断。主要厂商保持着周更节奏,繁忙的一周会发布不止一个新 AI 模型。2024 年以来节奏持续加快,官方公告一出,榜单就会新增对应条目。

每条记录采用首次公开发布的日期,即厂商官宣或向用户开放的当天。内测、传闻和论文预印本都不算。每条都链接到官方公告,日期可以自行验证。

可以。榜单同时是可回溯到 2017 年的存档。向前翻页能看到新 AI 模型发布节奏的爆发:从一年屈指可数到每年数百个。它是可检索的发布历史,而不只是实时信息流。

可以。厂商筛选可以把榜单收窄到一家或任意几家。再叠加类型筛选,可以回答很细的问题,比如某家厂商发布过的全部视频模型。

完全免费。所有发布记录、筛选和官方链接都可免费浏览,无需注册。榜单随新模型官宣而更新,每次发布会之后都值得回来看看。

数据整理自各厂商官方公告,发布时间为模型首次公开发布日期。