跳过主要内容

新 AI 模型

各大实验室发布的每一个重要新 AI 模型,按时间倒序排列,整理自官方公告。按厂商与模型类型筛选,看清谁发布了什么、何时发布。

厂商
类型

共 698 条发布第 2 / 35 页

厂商模型名称发布时间链接
OpenAI

GPT-5.6-Cyber

GPT-5.6-Cyber 是 OpenAI 面向网络安全的专训模型,基于 GPT-5.6 Sol 打造,强化 zero-day 漏洞挖掘、exploit chain 开发等高级任务,并降低对 dual-use 安全请求的拒绝率。在官方 Advanced Cybersecurity Completion Rate 评估中完成率达 95.0%,远高于 GPT-5.6 Sol 的 1.5%。该模型仅通过 Daybreak 计划的 Daybreak Red 层级向获批的可信防御者开放,须通过身份验证与授权用途审查。

2026年8月10日
Qwen

Qwen Audio Realtime3.0

千问实时语音大模型(qwen-audio-3.0-realtime-plus)是阿里云百炼推出的下一代实时双工语音对话模型,在 Artificial Analysis Speech-to-Speech 评测中取得综合排名第一。它兼顾模型智商与双工对话节奏,通过并行推理和全向流式等工程优化将端到端 latency 控制在低水平。标准版更注重高质量的回复结果,适用于语音助手、智能客服、AI 伴侣等场景。

2026年8月10日
Qwen

Qwen Audio Realtime3.0 Fast

千问实时语音对话3.0 极速版(Fast),阿里云百炼的实时双工语音大模型,Artificial Analysis Speech-to-Speech 评测榜首。它兼顾智商与双工节奏,以并行推理、全向流式控制时延,较标准版更看重响应速度,适合 latency 敏感的实时语音交互。

2026年8月10日
Grok

grok-imagine-image-2.0

Grok Imagine Image 2.0 是 xAI 面向实际工作的图像生成模型,已在 grok.com/imagine 上线为 Quality Mode,并提供 iOS、Android 应用与 API。它精确遵循指令,小字号文字与版式清晰稳定,支持 magic wand 局部编辑、background removal 与最多 5 张输入图的 multi-ref editing,smart resize 可按比例自动扩展画面。模板功能将产品图、头像、图标等常见工作流打包为现成起点。

2026年8月8日
Grok

grok-4.6

Grok 4.6 是 xAI 在 Grok 4.5 基础上推出的文本模型,重点强化长时程 agent 任务与更复杂的交互式视觉开发能力。官方称其在 AA Intelligence Index 上得分 61,追平 GPT-5.6 Sol,并在多项 agentic coding 与知识工作 benchmark 上达到 frontier 水平。模型擅长把宽泛的产品想法直接做成可运行的初版应用,适合代码库级开发、跨领域研究与多步复杂任务,API 定价为每百万 input tokens 2 美元、output tokens 6 美元。

2026年8月6日
Qwen

Wan3.0

Wan3.0(万相3.0)是 all-in-one 视频生成模型,统一支持文生视频、图生视频、参考生视频与编辑,支持文本、图像、音频等多模态输入。最长生成 30 秒有声视频,原生输出台词与音效,提供 480P/720P/1080P、30fps 输出,保持生产级角色一致性。

2026年8月6日
ByteDance

SeedRealtime

SeedRealtime 是字节跳动 Seed 团队推出的原生 audio-visual full-duplex LLM,在单一架构内统一音频、视频与文本,可在连续多模态流上实时交互。模型将感知、理解、决策与生成端到端整合,替代多级级联方案;端到端人工评测显示其对话节奏问题较级联方案减少一半,interruptions、latency 与误触发也显著降低。现已全量上线,适用于嘈杂多人对话、设备操作引导与学习讲解等场景。

2026年8月5日
Meta

Muse Spark 1.2

Muse Spark 1.2 是 Meta 以编码为重点的最新 LLM,为 Muse Spark 1.1 的升级版本,重点强化代码生成、复杂调试与代码库理解,并保持通用 agent 等既有强项。该模型与终端编码智能体 Muse Code 协同训练,在整仓生成、大型端到端项目等长周期任务上表现出色,GPU kernel 优化测试中经 1,000+ 次工具调用仍持续优于基线。现可通过 Muse Code 与 Meta Model API 使用。

2026年8月5日
OpenAI

GPT-Daybreak

OpenAI Daybreak 是面向网络安全防御的模型系列,用于在大型代码库中加速漏洞的发现、验证与修复。其中 Daybreak Red 专精授权漏洞研究、渗透测试与红队测试,曾用于发现 V8 中两个可串联逃逸 heap sandbox 的未知漏洞。经验证的防御者可通过 Daybreak Access 获取高级访问权限。

2026年8月5日
Mistral AI

Shieldstral 1.0 (3B)

Shieldstral 1.0 (3B) 是 Mistral AI 以 Apache 2.0 协议开源的多模态安全分类器,将内容 moderation 建模为自然语言问答:以纯文本问题定义安全政策,单次推理输出校准的连续安全分数,更换政策无需重训练。它统一处理文本与图像内容的 prompt 分类、response 审核、refusal detection 与 toxicity 检测,文本安全表现比肩最高约 7 倍于其规模的开放防护模型,单张 16GB GPU 即可部署。

2026年8月4日
Qwen

Qwen-Image-3.0

Qwen-Image-3.0 是阿里通义面向日常创作推出的图像生成模型 Standard 版。它支持最大 4.5k token 输入,复杂图文指令一次生成到位;文字渲染稳定,10px 小字、12 国语言、20+ 字体均清晰可辨。海报、网页、界面等日常任务可批量生成且成本更优,适合作为可持续的内容生产力工具。

2026年8月4日
Qwen

Qwen3.8-Max

Qwen3.8-Max 是阿里通义的 2.4 万亿参数 MoE 旗舰模型,编程与办公能力全面跃升,可自主编程十数天交付完整项目。它原生具备视觉理解,支持超长文档与长视频的深度语义解析,胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。

2026年8月2日
ByteDance

Seedance 2.5

Seedance 2.5 是字节跳动 Seed 团队推出的下一代音视频联合生成模型,单次可生成最长 30 秒的视频,并支持两次续写以延展叙事。它对参考视频的理解更精准,能捕捉意图、构图与镜头语言,并可靠响应音频与视觉层面的编辑指令,同时提供 white-model control、green-screen editing 与专业运镜、走位调度等能力,面向复杂视频制作与专业创意工作流。

2026年7月31日
DeepSeek

DeepSeek-V4-Flash-0731

DeepSeek-V4-Flash-0731 是 2026-07-31 上线的 V4-Flash API 正式公测版(public beta),模型名为 deepseek-v4-flash。该版本 agent 能力显著增强,在 Terminal Bench 2.1(82.7)、DeepSWE、Cybergym 等 benchmark 上远超 V4-Pro-Preview。架构与参数规模与 V4-Flash-Preview 一致,仅重新做了后训练,原生支持 Responses API 并针对 Codex 适配。

2026年7月31日
Hunyuan

HY-ASR-3-NoStream

腾讯混元非流式语音识别(ASR)模型,对应 Hy ASR 3.0 preview 的录音文件识别形态。基于 Hy3 基座,融合高精度识别与深度语义理解,支持中英文与 20 种方言,在上下文感知与多场景鲁棒性上表现突出,适合会议记录、采访整理、字幕生成等录音文件转写场景。

2026年7月31日
Hunyuan

HY-ASR-3-Stream

HY-ASR-3-Stream 是腾讯混元基于 Hy3 基座的流式 ASR 语音识别模型(官方预览版名 Hy-ASR-3.0-preview),支持中文普通话、英语及 20 种方言混合识别,经 WebSocket 实时返回结果,边说边出文字。模型融合深度语义理解能力,通用识别、上下文感知与方言覆盖均全面提升,适合 IM 语音转写、实时字幕、智能助手语音指令解析等低延迟场景。

2026年7月31日
Google

Gemini Robotics ER 2

Google DeepMind 推出的 Gemini Robotics ER 2 是其目前能力最强的 Embodied Reasoning 模型,以 vision language model(VLM)架构充当机器人的高层大脑。它能感知物理环境、规划持续数分钟的多步任务,并与 VLA 模型协同执行动作,支持多机器人协作。按官方说法,它在安全约束遵循与人体接近度基准上是 DeepMind 迄今最安全的机器人模型,现已上线 Google AI Studio。

2026年7月30日
HaiLuo

MiniMax H3

MiniMax H3 是 MiniMax 推出的通用多模态生成模型,统一理解文本、图像、视频与音频上下文,可生成长达 15 秒、原生 2K 分辨率并带原生立体声的视频。它在指令跟随、文字与品牌渲染及 V2V 运动迁移上表现出色,2K 每秒价格不到主流模型的三分之一,模型权重计划近期开放,适合广告、电商与游戏等商业内容创作场景。

2026年7月30日
Qwen

Qwen-Audio-3.0-ASR-Flash

Qwen-Audio-3.0-ASR-Flash 是阿里通义在百炼上线的非实时 ASR 模型,经 HTTP 提交音频文件完成转写,单次最长 5 分钟、最大 2GB。模型支持中、英、日、韩等 30 个语种与汉语七大方言,提供热词及 context 上下文增强,输出附带标点预测与文本归一化,古诗词识别也做了优化。适合呼叫中心录音、播客访谈、有声读物等录音文件转写场景。

2026年7月30日
Qwen

qwen-audio-3.0-asr-flash-filetrans

qwen-audio-3.0-asr-flash-filetrans 是阿里云百炼面向非实时整段音视频文件设计的 ASR 转写模型,支持单个最长 12 小时、不超过 2GB 的音频文件异步转写,按音频时长计费 0.00022 元/秒。模型集成 Context 上下文增强并强化垂直行业热词识别,语种覆盖中、英、日、韩等 30 种。适用于短视频字幕、客服质检和金融双录等场景。

2026年7月30日

如何追踪新 AI 模型

四种读法,每一种都把新 AI 模型的发布时间线变成清晰的答案。按你的问题选一个视角。

01

先看最新发布

榜单把新 AI 模型按发布时间倒序排列,第一行永远是最新发布的那一个,无论来自哪家。每行都链接到官方公告,一次点击直达源头。日期为模型首次公开发布的日期。

02

追踪单一厂商

在厂商筛选里选定一家。OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen 等 20+ 厂商各有专属视图。用它读懂一家厂商的发布节奏:多久发一次、押注哪类模型。

03

对比模型类型

按类型筛选:文本/LLM、多模态、图像生成、视频生成、音频/语音。类型分布能看出行业的发力方向:文本模型数量领先,图像与视频模型则成波次密集发布。逐月观察这个比例的变化。

04

补齐错过的发布

向前翻页回溯时间线。有的月份有几十个模型发布,存档可以回溯到 2017 年。这是一个完整的发布历史,而不只是新 AI 模型的当日动态。几次滚动就能还原任何一家厂商的全年动态。

新 AI 模型常见问题

榜单追踪什么、数据从哪来、怎么读。

榜单按发布时间倒序排列,第一行永远是最近一次发布,无论来自哪家。近几个月的新 AI 模型来自 OpenAI、Anthropic、Google、Qwen、智谱等实验室。每行都链接到官方公告,附确切发布日期。

目前覆盖 29 家厂商:OpenAI、Anthropic、Google、Meta、微软、亚马逊、NVIDIA、Mistral AI、DeepSeek、Qwen、月之暗面、智谱、字节跳动、xAI 等。海外与中国厂商在同一张榜单上,海外发布当天就能看到。

五类:文本/LLM、多模态、图像生成、视频生成、音频/语音。文本模型占发布数量的最大份额,图像与视频模型则成波次密集发布。类型筛选可以单独查看任意一类。

几乎不间断。主要厂商保持着周更节奏,繁忙的一周会发布不止一个新 AI 模型。2024 年以来节奏持续加快,官方公告一出,榜单就会新增对应条目。

每条记录采用首次公开发布的日期,即厂商官宣或向用户开放的当天。内测、传闻和论文预印本都不算。每条都链接到官方公告,日期可以自行验证。

可以。榜单同时是可回溯到 2017 年的存档。向前翻页能看到新 AI 模型发布节奏的爆发:从一年屈指可数到每年数百个。它是可检索的发布历史,而不只是实时信息流。

可以。厂商筛选可以把榜单收窄到一家或任意几家。再叠加类型筛选,可以回答很细的问题,比如某家厂商发布过的全部视频模型。

完全免费。所有发布记录、筛选和官方链接都可免费浏览,无需注册。榜单随新模型官宣而更新,每次发布会之后都值得回来看看。

数据整理自各厂商官方公告,发布时间为模型首次公开发布日期。