OpenAI GPT-5.6-Cyber
GPT-5.6-Cyber 是 OpenAI 面向网络安全的专训模型,基于 GPT-5.6 Sol 打造,强化 zero-day 漏洞挖掘、exploit chain 开发等高级任务,并降低对 dual-use 安全请求的拒绝率。在官方 Advanced Cybersecurity Completion Rate 评估中完成率达 95.0%,远高于 GPT-5.6 Sol 的 1.5%。该模型仅通过 Daybreak 计划的 Daybreak Red 层级向获批的可信防御者开放,须通过身份验证与授权用途审查。
2026年8月10日 Qwen Qwen Audio Realtime3.0
千问实时语音大模型(qwen-audio-3.0-realtime-plus)是阿里云百炼推出的下一代实时双工语音对话模型,在 Artificial Analysis Speech-to-Speech 评测中取得综合排名第一。它兼顾模型智商与双工对话节奏,通过并行推理和全向流式等工程优化将端到端 latency 控制在低水平。标准版更注重高质量的回复结果,适用于语音助手、智能客服、AI 伴侣等场景。
2026年8月10日 Qwen Qwen Audio Realtime3.0 Fast
千问实时语音对话3.0 极速版(Fast),阿里云百炼的实时双工语音大模型,Artificial Analysis Speech-to-Speech 评测榜首。它兼顾智商与双工节奏,以并行推理、全向流式控制时延,较标准版更看重响应速度,适合 latency 敏感的实时语音交互。
2026年8月10日 Grok grok-imagine-image-2.0
Grok Imagine Image 2.0 是 xAI 面向实际工作的图像生成模型,已在 grok.com/imagine 上线为 Quality Mode,并提供 iOS、Android 应用与 API。它精确遵循指令,小字号文字与版式清晰稳定,支持 magic wand 局部编辑、background removal 与最多 5 张输入图的 multi-ref editing,smart resize 可按比例自动扩展画面。模板功能将产品图、头像、图标等常见工作流打包为现成起点。
2026年8月8日 Grok grok-4.6
Grok 4.6 是 xAI 在 Grok 4.5 基础上推出的文本模型,重点强化长时程 agent 任务与更复杂的交互式视觉开发能力。官方称其在 AA Intelligence Index 上得分 61,追平 GPT-5.6 Sol,并在多项 agentic coding 与知识工作 benchmark 上达到 frontier 水平。模型擅长把宽泛的产品想法直接做成可运行的初版应用,适合代码库级开发、跨领域研究与多步复杂任务,API 定价为每百万 input tokens 2 美元、output tokens 6 美元。
2026年8月6日 Qwen Wan3.0
Wan3.0(万相3.0)是 all-in-one 视频生成模型,统一支持文生视频、图生视频、参考生视频与编辑,支持文本、图像、音频等多模态输入。最长生成 30 秒有声视频,原生输出台词与音效,提供 480P/720P/1080P、30fps 输出,保持生产级角色一致性。
2026年8月6日 ByteDance SeedRealtime
SeedRealtime 是字节跳动 Seed 团队推出的原生 audio-visual full-duplex LLM,在单一架构内统一音频、视频与文本,可在连续多模态流上实时交互。模型将感知、理解、决策与生成端到端整合,替代多级级联方案;端到端人工评测显示其对话节奏问题较级联方案减少一半,interruptions、latency 与误触发也显著降低。现已全量上线,适用于嘈杂多人对话、设备操作引导与学习讲解等场景。
2026年8月5日 Meta Muse Spark 1.2
Muse Spark 1.2 是 Meta 以编码为重点的最新 LLM,为 Muse Spark 1.1 的升级版本,重点强化代码生成、复杂调试与代码库理解,并保持通用 agent 等既有强项。该模型与终端编码智能体 Muse Code 协同训练,在整仓生成、大型端到端项目等长周期任务上表现出色,GPU kernel 优化测试中经 1,000+ 次工具调用仍持续优于基线。现可通过 Muse Code 与 Meta Model API 使用。
2026年8月5日 OpenAI GPT-Daybreak
OpenAI Daybreak 是面向网络安全防御的模型系列,用于在大型代码库中加速漏洞的发现、验证与修复。其中 Daybreak Red 专精授权漏洞研究、渗透测试与红队测试,曾用于发现 V8 中两个可串联逃逸 heap sandbox 的未知漏洞。经验证的防御者可通过 Daybreak Access 获取高级访问权限。
2026年8月5日 Mistral AI Shieldstral 1.0 (3B)
Shieldstral 1.0 (3B) 是 Mistral AI 以 Apache 2.0 协议开源的多模态安全分类器,将内容 moderation 建模为自然语言问答:以纯文本问题定义安全政策,单次推理输出校准的连续安全分数,更换政策无需重训练。它统一处理文本与图像内容的 prompt 分类、response 审核、refusal detection 与 toxicity 检测,文本安全表现比肩最高约 7 倍于其规模的开放防护模型,单张 16GB GPU 即可部署。
2026年8月4日 Qwen Qwen-Image-3.0
Qwen-Image-3.0 是阿里通义面向日常创作推出的图像生成模型 Standard 版。它支持最大 4.5k token 输入,复杂图文指令一次生成到位;文字渲染稳定,10px 小字、12 国语言、20+ 字体均清晰可辨。海报、网页、界面等日常任务可批量生成且成本更优,适合作为可持续的内容生产力工具。
2026年8月4日 Qwen Qwen3.8-Max
Qwen3.8-Max 是阿里通义的 2.4 万亿参数 MoE 旗舰模型,编程与办公能力全面跃升,可自主编程十数天交付完整项目。它原生具备视觉理解,支持超长文档与长视频的深度语义解析,胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。
2026年8月2日 ByteDance Seedance 2.5
Seedance 2.5 是字节跳动 Seed 团队推出的下一代音视频联合生成模型,单次可生成最长 30 秒的视频,并支持两次续写以延展叙事。它对参考视频的理解更精准,能捕捉意图、构图与镜头语言,并可靠响应音频与视觉层面的编辑指令,同时提供 white-model control、green-screen editing 与专业运镜、走位调度等能力,面向复杂视频制作与专业创意工作流。
2026年7月31日 DeepSeek DeepSeek-V4-Flash-0731
DeepSeek-V4-Flash-0731 是 2026-07-31 上线的 V4-Flash API 正式公测版(public beta),模型名为 deepseek-v4-flash。该版本 agent 能力显著增强,在 Terminal Bench 2.1(82.7)、DeepSWE、Cybergym 等 benchmark 上远超 V4-Pro-Preview。架构与参数规模与 V4-Flash-Preview 一致,仅重新做了后训练,原生支持 Responses API 并针对 Codex 适配。
2026年7月31日 Hunyuan HY-ASR-3-NoStream
腾讯混元非流式语音识别(ASR)模型,对应 Hy ASR 3.0 preview 的录音文件识别形态。基于 Hy3 基座,融合高精度识别与深度语义理解,支持中英文与 20 种方言,在上下文感知与多场景鲁棒性上表现突出,适合会议记录、采访整理、字幕生成等录音文件转写场景。
2026年7月31日 Hunyuan HY-ASR-3-Stream
HY-ASR-3-Stream 是腾讯混元基于 Hy3 基座的流式 ASR 语音识别模型(官方预览版名 Hy-ASR-3.0-preview),支持中文普通话、英语及 20 种方言混合识别,经 WebSocket 实时返回结果,边说边出文字。模型融合深度语义理解能力,通用识别、上下文感知与方言覆盖均全面提升,适合 IM 语音转写、实时字幕、智能助手语音指令解析等低延迟场景。
2026年7月31日 Google Gemini Robotics ER 2
Google DeepMind 推出的 Gemini Robotics ER 2 是其目前能力最强的 Embodied Reasoning 模型,以 vision language model(VLM)架构充当机器人的高层大脑。它能感知物理环境、规划持续数分钟的多步任务,并与 VLA 模型协同执行动作,支持多机器人协作。按官方说法,它在安全约束遵循与人体接近度基准上是 DeepMind 迄今最安全的机器人模型,现已上线 Google AI Studio。
2026年7月30日 HaiLuo MiniMax H3
MiniMax H3 是 MiniMax 推出的通用多模态生成模型,统一理解文本、图像、视频与音频上下文,可生成长达 15 秒、原生 2K 分辨率并带原生立体声的视频。它在指令跟随、文字与品牌渲染及 V2V 运动迁移上表现出色,2K 每秒价格不到主流模型的三分之一,模型权重计划近期开放,适合广告、电商与游戏等商业内容创作场景。
2026年7月30日 Qwen Qwen-Audio-3.0-ASR-Flash
Qwen-Audio-3.0-ASR-Flash 是阿里通义在百炼上线的非实时 ASR 模型,经 HTTP 提交音频文件完成转写,单次最长 5 分钟、最大 2GB。模型支持中、英、日、韩等 30 个语种与汉语七大方言,提供热词及 context 上下文增强,输出附带标点预测与文本归一化,古诗词识别也做了优化。适合呼叫中心录音、播客访谈、有声读物等录音文件转写场景。
2026年7月30日 Qwen qwen-audio-3.0-asr-flash-filetrans
qwen-audio-3.0-asr-flash-filetrans 是阿里云百炼面向非实时整段音视频文件设计的 ASR 转写模型,支持单个最长 12 小时、不超过 2GB 的音频文件异步转写,按音频时长计费 0.00022 元/秒。模型集成 Context 上下文增强并强化垂直行业热词识别,语种覆盖中、英、日、韩等 30 种。适用于短视频字幕、客服质检和金融双录等场景。
2026年7月30日