近期一个月国产大模型发布盘点与使用案例(2026-06-27 ~ 2026-07-27)
时间窗口:近一个月(2026-06-27 至 2026-07-27)。本月国产大模型密集发布,被称为"72小时三连发""无限战争"。 划分标准:①旗舰大模型(千亿~万亿参数,走云端 API);②小模型/端侧模型(1B~10B,可本地/终端跑)。
一、旗舰大模型(云端为主,参数迈入"2万亿俱乐部")
| 模型 | 厂商 | 发布时间 | 参数规模 | 核心特点 | 获取方式 |
|---|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 7/17 发布,7/27 正式开源 | 2.8 万亿(MoE,896 专家) | 全球最大开源权重模型;原生视觉理解;100 万 token 上下文;Arena 前端代码盲测全球第一;Artificial Analysis 智能评分全球第三(仅次于 Claude Fable 5 / GPT-5.6 Sol) | 开源权重(7/27 放出) |
| Qwen3.8-Max | 阿里千问 | 7/19 预览版 | 2.4 万亿 | 官方称"可能是除 Fable 5 外最强";即将开源 | 预览版 API + 即将开源 |
| DeepSeek V4(正式版) | 深度求索 | 7/20 开源 | 1.6 万亿(MoE,单 token 激活 490 亿) | MIT 协议;推理计算量仅为 V3.2 的 27%;Pro 版 Codeforces 3206 超 GPT-5.4;Flash 版输出低价 0.28 美元/百万 token;首创"峰谷计费" | 开源(MIT) |
| MiniMax M3 Pro | MiniMax | 计划发布中(M3 已于 6 月初上线) | 2.7 万亿(规划) | 原生多模态 + 100 万上下文;MSA 稀疏注意力;桌面自动化 | M3 API 已上线,M3 Pro 待发 |
| GLM-5.2 | 智谱 | 近期(7 月前) | 未公开(开源旗舰) | 与 Claude Opus 4.8 差距收窄至 1%~4%;开源模型综合最佳之一;昇腾/平头哥/摩尔线程 Day0 适配 | 开源 |
| LongCat-2.0 | 美团 | 7/3 | 1.6 万亿 | 国内首个 5 万卡国产算力集群全流程训练;原生 100 万上下文 | 开源 |
| openPangu-2.0-Flash | 华为 | 7/3 | 920 亿 | 盘古首次开源;华为昇腾芯片训练/推理 | 开源 |
| 星火医疗大模型 V3.5 | 科大讯飞 | 7 月初 | 未公开 | 全国产算力;医疗多模态 + 长上下文突破 | 商用 API |
本月关键信号:参数从"万亿级"跳到"2 万亿级以上"(7 个月翻 4 倍);国产模型与海外顶尖差距缩至 3~5 个月;K3 发布次日智谱跌 28%、MiniMax 跌 16%(新模型直接重估同业估值)。
二、小模型 / 端侧模型(1B~10B,可本地/终端跑)
| 模型 | 厂商 | 发布时间 | 参数 | 核心特点 | 用途 |
|---|---|---|---|---|---|
| MiniCPM5-1B | 面壁智能(清华系) | 6/12(智源大会) | 1B | AA 智能指数 17.9 分,超多款更大开源基座;7 月确认将搭载三星旗舰手机 | 端侧文本基座 |
| BitCPM-CANN | 面壁智能 | 6/12 | 三值量化(1.58bit) | 国内首个全链路国产算力(昇腾)训练并开源的三值大模型;推理省约 6 倍显存,能力保留 90%~97.2% | 低算力/低功耗端侧 |
| Mano-CUA-2.0 | 明略科技(2718.HK) | 6/26 | 4B(GUI VLA) | AIPC 端侧"看屏操作"模型;纯视觉操控桌面/网页;Thinking 模式成功率 +9%~13%;数据不出域 | 办公自动化、私有化业务流程 |
| Stellaris-VL-0.8B | 极视角 | 6/22 | 0.8B | 端侧视觉语言模型;OVD/REC/VQA;嵌入式/边缘硬件可跑 | 工业检测、园区治理 |
| Qwen-VLA | 阿里通义 | 6 月初 | 4B 骨干 + 1.15B DiT | 视觉-语言-动作一体;机器人操作/导航/轨迹预测 | 具身智能、机器人 |
| Holo3.1 系列 | H Company | 6 月初 | 0.8B / 4B / 9B / 35B-A3B | 端侧优化;跨平台智能体控制;35B 版支持 FP8/Q4 GGUF 本地化 | 网页/桌面/移动端 Agent |
| Mellum2 | JetBrains | 6 月初 | 12B(MoE,激活 2.5B) | 低延迟代码模型;Apache 2.0 开源;推理速度快 2 倍+ | 代码提示、上下文压缩、私有化 |
补充(窗口略早但 7 月仍在发酵):面壁 MiniCPM-V 4.6(5/11,1.3B 多模态,6GB 内存手机可跑,7 月确认上三星)累计下载破 3800 万;面壁 MiniCPM-o 4.5(2 月,9B 全双工全模态)定位"具身大脑"。
三、你可以怎么用:场景化案例
A. 云端大模型 API —— 复杂认知任务(用 Kimi K3 / DeepSeek V4 / Qwen3.8)
- 案例 1 · 彩票量化策略复盘:把
lottery-quant的历史开奖 + 购彩记录导出,丢给 K3(100 万上下文)做"哪些选号策略长期正期望、哪些期数规律可建模"的归因分析,产出策略报告。 - 案例 2 · 博客写作辅助:用 DeepSeek V4 / Qwen3.8 帮你起草、润色、做"转载保来源"的合规改写(配合 biggerblog-agent 技能)。
- 案例 3 · 长文档/代码分析:用 K3 读你整个
E:\workbuddy项目代码库,生成架构说明或定位 Bug;其代码能力 Arena 全球第一。
B. 端侧小模型 —— 隐私 / 离线 / GUI 自动化(用 Mano-CUA / MiniCPM-V)
- 案例 4 · 桌面自动化(数据不出域):本地跑 Mano-CUA-2.0,让它"看屏幕"自动操作你电脑上的旧业务系统(如彩票录入后台、Excel 报表),纯视觉无需 API 适配,断网也能用——适合隐私敏感流程。
- 案例 5 · 本地多模态 OCR/图文:手机或 PC 本地跑 MiniCPM-V 4.6(6GB 内存),离线识别票据、文档、儿童画,零 token 账单、零隐私上传。
C. 大小模型协同 —— 降本增效
- 案例 6 · RAG 路由 + 投机采样:用 1B 小模型做意图路由/闲聊分流/数据清洗(几乎零幻觉、零成本),只在复杂任务才调用 K3/V4 大模型;配合投机采样把大模型预测速度拉高 2~3 倍。整体 API 成本可降一个数量级。
D. 结合你现有项目的具体落地
- 有道云 → Obsidian 迁移:用小模型(本地)批量把
→ 页面转[[页面]]双链 + 补 frontmatter(文档里已给脚本思路),敏感笔记全程不出本机。 - 亲子内容:端侧模型做儿童内容过滤/语音互动(面壁 MiniCPM-o 4.5 全双工),离线陪娃不联网也安全。
- 公司任务自动化(carutoo):用 Holo3.1 / Mellum2 做本地 Agent 控制网页后台,减少云端调用。
四、选型速查
- 要最强智能、长上下文、代码/视觉:Kimi K3(开源)、DeepSeek V4(便宜开源)、Qwen3.8(即将开源)
- 要国产算力自主、政务/医疗合规:讯飞星火 V3.5、华为 openPangu、LongCat-2.0
- 要本地跑、隐私、离线、手机/车机:面壁 MiniCPM 系列、明略 Mano-CUA、极视角 Stellaris-VL
- 要机器人/具身:阿里 Qwen-VLA、面壁 MiniCPM-o 4.5
- 要代码私有化:JetBrains Mellum2
五、一个值得你想的问题
这一个月里,参数从万亿跳到 2.8 万亿,但端侧 1B 模型(MiniCPM-V 4.6)的智能密度反而超过了 2024 年的 GPT-4o 级别——"密度定律"说模型能力密度每 3.5 个月翻一番。
顺着你前面看的产业链逻辑想:当 1B 小模型就能干翻旧时代大模型,你手上的消费级 PC / 手机,是不是已经够跑一个"专属私人助理"了? 你最想先拿哪个场景试点——是让本地小模型帮你自动整理有道云笔记,还是用云端 K3 把彩票策略彻底复盘一遍?