核心速览
2026 年开源模型已经能打:图像侧 NVIDIA 与 HiDream 登顶 Arena,中文渲染百花齐放;视频侧 Wan2.7 全家桶最全能,MAGI-2 首次把开源拉到千亿 MoE。本报告只收录已开源(权重可下载)的模型;Qwen-Image 3.0 / Wan3.0 未开源,不列入。
1.6T
文本开源旗舰 · DeepSeek V4(MIT)
AA 前三
文本开源SOTA · GLM-5.3
12B
独立实验室第1 · Krea 2(2026-06)
Elo 1219
图像开源第1 · NVIDIA Cosmos3
0.90
GenEval 开源第1 · HiDream-O1
0.97
英文OCR · Ideogram 4
114B
全球首个千亿开源视频 · MAGI-2
15s/2K
原生音画 · MiniMax H3
13GB
最轻可商用实时 · FLUX.2 klein 4B
文本大模型 · 2026 开源一览表
聚焦 2026 年发布、权重可下载的文本模型(各厂家旗舰/主打)。点击表头可排序。
| 模型 | 厂商 | 开源时间 | 参数(总/激活) | 上下文 | 许可 | 亮点 | 开源地址 |
|---|---|---|---|---|---|---|---|
| DeepSeek V4-Flash-Vision-Exp DeepSeek | DeepSeek | 2026-08-31 | 305B/13B | 1M | MIT | 视觉Agent超Opus | HF / GitHub |
| Hy4 Preview 腾讯 | 腾讯 | 2026-08-28 | 770B/49B | 1M | 社区许可 | Agent/编程 | GitHub / HF |
| GLM-5.3(含 5.3-Flash) 智谱 | 智谱 | 2026-08-26 | 744B/40B · 320B/18B | 1M | MIT | AA 前三 | HF / GitHub |
| Qwen3.8-Flash-Next 阿里 | 阿里 | 2026-08-26 | 125B/6B | 256K→1M | 开放权重 | HF 热榜第1 | HF / MS |
| Qwen3.8(2.4T-A95B · 27B) 阿里 | 阿里 | 2026-08-12 | 2.4T/95B · 27B | 262K | Apache 2.0* | Max级+视觉 | HF / GitHub |
| Ling-3.0-tiny 蚂蚁百灵 | 蚂蚁 | 2026-08-11 | 7.9B/1.3B | — | MIT | 端侧Agent | HF |
| Muse Glimmer Meta | Meta | 2026-08-10 | 30B dense | 128K | Apache 2.0 | 本地Agent | HF |
| Ling-3.0-flash 蚂蚁百灵 | 蚂蚁 | 2026-08-08 | 124B/5.1B | — | MIT | AA 38 智效比13.2 | HF / MS |
| Kimi K3 月之暗面 | 月之暗面 | 2026-07-27 | 2.8T/1040B | 1M | 开放权重 | 全球最大开源 | HF / GitHub |
| LongCat-2.0 美团 | 美团 | 2026-07-06 | 1.6T/48B | 1M | MIT | SWE超GPT-5.5 | HF / GitHub |
| MiniMax M3 MiniMax | MiniMax | 2026-06-12 | 428B/23B | 1M | 开放权重* | 原生多模态 | HF / MS |
| DeepSeek V4 Pro / Flash DeepSeek | DeepSeek | 2026-04-24 | 1.6T/49B · 284B/13B | 1M | MIT | LiveCodeBench 93.5 | HF / GitHub |
| Kimi K2.6 月之暗面 | 月之暗面 | 2026-04-20 | 1T/32B | 256K | Apache 2.0* | 300 子Agent | GitHub / HF |
| MiniMax-M2(含 M2.7) MiniMax | MiniMax | 2026-04(M2.7) | 230B/10B | 192K | Apache 2.0* | 8%价2倍速 | GitHub / HF |
| Gemma 4(31B/26B/12B/E4B/E2B) Google | 2026-04-02 | 31B · 26B/3.8B · 12B · 4B · 2.3B | 2M | Apache 2.0 | Arena 1452 | HF / 官网 |
文本大模型 · 逐模型详情
统一字段模板:开源时间 → 地址 → 架构 → 能力 → 评测 → 部署 → 许可 → 社区评价 → 优化生态
1. DeepSeek V4-Flash-Vision-ExpDeepSeek
视觉Agent超OpusMIT多模态
开源时间
2026-08-31(API 08-21 上线,10 天后开源权重;V4 家族首个多模态模型)
开源地址
HF
deepseek-ai/DeepSeek-V4-Flash-Vision-Exp | GitHub deepseek-ai | ModelScope架构细节
305B 总 / 13B 激活 MoE(V4-Flash 284B 基座 + ~466M 视觉模块);基座 43 层、256 路由专家+1 共享、每 token 激活 6、hidden 4096、fp8 权重+fp4 专家;视觉塔 32 层、1024 hidden、16 头、patch 14、downsample 3、每图最多 384 vision tokens + Aligner;DFlash Attention + Hyper-Connections + DSpark能力规格
原生图片输入(JPEG/PNG/GIF/WebP);图像描述/OCR/图表分析;完整保留 V4-Flash 文本推理/Agent/世界知识;1M 上下文(YaRN 16×),最大输出 384K评测/排行
ZeroBench 视觉推理 35.0(超 Opus-4.8 34.0);DeepSWE 59.3%(超 Opus-4.8,V4-Flash 54.4%);Agents' Last Exam 27.3;ApexBench 36.5(+10 vs Flash-0731);Chartography 64.3;Toolathlon-Verified 75.9;Cybergym 75.3(-1.4 轻微回归)部署
权重约 168GB(fp8+fp4),多 GPU 必需;官方 convert.py 张量并行(示例 MP=4);DeepSeek Harness 0.1.1 原生支持;SGLang 跟进适配;DGX Spark 版本即将推出;API 与 V4-Flash 同价($0.44/$1.32 peak,cache hit $0.014)⚠️ "Exp" 实验版,官方建议谨慎用于生产;所有 benchmark 为厂商自报(DeepSeek Harness),无独立验证、无技术报告;FIM 补全不支持;Cybergym 较文本版轻微回归。
社区评价
DeepSeek 从纯文本向多模态 Agent 体系转型的标志;"连眼睛也一起交出来了";MIT 协议+完整推理代码,多模态 Agent 研发门槛大降优化生态
官方最小化 PyTorch 推理实现(视觉编码器+Aligner+DFlash+MoE+Hyper-Connections+DSpark);Prompt Encoding 参考实现+等价测试;权重转换脚本;DeepSeek Harness 0.1.1;SGLang 适配中;DGX Spark 版将出2. 腾讯 Hy4 Preview腾讯混元
社区许可Agent/编程
开源时间
2026-08-28(Hy3 295B/21B 为上一代,2026 早前开源)
开源地址
GitHub
Tencent-Hunyuan | HF tencent | 混元官网 hy.tencent.com架构细节
770B 总 / 49B 激活 MoE;1M 上下文;定位"为生产力而生"能力规格
Agent 与编程为主打;163 名专家、203 个工程任务内部盲测领先;超大上下文长文档/长程任务部署
大显存多卡集群;腾讯云托管;社区整合包社区评价
腾讯开源回归第一梯队;与 DeepSeek V4、Qwen3.8 同台竞争国产开源旗舰⚠️ 许可以官方仓库为准(混元系历史用腾讯社区许可,大规模商用需读协议)。
优化生态
社区整合包 / 多卡部署教程;腾讯云托管一键部署;MoE 调度优化(论文级方案);与 DeepSeek V4、Qwen3.8 并列的国产旗舰适配生态
3. GLM-5.3(含 5.3-Flash)智谱 AI
AA 前三MITFlash=牛来
开源时间
GLM-5.3 主模型:2026-08-14 发布,权重 2026-08-28 开源;GLM-5.3-Flash:2026-08-26 直接开源
开源地址
HF
zai-org(GLM-5.3 / GLM-5.3-Flash)| GitHub zai-org | ModelScope架构细节
- GLM-5.3(主):744B 总 / 40B 激活 MoE,与 5.2 同基座,纯后训练 Scaling;1M 上下文、最大输出 128K;目前纯文本
- GLM-5.3-Flash:320B 总 / 18B 激活 MoE,首个原生多模态 GLM-5(文本+图像→文本);混合注意力 MLA + DSA 稀疏注意力 + KDA 线性注意力;45 层语言模型 + 24 层视觉编码器;FP8 权重约 328GB;1M 上下文
评测/排行
- GLM-5.3 主:开源/即将开源模型中多项基准第一,编程能力较 5.2 +50%,社区称超越 Claude Opus 4.8
- GLM-5.3-Flash:性能追平 Claude Opus 4.8,API 价格仅约其 1/40(输入 0.8 元 / 输出 2.8 元每百万 token,上线两周半价)
身份
5.3-Flash 即刷屏匿名模型 "Ox-Alpha"(中文社区"牛来")——2026-08-20~26 匿名内测 6 天处理 23T+ tokens 才认领部署
主模型 744B 需多卡集群;Flash FP8 328GB,官方称可在国产芯片(昇腾)上跑;BF16/FP8 双档社区评价
编程/工程场景开源 SOTA;Flash 以 1/40 价格打 Opus 4.8,"极致性价比"刷屏;混合注意力方案引发关注优化生态
Unsloth GGUF 动态量化(1bit 93GB / UD-Q2 109GB 保 78% / Q8 近无损;BF16 642GB);vLLM 原生支持(MoE 路由 / 张量并行 / 专家并行 / flashinfer);MTP 投机解码(--speculative-config 5 token);llama.cpp / Ollama;七牛 / 腾讯云部署教程;FP8 量化;国产算力(昇腾)适配;CodeArena 生态4. Qwen3.8-Flash-Next(Qwen4 预览)阿里
HF 热榜第1开放权重Qwen4架构
开源时间
2026-08-26(Qwen4 架构首个开源权重预览)
开源地址
HF
Qwen/Qwen3.8-Flash-Next | ModelScope | 官方模型卡架构细节
125B 总 / 6B 激活 MoE;另含 51B N-gram 嵌入表 + 4B MTP 层;512 专家(每 token 激活 10 routed + 1 shared);Gated DeltaNet + Qwen Sparse Attention(QSA,micro-block 级稀疏);48 层混合注意力(3 块 Gated DeltaNet + 1 块 QSA 循环);多 token 预测能力规格
- 256K(262,144)原生上下文,可扩展至 1M(YaRN)
- 文本 + 图像输入(多模态 MoE)
- 面向复杂推理 / Agent 任务
评测/排行
HF Trending 第 1(❤3.8k);社区称"6B 激活打 27B"部署
本地推理需 Ada/Blackwell 架构 GPU(RTX 40 系及以上);社区以 FP8 量化为主;vLLM 适配中⚠️ 定位:架构实验预览版,供社区提前适配 Qwen4;生产部署应等基于此架构的 Qwen3.8-Flash 正式版。
社区评价
"Qwen4 架构先行者";提前适配新推理栈的窗口期优化生态
QSA 稀疏注意力降长上下文延迟;MTP 支持投机解码;社区量化/部署教程5. Qwen3.8(2.4T-A95B · 27B)阿里
Apache 2.0*Max级开源
开源时间
Qwen3.8-2.4T-A95B(2026-08-12,首个 Qwen-Max 级开源)| Qwen3.8-27B(2026-08-14,原生视觉语言)
开源地址
HF
Qwen | GitHub QwenLM | ModelScope架构细节
- Qwen3.8-2.4T-A95B:2.4T 总 / 95B 激活 MoE,旗舰级(对标 Qwen-Max)
- Qwen3.8-27B:27B dense,原生视觉语言模型(文本+图像+视频理解)
能力规格
262K 上下文;27B 支持多模态理解;2.4T 旗舰面向 Agent/长上下文/中文最强评测/排行
Qwen3.8-2.4T 为开源梯队第一档;27B 代码/Agent 均衡、消费级可跑(Q4 约 17GB)⚠️ 许可注意:Qwen3.8-27B 为 Apache 2.0;Qwen3.8-2.4T-A95B 为自定义 revenue-gated 许可(非 Apache,高营收商用需注意门槛)。
社区评价
"首个 Max 级权重开源"引发关注;阿里"中低端开源、顶端开放权重(有条件)"路线优化生态
unsloth GGUF / UD 动态量化(27B Q4 约 17GB);社区蒸馏生态(Qwen3.8-9B、Qwen3.8-Distilled-4B-NPU2 等);llama.cpp / Ollama / LM Studio / vLLM / TGI / TensorRT-LLM 全系支持;AWQ 4bit;vLLM 官方推理命令(TP4 / qwen3 reasoning parser / auto tool);Prompt 缓存 + 批处理 + 流式优化栈;LoRA 微调生态成熟6. Ling-3.0-tiny蚂蚁百灵
端侧AgentMIT轻量MoE
开源时间
2026-08-11
开源地址
HF 蚂蚁百灵组织(Ling-3.0-tiny)| 官方三档权重
架构细节
7.9B 总 / 1.3B 激活(轻量级混合推理 MoE,Kimi 系技术路径)能力规格
面向高效本地 Agent / 低成本部署;推理计算量极低(每 token 仅激活 1.3B)评测/排行
社区称"1.3B 激活硬刚 26–31B";紧咬同规格更大模型(第三方实测口径)部署
官方提供 BF16 / FP8 / INT4 三版本;已验证 Mac mini、M4 Pro MacBook、DGX Spark 可跑许可
MIT社区评价
端侧轻量 Agent 新选择;生态较新,LoRA/量化生态成熟度待观察优化生态
官方三档权重适配多平台;社区部署教程7. Meta Muse GlimmerMeta Superintelligence Labs
本地AgentApache 2.0单卡
开源时间
2026-08-10
开源地址
HF
meta-models/Muse-Glimmer-30B(含 GGUF 转换)| llama.cpp / ExecuTorch / MLX 生态架构细节
~29.6–30B dense(含 1.8B 视觉编码器);混合注意力(sliding-window 注意力块与全注意力交错);causal LM + 专用 perception encoder(图像/视频输入)能力规格
- 本地 Agent:规划 / 调用工具 / 从错误中自我恢复
- 131,072(128K)上下文;多模态(图/视频理解)
评测/排行
AA Intelligence Index 35(比 Llama 4 Maverick 高 21 分、比同尺寸 Gemma 4 高 5 分)部署
24GB 消费级 GPU(4-bit <20GB)或 M4/M5 Max Mac;DFlash 投机解码 RTX 5090 ~233 tok/s;Ollama / LM Studio / vLLM / Together / Fireworks day-0许可
Apache 2.0,无 Llama 式 MAU 上限——商业嵌入零门槛;Muse Spark(旗舰)仍闭源 API,Glimmer 是权重可拥有版社区评价
Meta 以 Apache 2.0 重返开源;端侧 Agent"小钢炮";Muse Spark 1.2 权重将跟进优化生态
GGUF k-quants + ExecuTorch + 4-bit;llama.cpp / Apple MLX / vLLM;TorchTitan 微调8. Ling-3.0-flash蚂蚁百灵
AA 38MIT智效比13.2
开源时间
2026-08-08(7-24 发布 API,8-5 ModelScope 上架,8-8 正式开源权重)
开源地址
HF 蚂蚁百灵组织(Ling-3.0-flash)| ModelScope | developer.ant-ling.com
架构细节
124B 总 / 5.1B 激活 MoE(专家激活比例 1/64,上代 1/32);原生混合推理模型;FP8/FP4/INT4 多精度版本能力规格
推理/Agent 任务;以 1/12 算力对标上代 1T 旗舰 Ring-2.6-1T;低成本部署评测/排行
AA 智能指数 38(较上代 Ling 2.6 Flash +24 分);追平 MiMo-V2.5 和 Qwen3.6 27B;智效比 13.2;全方位对标甚至超越上代 1T 旗舰 Ring-2.6-1T部署
官方提供 BF16/FP8/FP4/INT4 多版本;量化版本可单台机器跑;API 调用 + 自部署 + 微调三种落地选择许可
MIT社区评价
"1/12 算力跑出旗舰性能";小身板大能量;从限时免费 API 到全面开源自部署优化生态
官方多精度权重;ModelScope/HF 双平台;社区量化部署教程;蚂蚁百灵开发者生态9. Kimi K3月之暗面 Moonshot
全球最大开源开放权重3T级
开源时间
2026-07-27(发布 07-16/17,按承诺 11 天后全量开源)
开源地址
HF
moonshotai/Kimi-K3 | GitHub MoonshotAI | kimi.com架构细节
2.8T 总 / 1040B(104 亿)激活 MoE;896 路由专家、每 token 激活 16;KDA(Kimi Delta Attention 线性注意力)+ Gated MLA 混合(约 3:1) + Attention Residuals(AttnRes)+ Stable LatentMoE;93 层、hidden 7168、max 位置 1M能力规格
原生图文视频理解;1M 上下文;Agentic / 长程任务评测/排行
GPQA Diamond 93.5%(接近 GPT-5.6 Sol);FrontierSWE 81.2%(高于 GPT-5.6 Sol 的 71.3%);SpreadsheetBench 2 领先;编程评测登顶部署
MXFP4 量化感知训练权重(仅权重约 1.4TB);官方建议 64 卡以上超节点;本地部署约 200 万元起(8×H200 集群约 2800-3000 万元)许可
开放权重(License 以官方仓库为准)社区评价
全球首个 3T 级开源模型;开源半小时登顶 HF 刷新平台纪录;"中国的 Fable 5 时刻";阿里、华为等厂商首日适配优化生态
权重 + 47 页技术报告 + MoonEP / FlashKDA / AgentEnv 三大训练 Infra 同步开源;MXFP4 量化感知训练;KDA 线性注意力降长上下文推理开销10. 美团 LongCat-2.0美团
SWE超GPT-5.5MIT国产卡推理
开源时间
2026-06-30 发布,2026-07-06 完全开源(MIT);曾化名 Owl Alpha 在 OpenRouter 跑了两个月
开源地址
HF
meituan | GitHub meituan | 美团技术团队 tech.meituan.com架构细节
1.6T 总 / 48B 激活 MoE(动态激活 3B-56B);LongCat 稀疏注意力 + N-gram Embedding;原生 1M 上下文;Agentic Coding 定位能力规格
真实 Agentic Coding 任务;代码理解/生成/执行;1M 长上下文;国内首个完全开源的超大规模 MoE评测/排行
SWE-bench Pro 超越 GPT-5.5(国内大厂首个);化名 Owl Alpha 期间在 OpenRouter 表现亮眼;编程/Agent 场景为核心卖点部署
业界首个在五万卡国产算力集群上完成推理的万亿参数模型;同步开放国产卡推理代码;针对显存与带宽受限的国产芯片深度协同优化;MIT 无使用限制⚠️ 发布后存在"智能体能力翻车"争议(部分实测未达宣传水平),benchmark 与真实场景表现有差距,建议以官方技术报告+独立实测交叉验证。
社区评价
"国产算力炼出的万亿参数 Agentic 大模型";MIT 完全开源+国产卡推理是最大亮点;SWE-bench Pro 超 GPT-5.5 引发关注,但也有实测争议优化生态
国产卡推理代码同步开源;LongCat 稀疏注意力降长上下文开销;N-gram Embedding 提升 Token 级表示;美团技术团队工程优化;模芯协同11. MiniMax M3MiniMax
原生多模态开放权重*1M上下文
开源时间
2026-06-01 发布 → 2026-06-12 开源权重(HF + ModelScope)
开源地址
HF
MiniMaxAI/MiniMax-M3 | ModelScope | GitHub | MSA 技术论文架构细节
428B 总 / 23B 激活 MoE;MSA(MiniMax Sparse Attention)稀疏注意力(长上下文计算量压到常规 1/3);首个从 Step 0 做多模态混合训练的开源模型能力规格
原生多模态(文本+图像等);1M 上下文;Agentic Coding / 超长文档 / 私有化部署评测/排行
SWE-Bench Pro ~59%(开源第一梯队);Swaybench Pro / SVG Bench / Kernel Bench Hard 优于 Opus 4.7;AA 综合智能指数全球开源最高排名部署
API 输入 $0.30 / 输出 $1.20 每百万 token(约闭源 1/10);支持私有集群部署 + LoRA/QLoRA 微调;M3-highspeed 快速版⚠️ 许可需核验:MiniMax 系 Apache 2.0 历史;M2.7/M3 新开源协议可能含商用限制,以官方仓库为准。
社区评价
国产首个原生多模态旗舰开源;代码能力追平国际顶尖;开源当天 HF 下载 5 万+、GitHub 24h 千星优化生态
MSA 稀疏注意力降长上下文成本;LoRA/QLoRA 微调;GPUStack / Transformers 部署教程;自动 Cache12. DeepSeek V4(Pro / Flash)DeepSeek
LiveCodeBench 93.5MIT1M上下文
开源时间
2026-04-24(预览版同步开源,官方模型卡 PDF)
开源地址
HF
deepseek-ai | GitHub deepseek-ai | ModelScope | 官方模型卡 fe-static.deepseek.com架构细节
MoE:Pro 1.6T/49B 激活、Flash 284B/13B 激活;MTP 多 token 预测;CSA+HCA 混合注意力(KV 缓存序列维压缩 + DeepSeek Sparse Attention + 重度压缩密集注意力,长上下文效率大提升);mHC 流形约束超连接(Birkhoff 多胞形);Muon 优化器能力规格
- 1M token 上下文;三种推理模式:Non-Think / Think High / Think Max
- 预训练数据 33T tokens(Pro);纯文本 + 三推理档
评测/排行
LiveCodeBench 93.5 | Codeforces 3206 | MMLU-Pro 87.5 | SWE-bench Verified 80.6% | Agent Score 1554(超 Kimi K2.6 的 1484)部署
华为昇腾首发适配(首次国产芯片扛旗舰);官方称推理成本 -75%、显存占用 -90%;vLLM / SGLang 生态跟进社区评价
"百万上下文时代的开源宣言";GPT-5.5 同日发布,V4 用 1/8 价格对标;从追赶者到规则制定者优化生态
昇腾 CANN 全链路:FP8+INT4 分层混合量化(体积 1/4、2×910B 跑 Pro);众智 FlagOS Day-0(1.6T & 284B 八芯适配、8/16 卡脚本、权重反量化工具);社区 DwarfStar 本地推理引擎(antirez,Metal/CUDA/ROCm);腾讯云 SGLang 量化 +3.9× 成本 -50%;vLLM DualPath / llama.cpp / GGUF / Ollama13. Kimi K2.6月之暗面 Moonshot
SWE-Bench Pro 58.6%Apache 2.0*300子Agent
开源时间
2026-04-20(8 天预览后正式开源上线)
开源地址
GitHub
MoonshotAI | HF moonshotai | kimi.com架构细节
1T 总 / 32B 激活 MoE;384 路由专家 + 1 共享专家,每 token 激活 8;61 层;MLA 注意力;MuonClip 稳定训练;内置 400M MoonViT 视觉编码器,原生文本+图像+视频能力规格
256K(262,144)上下文;每集群最多 300 子 Agent 并行;12 小时长程运行;多文件编辑/终端操作/复杂工具链评测/排行
SWE-Bench Pro 58.6% | Agent Score 1484 | 博士级"人类最后考试"领先 | 长周期高难度编程 Agent 场景领先部署
大显存多卡;vLLM / SGLang社区评价
最强开源原生多模态 Agent 模型;"12 小时运行"生产级;长程编码标杆⚠️ K2 系 Apache 2.0;K2.6 具体许可以官方仓库为准。
优化生态
Ollama 直接支持(kimi-k2.6 标签);与 K2.5 架构一致可平滑升级;Bittensor 蒸馏子网 Distil-SN97(社区竞争蒸馏);社区三推理引擎部署指南;INT4 compressed-tensors 封装;300 子 Agent 编排 / Agent OS 工具链
14. MiniMax-M2(含 M2.7)MiniMax
AA 全球前五Apache 2.0*极致参数效率
开源时间
M2(2025-10-27 发布开源)| M2.7(2026-04-12)
开源地址
GitHub
MiniMax-AI/MiniMax-M2(已确认)| HF MiniMaxAI/MiniMax-M2 | arXiv 2605.26494架构细节
229.9B 总 / 9.8B 激活;62 层 decoder-only;256 细粒度专家 + sigmoid gating;GQA;192K 原生上下文;MTP 多 token 预测能力规格
Agent / 代码 / 多文件编辑 / 终端操作 / 复杂工具链;M2.7 主打"自进化"概念与办公/Agent 协作评测/排行
Artificial Analysis 全球前五;8% 价格、2 倍速度(对比 Claude Sonnet);代码智能逼近最强闭源部署
10B 激活性价比极高;SGLang / vLLM 推荐;沐曦国产 GPU Day-0 适配(M2.7)⚠️ 许可注意:M2 为 Apache 2.0;M2.7 采用新开源协议,商业用途需 MiniMax 书面授权。
社区评价
"10B 激活实现 230B 性能"的极致参数效率;Agent 场景口碑好优化生态
Unsloth 22 个 GGUF 量化(1-8bit,4bit 108GB 可跑 128GB 设备);AWQ + QLoRA 微调(DGX Spark Blackwell 实测);SGLang / vLLM;沐曦国产 GPU Day-0(vLLM≥0.13);Agent 工具链 / 多文件编辑生态;本地部署教程15. Google Gemma 4Google DeepMind
Arena 1452Apache 2.0边缘部署
开源时间
2026-04-02(四款齐发);技术报告 2026-06-19
开源地址
HF
google(gemma-4-31b / 26b-a4b / 12b / e4b / e2b)| ai.google.dev/gemma | DeepMind 官方页架构细节
dense + MoE 家族:31B dense、26B A4B(3.8B 激活 MoE)、12B Unified dense、E4B、E2B;12B 用 35M 轻量视觉嵌入器替代传统 550M 视觉编码器(图片切 48×48 patch 当 token 直接进 Transformer);多 token 预测能力规格
- 原生多模态(文本+图像+音频理解/生成);2M 上下文(宣传口径)
- 思考 / 无思考双模式
评测/排行
Arena AI:31B=1452 / 26B=1441 | MMLU 31B 88.4% | BigBench Extra Hard 74.4% | AIME 2026 89.2% | LiveCodeBench 80% | GPQA Diamond 84.3% | τ2-bench 86.4%部署
E2B/E4B 端侧;12B 消费级(M5 Mac 16GB 可跑,32GB 更流畅);QAT 量化 12B ~7GB 质量近无损社区评价
Google 称"最强开源",Nathan Lambert 评价"rivals Qwen3.5(匹敌非超越)";6 项 benchmark Qwen 赢 4 项,但边缘部署无对手;30B 级最强多语言+多模态+边缘优化生态
LiteRT / Keras;ollama / llama.cpp;QAT 量化;Android 端侧图像大模型 · 2026 开源一览表
聚焦 2026 年发布、权重可下载的图像生成模型。点击表头可排序。(带 ⚠️ gated 的仓库需登录 HF 接受许可,非死链)
| 模型 | 厂商 | 开源时间 | 参数 | 许可 | 排行亮点 | 核心标签 | 规格 | 开源地址 |
|---|---|---|---|---|---|---|---|---|
| SenseNova U1.5 商汤 | 商汤 | 2026-08-21 | 8B MoT | Apache 2.0 | 8B 对标闭源 | moT | 原生4K | HF |
| Krea 2(RAW / Turbo) Krea AI | Krea AI | 2026-06-22/23 | 权重公开 | Krea 社区许可 | AA 独立实验室第1 | krea | 美学/2s | GitHub / HF |
| Ideogram 4.0 Ideogram | Ideogram | 2026-06-03 | — | 权重非商用 | DesignArena 开源第1 | ideogram | 文字之王 | GitHub |
| Cosmos3-Super-T2I NVIDIA | NVIDIA | 2026-06-01 | 64B(32B+32B) | OpenMDW-1.1 | AA 开源第1 · Elo 1219 | cosmos | 物理AI | HF / GitHub |
| HiDream-O1-Image 智象未来 | 智象未来 | 2026-05-08 | — | MIT | AA 开源第2 · Elo 1183 | hidream | 无VAE | GitHub / HF |
| ERNIE-Image 百度 | 百度 | 2026-04-15 | — | Apache 2.0 | OneIG-ZH 0.554 | ernie | 中文指令 | HF / GitHub |
| SenseNova U1 商汤 | 商汤 | 2026-04-28 | 8B MoT | Apache 2.0 | 8B 对标闭源 | sensenova | 原生4K | GitHub |
| Wan2.7-Image 阿里 | 阿里 | 2026-04 | — | Apache 2.0 | — | wan | 照片级 | HF |
| Qwen-Image 2.0 阿里 | 阿里 | 2026-02-10 | 20B | Apache 2.0 | AI Arena 开源最强 | qwen | 中文渲染 | HF / GitHub |
| FLUX.2 klein 4B/9B Black Forest Labs | Black Forest Labs | 2026-01-19 | 4B / 9B | 4B:Apache 2.0 | — | flux | 亚秒级 | HF |
| GLM-Image 智谱 + 华为 | 智谱 + 华为 | 2026-01-14 | — | MIT | CVTG-2K 文字第1 | glm | 自回归+扩散 | HF / GitHub |
| Qwen-Image-2512 阿里 | 阿里 | 2025-12-31 | 20B | Apache 2.0 | AI Arena 开源最强 | qwen | 中文渲染 | HF / GitHub |
图像生成 · 逐模型详情
统一字段模板:基本信息 → 架构细节 → 能力规格 → 评测/排行榜 → 部署 → 许可 → 社区评价 → 优化生态
1. SenseNova U1 / U1.5商汤
8B 对标闭源Apache 2.0原生4K
开源时间
U1:2026-04-28;U1.5 Lite:2026-07-31 Preview → 2026-08-21 正式版
开源地址
GitHub
OpenSenseNova/SenseNova-U1 | HF sensenova/SenseNova-U1.5-8B-MoT | ModelScope | sensetime.com架构细节
NEO-Unify:去掉视觉编码器和 VAE,像素与文本同一 Transformer 原生共存;U1.5 为 8B MoT(Mixture of Tokens);U1 另有 A3B 版(38B 总 / 理解 3B + 生成 3B 激活 MoE);U1.5 按文字/美学/编辑训练专家后蒸馏融合能力规格
- 原生 4K 图像生成;3–4k 字符超长指令(两千字指令一字不落)
- 图像编辑:Bounding Box / Visual Marker / 单图多图参考
- 图像理解:OCR / 图表解析 / 多图对比
评测/排行
8B 达商业闭源生成与编辑质量;效果对标 GPT-Image-2;指令遵循与编辑保持度超越同量级(商汤自测 2026-08-30 对比表)部署
8B 单卡可部署;GGUF 量化后更低;注意:3K/4K 显存压力大(社区实测两张 4090D 才较稳),1K 文字偏糊、2K 内容偶不全社区评价
"终结缝合时代";"8B 小模型搞定 4K + 两千字指令";海外社区广泛讨论优化生态
GGUF 量化;ComfyUI;预训练启动器/配置开源;10 家国产芯片适配;U1 Fast 信息图专用(2K,11 种宽高比)2. Krea 2(RAW / Turbo)Krea AI
AA 独立实验室第1Krea 社区许可美学/2s
开源时间
2026-05-12 公告 → 05-18 GA → 2026-06-22/23 开放权重(同日发布技术报告)
开源地址
GitHub
krea-ai/krea-2 | HF(Krea 2 RAW / Turbo 双 checkpoint)| krea.ai | FAL / ComfyUI / AWS / GCP架构细节
12B 扩散 Transformer(DiT),完全从零训练(首个自研基础模型,非基于 FLUX 微调,Krea 1 才与 BFL 合作);文本编码器用 Qwen3-VL 多层特征聚合;两个 checkpoint:RAW(未蒸馏基础版,供 LoRA/后训练)+ Turbo(8 步蒸馏,约 2s 生成 2K)能力规格
- 美学优先("最美学开源图像模型");风格迁移 / 创意控制
- "creativity" 参数:在字面提示遵循与模型自由度之间可调
- 擅长胶片颗粒、金属表面、运动模糊、虹彩质感、微距细节
- Turbo:8 步生成 2K 约 2 秒
评测/排行
- Artificial Analysis 文生图 —— 独立实验室 #1
- 第三方评测"120 亿参数登顶全球前十"
部署
Turbo 8 步 2K 约 2s;13B 参数 BF16 约 24GB 级,量化可更低;推荐工作流:RAW 上训 LoRA → Turbo 推理社区评价
"美学优先颠覆 AI 绘图";独立实验室最强;从 FLUX 微调转向自研的标杆⚠️ 许可注意:Krea 2 Community License(社区许可)——个人/小团队可商用;企业超 50 席位需另行购买商业许可。非 Apache/MIT。
优化生态
RAW(LoRA 微调)+ Turbo(推理)双 checkpoint;ComfyUI 原生(Floyo 2 workflows);FAL / AWS / GCP / Nous Research(Hermes)接入3. Ideogram 4.0Ideogram
DesignArena 开源第1权重非商用文字之王
开源时间
2026-06-03
开源地址
GitHub
ideotom/ideogram4 | HF 开放权重 | ideogram.ai架构细节
完全单流 DiT(34 层 Transformer,文本+图像 token 统一序列,无独立分支);文本编码器用 Qwen3-VL-8B-Instruct 视觉语言模型(提取 13 个中间层 hidden states);从零训练能力规格
- 原生 2K 输出
- 结构化 JSON 提示接口:指定文本位置、边界框布局、16 进制调色板
- 英文 OCR 准确率 0.97;海报/标识/Logo"首生即用"
评测/排行
- DesignArena 全球第 4、开源第 1
- 专业盲测排版偏好率 47.9%(Gemini 3.1 Pro 30%、FLUX.2 15.5%)
- SpatialGenEval 空间推理优秀
部署
NF4 量化版单张 RTX 4090 可跑;标准版 24GB 级社区评价
彻底解决"AI 生图写字难";设计师圈强烈反响;"93 亿参数打爆 800 亿"(指文字能力)⚠️ 许可注意:多数信源为权重非商用许可 + 推理代码 Apache 2.0;部分信源称 Apache 2.0。商用前必须核对官方仓库。
4. Cosmos3-Super-Text2ImageNVIDIA
AA 开源第1 · Elo 1219OpenMDW-1.1物理AI
开源时间
2026-06-01(随 Cosmos 3 全家桶发布)
开源地址
HF
nvidia/Cosmos3-Super-Text2Image | GitHub NVIDIA/Cosmos | 技术报告 research.nvidia.com/labs/cosmos-lab/cosmos3架构细节
64B = 32B reasoner + 32B generator;Mixture-of-Transformers(MoT)——自回归 Transformer 处理文本 + 扩散 Transformer 处理连续模态,mRoPE + 多模态注意力层统一语言/图像/视频/音频/动作
能力规格
- Agentic 文生图(带推理规划)
- 物理一致性专为机器人/自动驾驶合成数据设计
- 物理基准:Unigraph ~91.3、前项动力学 26、Nano Policy 39.7
评测/排行
- Artificial Analysis T2I Arena 开源权重第 1(Elo 1219,2026-07 快照)
- 8 项物理 AI 基准开放模型排名第 1
部署
64B 需数据中心(8×H100/H200/GB200);另有 Cosmos3-Nano 16B 单 GPU 可跑(Project DIGITS GB10 实测);推理栈 PyTorch / vLLM-Omni / Diffusers / NIM社区评价
物理 AI"核弹"级发布;机器人/自动驾驶首选;普通创作者门槛过高优化生态
代码+权重+合成数据集+评估基准全开源;Cosmos Coalition 联盟;Nano/Edge 轻量档5. HiDream-O1-Image智象未来
AA 开源第2 · Elo 1183MIT无VAE
开源时间
2026-05-08(Dev-2604 于 05-14 追加开源)
开源地址
GitHub
HiDream-ai/HiDream-O1-Image | HF HiDream/HiDream-O1-Image(gated 需登录接受许可) | ModelScope | hidreamai.app架构细节
UiT(Unified Transformer)——像素级统一 Transformer,彻底抛弃 VAE 和分离式文本编码器,像素/文本/task 条件共享 token 空间端到端建模;RMSNorm+SwiGLU+RoPE;隐藏层 4096、注意力头 32能力规格
- 最高 2048×2048 原生 2K
- 单一模型完成:文生图 + 指令编辑 + 主体个性化 + 多镜头
- 内置 prompt_agent.py 自动扩提示词;中文长文渲染接近完美
评测/排行
- GenEval 0.90 —— 开源第 1(超 GPT Image 2 的 0.89)
- HPSv3 10.37(超 GPT Image 2);DPG-Bench 89.83
- AA Arena 全球第 8 / 开源第 2(2026-05);1.5 版升至中国第 1、全球第 2(2026-06)
部署
8B 消费级 GPU 可跑;FP8 版 RTX 40xx/H100 加速;Distilled 28 步推理速度翻倍社区评价
上线 6 天 3000+ 赞;"没有 VAE 的革命性架构";8B 性价比之王;复杂提示词偶尔需手动细化优化生态
ComfyUI 官方教程;Diffusers;FP8 量化;IP 加速(layout/skeleton conditioning);Dev editing scheduler6. ERNIE-Image百度
OneIG-ZH 0.554 追平闭源Apache 2.0中文指令
开源时间
2026-04-15
开源地址
HF
baidu/ERNIE-Image | GitHub baidu/ernie-image | ernie-image.github.io | arXiv 2605.25347架构细节
8B 单流 DiT 骨干 + 3B Prompt Enhancer(PE);采用 FLUX.2 VAE;两档:SFT 版(50 步,guidance 4.0)+ Turbo 版(8 步,DMD+RL 蒸馏,6× 更快)能力规格
- 1024² 默认;832×1216 / 1216×832;分辨率 64–2048(步长16)
- 最大 prompt 2048 字符;中英日图内文字渲染
- 结构化输出(海报/漫画/多格分镜);多元风格
评测/排行
- OneIG-ZH 0.554 —— 开源第 1,与闭源 Seedream 4.0 总分持平
- LongText-Bench 中文长文本领先;GenEval 0.8667(Turbo w/o PE)
- 复杂指令遵循强于 Qwen-2512 / Z-Image(第三方实测)
部署
BF16 ~16–29.5GB;GGUF Q8_0 ~15GB;24GB(RTX 4090)单卡流畅;Turbo 8 步数秒/张,SFT 50 步约 4s/张社区评价
"最懂中文的文生图模型";8B 叫板 Nano Banana 2.0 与 Seedream 5.0优化生态
ComfyUI Day-0;Diffusers;SGLang;ControlNet/IP-Adapter 管线;Unsloth GGUF;LiblibAI;国产算力适配7. Wan2.7-Image阿里
Apache 2.0照片级
开源时间
2026-04(随 Wan2.7 全家桶)
开源地址
HF
Wan-AI/Wan2.7-Image(gated 需登录接受许可) | ModelScope | 阿里云百炼 API架构细节
14B(27B 总 / 14B 激活 MoE);MoE DiT + 流匹配;与 Wan2.7 视频共享骨干能力规格
- 标准 2048×2048(2K);Pro 版 4096×4096(4K)
- 统一文生图 + 图像编辑
- thinking mode(链式推理)默认开启——先思考再生成
评测/排行
开源照片级真实感第一梯队;Artificial Analysis 相关榜单前列部署
14B 24GB+;32GB+ 系统内存;thinking mode 显著增加耗时社区评价
照片级真实感强;复杂指令遵循佳优化生态
ComfyUI;LoRA;社区 4K 工作流8. Qwen-Image 2.0 / 2512阿里
AI Arena 开源最强Apache 2.0中文渲染
开源时间
2512:2025-12-31(基准);2.0:2026-02-10
开源地址
GitHub
QwenLM/Qwen-Image | HF Qwen/Qwen-Image-2.0(gated 需登录接受许可) / Qwen-Image-2512 | ModelScope | arXiv:2605.10730架构细节
~7B(第三方口径);MMDiT 骨干 + Qwen2.5-VL 7B 文本编码器(编辑路径)能力规格
- 原生 2048×2048(2K);2512 支持 2512² 以上
- 1000 token 长提示词;专业排版;生成+编辑统一
- 2512 重点:更真实人像、更细纹理、更强文字渲染
评测/排行
- 2512:AI Arena 最强开源文生图(10,000+ 轮盲测)
- 2.0:DPG-Bench 88.32;AI Arena 文生图+编辑双榜第一;DataLearner 1139 分
部署
2512:FP16 21.3GB / INT8 13.7GB(30 步 FP16 142.6s / INT8 87.9s);2.0:12–16GB;GGUF 量化 6GB 可跑社区评价
开源中文文生图第一选择;中文提示词理解强(无需翻译式写法);生态成熟优化生态
GGUF 多档量化(含 uint4 信创方案);ComfyUI;LoRA;FP16/INT8 实测9. FLUX.2 klein 4B / 9BBlack Forest Labs
4B: Apache 2.09B: FLUX 许可亚秒级
开源时间
2026-01-19
开源地址
HF
black-forest-labs/FLUX.2-klein | bfl.ai | ComfyUI 官方文档架构细节
整流流(Rectified Flow)Transformer,蒸馏 4 步;版本矩阵:4B/9B × Base/蒸馏 + 9B FP8能力规格
1024–2048;文生图 + 图像编辑 + 多参考合成统一(最多 4 张参考图);单模型 All-in-One评测/排行
ELO ~1066(FLUX.2 Pro ~1170 为闭源对照)部署
4B:13GB(8GB 显存+16GB 内存可跑);9B:29GB(16GB+32GB);9B FP8 更低;蒸馏版 4 步 0.5–1.2s 亚秒级社区评价
消费级 GPU 实时生成首选;"AI 绘图万能工厂";电商视觉提效优化生态
ComfyUI day-0;unsloth GGUF;FP8/NVFP(与 NVIDIA 合作);LoRA;Nunchaku 4-bit(提速 3–5×);9B KV 多图融合10. GLM-Image智谱 + 华为
CVTG-2K 文字第1MIT自回归+扩散
开源时间
2026-01-14
开源地址
HF
zai-org/GLM-Image | GitHub zai-org/GLM-Image | ModelScope | 昇腾社区架构细节
16B = 9B 自回归(GLM-4-9B 基础)+ 7B DiT 扩散解码器;Semantic-VQ 语义离散化 token;GRPO + Flow-GRPO 强化学习;华为昇腾 Atlas 800T A2 + 昇思 MindSpore 全流程训练(首个国产芯片训练 SOTA 多模态)能力规格
- 上下文 4K;模型文件 35.8GB
- 海报/PPT/科普图等知识密集型场景;"认知型生成"范式
- 图生图全家:编辑/风格迁移/身份保持/多主体一致性
评测/排行
CVTG-2K 文字渲染 0.9116 第 1;DataLearner 1013 分;首个开源工业级离散自回归图像生成部署
推理速度与消费级同级别相当;GQA + Flash Attention;API 单图约 0.1 元社区评价
知识密集型任务优势明显;国产全栈算力验证里程碑优化生态
权重+训练代码+评估脚本全开源;GQA+Flash Attention;昇腾国产算力验证视频生成 · 2026 开源一览表
点击表头可排序。
| 模型 | 厂商 | 开源时间 | 参数 / 架构 | 许可 | 排行榜亮点 | 显存 | 核心标签 | 开源地址 |
|---|---|---|---|---|---|---|---|---|
| LTX-2.5 Lightricks | Lightricks | 2026-08 | 22B 非对称双流 | LTX 许可 | 速度第一梯队 | 32–80GB | 4K/原生音画 | HF |
| MAGI-2 Preview Sand.ai | Sand.ai | 2026-08-05 | 114B / 6B 激活 MoE | Apache 2.0 | AA I2V 第6 | 8×H100(307GB) | 千亿MoE | 官网 |
| MiniMax H3 MiniMax | MiniMax | 2026-07-31/08-03 | 33B Dense | H3 社区许可 | 开源第一梯队 | ~130GB | 原生音画 | HF / GitHub |
| LingBot-Video 灵波智能 | 灵波智能 | 2026-07 | 1.3B / 30B-A3B | 待核 | 具身视频新玩家 | 消费级 | 机器人 | 待核 |
| Cosmos3-Super-Image2Video NVIDIA | NVIDIA | 2026-06-01 | 64B · MoT | OpenMDW | AA I2V 开源第1 | 数据中心 | 物理AI | HF |
| MAGI-1 Sand.ai | Sand.ai | 2026-04 | 4.5B / 24B | Research | 首个主流自回归视频 | 24GB+/多卡 | 无限长度 | GitHub |
| Wan2.7 阿里 | 阿里 | 2026-04 | 14B MoE(27B总) | Apache 2.0 | AA T2V 首发 Elo 1762 I2V Elo 1090 | 24GB+ | 全家桶 | HF / GitHub |
| LTX-2.3 Lightricks | Lightricks | 2026-03 | 22B | LTX 许可 | 4K 原生音画 | 24–32GB | 22B 双流 | HF |
| SkyReels V2 昆仑万维 | 昆仑万维 | 2026 | 1.3B / 14B | Apache 2.0 | 开源 I2V 最高分 | 14.7–51GB | 无限长度 | GitHub |
视频生成 · 逐模型详情
统一字段模板同上。
1. LTX-2.5 / 2.3Lightricks
速度第一梯队LTX 许可4K/原生音画
开源时间
LTX-2.3:2026-03;LTX-2.5:2026-08
开源地址
HF
Lightricks/LTX-2.5 / LTX-2.3 | ltx.io | ComfyUI-LTXVideo | LTX Studio架构细节
22B 非对称双流扩散 Transformer(双向交叉注意力);2.5 新增:新扩散视频解码器(替代 VAE,面部/纹理/文字更清晰)、自定义 Gemma 4 12B 文本编码器、Prompt enhancer、Duration predictor能力规格
- 原生 4K(3840×2160);Auto Duration
- 24/25/48/50fps;原生同步音频(单模型 pass 音视频同生)
- T2V / I2V / 首尾帧;竖屏 1080×1920 原生训练
评测/排行
速度:1080P 5s 约 50s 生成;8s 视频 57s;2K 视频 47s;ltx.dev 称业界首个实时(2–4s)视频模型部署
32GB(FP8),80GB 推荐;社区 8G 显存整合包可跑社区评价
速度快但提示词遵从度一般、复杂人物动作/手部/多人交互易崩;适合过场素材/大场景/无远距离人像优化生态
ComfyUI day-0(dev+distilled);LTX Studio;原生 macOS 应用;HF 下载 79 万/月;IC-LoRA(HDR);物理仿真 checkpoint2. MAGI-2 PreviewSand.ai / 清华系
AA I2V 第6Apache 2.0千亿MoE
开源时间
2026-08-05
开源地址
GitHub(MAGI 系列)| HF | magi-1.ai | SGLang PR #35014 | Sand.ai 博客
架构细节
114B 总 / 每 token 激活约 6B(MoE);宽度 3072,路由 12 heads × 256 维,每 head 256 专家 / Top-6 激活,专家 FFN 256→1280→256(fused SwiGLU);40 层单流 Transformer + 36 层细粒度 MoE;统一音视频生成;推理优化 Head Parallel + MagiMoE能力规格
时长 10s;1080P(先 512×896 再 refiner 至 1088×1920);联合生成视频+音频;文本或文本+首帧输入;运镜/对焦/人物表现达闭源第一梯队评测/排行
Artificial Analysis Image-to-Video 榜第 6(2026-08 快照);全球首个参数过百亿开源视频模型部署
8 张 H100/Hopper,权重合计约 307GB;按 8 卡 H100 月租折算,10s 1080P 推理成本约 0.5 元/条⚠️ 注意:6B 激活 ≠ 6B 小模型成本;MoE 调度开销 + 307GB 权重加载是实际门槛。
社区评价
"用得起"的千亿 MoE 视频;发布当天刷屏;"ComfyUI 生态要变天"优化生态
SGLang 官方支持(fused_experts);ComfyUI 适配中;社区部署教程;MoE 调度优化论文级方案3. MiniMax H3MiniMax
开源第一梯队H3 社区许可原生音画
开源时间
2026-07-31 发布 → 2026-08-03 HF 开放权重
开源地址
HF
MiniMaxAI/MiniMax-H3 | GitHub MiniMax-AI/MiniMax-H3 | ComfyUI Wiki | Hailuo AI架构细节
33B Dense 单流 Omni Transformer(约 13B 在 AdaLN 分支,推理时可预计算缓存);多模态编码器复用 Qwen3-VL-32B;系统三层:context2(闭源)+ H3-Base(开源)+ regenerate2K(超分)能力规格
- 时长 4–15s;最高 2K(默认短边 768);24fps
- 原生 32kHz 立体声同一前向生成(非后配音);11 种语言
- 输入最多 9 图 / 3 视频 / 3 音频 + 提示词(参考生成视频最强)
- 视频编辑(精准剪辑/替换/扩展)、风格迁移;一次出 8 个
评测/排行
文生/图生视频进入开源第一梯队;视频编辑尤其亮眼;"完整镜头生成工具"部署
33B 全模型约 130GB(Mac M5 Max 实测可跑);bf16/INT8/pruned/NVFP4 多档;社区 8G 整合包(量化)可跑;API $0.13/s社区评价
"这次真不是吹的";保真度有短板(特殊生物外观 2 秒后跑偏变普通老虎);开源一周衍生近 300 个模型、ComfyUI 版下载逼近 700 万次,"视频模型重演 DeepSeek 的故事"⚠️ 许可注意:H3 Community License 排除美欧商业使用,务必阅读协议。
优化生态
量化全家桶:GGUF(Q2~Q8 各档,消费级 15.6-23.9GB)+ INT4 / INT8 / MIXED / NVFP4 统一仓库(Abiray / realrebelai / DiffSynth-NF4 等);显存压缩:ComfyUI 团队裁减调制权重 + INT8 + 定制内核,最低占用 123.6GB→42.5GB,INT8 24GB 单卡按层 offload、NF4 8-12GB 可跑;推理加速:SageAttention2 / TE-Speed / TeaCache 等(潜力 2-3 倍);Turbo LoRA 采样 20 步→4-8 步;Apple Silicon 原生推理引擎(antirez);开源当天即 ComfyUI 原生支持 + 六套工作流(文生/图生/首尾帧/参考视频);设计期即适配国产芯片4. LingBot-Video灵波智能
待核具身/机器人
开源时间
2026-07(2026 全景盘点新发布)
开源地址
GitHub / HF(以官方仓库为准)
架构细节
Dense 1.3B;MoE 30B-A3B + Refiner能力规格
T2V / TI2V / 具身视频;物理行为、机器人、第一人称数据导向部署
1.3B 消费级可跑;30B-A3B 需多卡社区评价
新发布、生态成熟度待观察;具身智能研究新选择优化生态
生态仍在早期5. Cosmos3-Super-Image2VideoNVIDIA
AA I2V 开源第1OpenMDW-1.1物理AI
开源时间
2026-06-01
开源地址
HF
nvidia/Cosmos3-Super-Image2Video | GitHub NVIDIA/Cosmos架构细节
64B(MoT 混合 Transformer,Cosmos3 全模态世界模型一部分)能力规格
图 → MP4;推荐 480p(832×480,16:9);默认 189 帧;物理一致性、时间连贯评测/排行
Artificial Analysis Image-to-Video 榜开源第 1(2026-07-17 快照)部署
64B 数据中心级(8×H100/H200/GB200);Cosmos3-Nano 16B 单 GPU;PyTorch/vLLM-Omni/Diffusers/NIM社区评价
物理 AI 世界仿真首选;普通创作者门槛过高优化生态
代码+权重+数据集+基准全开源;Nano/Edge 轻量档;AtomGit 镜像6. MAGI-1Sand.ai
Research 许可自回归
开源时间
2026-04
开源地址
GitHub
isl-org/MAGI-1 | HF | magi-1.ai架构细节
自回归 + Diffusion Transformer;4.5B / 24B;24 帧/块流式生成能力规格
无限长度(24 帧/块流式);精确秒级时间线控制;强提示遵循部署
4.5B 单 GPU 24GB+(RTX 4090);24B 需 8×H100 或 8×4090;distill+fp8 版 4×H100 或 8×4090社区评价
无限长度生成标杆;长叙事/纪录片场景;生成慢、分辨率选择有限优化生态
4.5B 单卡版;24B 多卡版;distill+fp8 量化;T5+VAE 配套7. Wan2.7阿里
AA T2V 首发 Elo 1762Apache 2.0全家桶
开源时间
2026-04(4-07 曾以匿名 HappyHorse-1.0 登 Arena 历史第一)
开源地址
HF
Wan-AI/Wan2.7(gated 需登录接受许可)| ModelScope | GitHub Wan-Video(官方组织,Wan2.7 独立推理仓库未建,代码沿用 Wan2.2/diffusers)| 阿里云百炼 API架构细节
14B MoE(27B 总 / 14B 激活);DiT + MoE + 流匹配 + T5 编码器;图像 2D VAE+空间注意力,视频因果 3D VAE+全时空注意力;另有 1.3B 轻量版能力规格
- 时长:默认 5–10s,最短 2s 素材续写至 15s;首尾帧控制
- 720P/1080P;24fps 默认(15/30 可调);6 种宽高比
- 指令式视频编辑(删物体/换背景/改风格/改光照/改运镜/重写台词带口型)
- 声画同步(r2v 多主体可配音色);9 宫格图像转视频;动作模仿
评测/排行
- AA T2V 首发 Elo 1762(超 LTX-2.3 Pro 1484 / HappyHorse-1.0 1446)
- Awesome Agents I2V 榜 Elo 1090 第 4($6/min);社区编辑评分 8.5/10
部署
14B 24GB+;1.3B 8GB+;RTX 4090 可跑(FP8/GGUF);5B TI2V 720P 5s:多卡 ~155s / 单卡 ~534s社区评价
"视频生成瑞士军刀——功能最全";"开源第一次领先商业(首发 AA 榜首)";唯一同时具备帧控制+音频同步+多参考优化生态
ComfyUI 原生(Kijai);GGUF(INT4/INT8);LoRA 丰富;阿里云 PAI 一键部署;社区 4K 工作流8. SkyReels V2昆仑万维
开源 I2V 最高分Apache 2.0无限长度
开源时间
2026(V1 为 2025)
开源地址
GitHub
skyworkai/skyreels-v2 | HF | 社区 fork架构细节
Diffusion Forcing + 流匹配(Wan2.1 血统);1.3B / 14B;电影级光影(好莱坞级影视数据训练)能力规格
演示最长 60s(1457 帧),理论无限长度;540P/720P;9:16 竖屏默认;24fps;T2V/I2V评测/排行
开源 I2V 最高分(ChatForest 口径)部署
1.3B-540P ~14.7GB;14B-540P ~51.2GB;T2V-14B-540P ~43.4GB社区评价
无限长度生成开源标杆;电影级光影美学;情绪/氛围感强优化生态
ComfyUI;无限长度工作流;电影级风格 LoRA重要基准 · 2025 年末发布、仍居第一梯队
虽是 2025 年发布,但替换现有模型时必然要对标的基线,故单列。
HunyuanImage-3.0(腾讯,2025-09-28)
HunyuanVideo 1.5(腾讯,2025-11-21)
Qwen-Image-2512(阿里,2025-12-31)
- AI Arena 10,000+ 轮盲测最强开源;Apache 2.0
- FP16 21.3GB / INT8 13.7GB;GGUF 6GB 可跑
- 2026 上半年最常被对比的基线(详见图像详情 #4)
FLUX.2 dev(BFL,2025-11)
- 32B MMDiT;LM Arena #9(1149)
- 1024–2048+;文生图+单图/多图参考;中文提示词
- Q4 GGUF 19GB / FP8 32GB;许可:FLUX 非商用
Kandinsky 5.0(SberAI,2025-09)
- 图像 Lite 6B(MIT,4090 可跑);视频 Pro 19B(LMArena 开源 T2V #1)/ Lite 2B(同类 #1,12GB+offload)
- 10s HD;可控运镜(Camera Control LoRAs);英俄双语
- GitHub
kandinskylab/Kandinsky-5
排行榜数据源与口径说明
不同榜单/任务不可直接比较,这里标注快照与口径供交叉验证。
| 榜单 | 网址 | 口径 | 快照 | 注意 |
|---|---|---|---|---|
| AA T2I Arena | artificialanalysis.ai | Elo 盲测(人类偏好投票) | 2026-07 | 过滤到开源权重后 NVIDIA 第 1 |
| AA I2V/T2V Arena | artificialanalysis.ai | Elo 盲测 | 2026-07/08 | MAGI-2 第 6 是 I2V 榜 |
| LMArena | lmarena.ai / arena.ai | Arena 分数 | 2026-08-04 | qwen-image-3.0-pro 第 5(~1263,未开源,仅参考) |
| DesignArena | designarena.ai | 设计导向盲测 | 2026-06/07 | Ideogram 4 开源第 1 / 全球第 4 |
| DataLearner | datalearner.com | 综合评分 | 2026 | 开源/可商用过滤 |
| ChatForest 视频榜 | chatforest.ai | 开源 I2V | 2026 | SkyReels V2 最高分 |
⚠️ 关键口径(避免误读):
- Wan2.7 的"1762"是首发匿名 T2V 测试(2026-05);Awesome Agents I2V 榜为 Elo 1090 第 4——不同榜单、不同任务
- NVIDIA Cosmos3"开源第一"指 AA 榜单过滤到开源权重后;与闭源混排时榜首仍是 GPT Image 2 / Veo
- Ideogram 4"全球第 4"是 DesignArena,非 AA 通用榜
- MAGI-2 第 6 是 114B/6B 激活 MoE,与 dense 模型成本口径不同
- HiDream-O1 有"全球第 8"(5 月)和"全球第 2"(6 月 1.5 版)两个版本差异
按部署场景的选型建议
针对"跟踪最新 → 评估 → 替换现有模型"的决策路径。
🖼️ 图像生成(自部署)
| 场景 | 首选 |
|---|---|
| 可商用+实时高吞吐 | FLUX.2 klein 4B(Apache,13GB,亚秒级) |
| 可商用+中文文字/版式 | ERNIE-Image(Apache,8B,OneIG-ZH 0.554) |
| 文字排版设计 | Ideogram 4(OCR 0.97)⚠️权重非商用 |
| 可商用+统一架构性价比 | HiDream-O1(MIT,8B,GenEval 开源第1) |
| 可商用+原生4K | SenseNova U1.5(Apache,8B,单卡) |
| 照片级真实感 | Wan2.7-Image(Apache,2K/4K Pro) |
| 知识密集型图文 | GLM-Image(MIT,CVTG-2K 第1) |
| 物理AI/机器人数据 | Cosmos3-Super-T2I(OpenMDW) |
🎬 视频生成(自部署)
| 场景 | 首选 |
|---|---|
| 可商用+全家桶全能 | Wan2.7(Apache,14B,2–15s,编辑/续写/音画) |
| 可商用+无限长度 | SkyReels V2(Apache,60s+) |
| 可商用+原生音画 | LTX-2.5(4K,极快)⚠️遵从度一般 |
| 全模态参考生成 | MiniMax H3(33B,2K/15s)⚠️排除美欧商用 |
| 千亿 MoE 极致参数 | MAGI-2 Preview(Apache,114B/6B激活,0.5元/条) |
| 物理AI/未来预测 | Cosmos3-Super-I2V(OpenMDW) |
| 消费级轻量快速 | LTX-Video 1.x / Wan2.7-1.3B |
信息源与聚合站
排行榜与模型情报的权威一手来源 / 聚合站。
- Artificial Analysis —— 模型质量/速度/价格综合榜(图像/视频 Arena)
- LMArena / Arena.ai —— 人类盲测竞技场
- Hugging Face —— 权重/许可/趋势榜(外网,需代理)
- ModelScope —— 国内权重/许可/趋势榜
- DataLearner —— 中文模型情报/规格聚合
- ComfyUI Docs —— 部署/工作流生态
⚠️ 模型迭代极快,替换前务必在官方仓库二次核验权重、许可与量化生态。整理:2026-08-31。