2026 年开源图像 / 视频大模型深度追踪报告

整理时间:2026-09-01 | 范围:2026 年发布的新开源模型(文本 15 + 图像 12 + 视频 9 + 基准 5),四 Tab 按开源时间排序 | 目的:跟踪最新 → 评估效果 → 替换现有模型
📄 文本 · 15🖼️ 图片 · 12🎬 视频 · 9🗂️ 其他 · 基准/选型/信息源 🖼️ 图像 · 12 款 🎬 视频生成 · 9 个开源 🔖 2025 基准 · 5 个 ✅ 仅收录已开源模型 📊 排行榜已核验

核心速览

2026 年开源模型已经能打:图像侧 NVIDIA 与 HiDream 登顶 Arena,中文渲染百花齐放;视频侧 Wan2.7 全家桶最全能,MAGI-2 首次把开源拉到千亿 MoE。本报告只收录已开源(权重可下载)的模型;Qwen-Image 3.0 / Wan3.0 未开源,不列入。
1.6T
文本开源旗舰 · DeepSeek V4(MIT)
AA 前三
文本开源SOTA · GLM-5.3
12B
独立实验室第1 · Krea 2(2026-06)
Elo 1219
图像开源第1 · NVIDIA Cosmos3
0.90
GenEval 开源第1 · HiDream-O1
0.97
英文OCR · Ideogram 4
114B
全球首个千亿开源视频 · MAGI-2
15s/2K
原生音画 · MiniMax H3
13GB
最轻可商用实时 · FLUX.2 klein 4B

文本大模型 · 2026 开源一览表

聚焦 2026 年发布、权重可下载的文本模型(各厂家旗舰/主打)。点击表头可排序。
模型厂商开源时间参数(总/激活)上下文许可亮点开源地址
DeepSeek V4-Flash-Vision-Exp
DeepSeek
DeepSeek2026-08-31305B/13B1MMIT视觉Agent超OpusHF / GitHub
Hy4 Preview
腾讯
腾讯2026-08-28770B/49B1M社区许可Agent/编程GitHub / HF
GLM-5.3(含 5.3-Flash)
智谱
智谱2026-08-26744B/40B · 320B/18B1MMITAA 前三HF / GitHub
Qwen3.8-Flash-Next
阿里
阿里2026-08-26125B/6B256K→1M开放权重HF 热榜第1HF / MS
Qwen3.8(2.4T-A95B · 27B)
阿里
阿里2026-08-122.4T/95B · 27B262KApache 2.0*Max级+视觉HF / GitHub
Ling-3.0-tiny
蚂蚁百灵
蚂蚁2026-08-117.9B/1.3BMIT端侧AgentHF
Muse Glimmer
Meta
Meta2026-08-1030B dense128KApache 2.0本地AgentHF
Ling-3.0-flash
蚂蚁百灵
蚂蚁2026-08-08124B/5.1BMITAA 38 智效比13.2HF / MS
Kimi K3
月之暗面
月之暗面2026-07-272.8T/1040B1M开放权重全球最大开源HF / GitHub
LongCat-2.0
美团
美团2026-07-061.6T/48B1MMITSWE超GPT-5.5HF / GitHub
MiniMax M3
MiniMax
MiniMax2026-06-12428B/23B1M开放权重*原生多模态HF / MS
DeepSeek V4 Pro / Flash
DeepSeek
DeepSeek2026-04-241.6T/49B · 284B/13B1MMITLiveCodeBench 93.5HF / GitHub
Kimi K2.6
月之暗面
月之暗面2026-04-201T/32B256KApache 2.0*300 子AgentGitHub / HF
MiniMax-M2(含 M2.7)
MiniMax
MiniMax2026-04(M2.7)230B/10B192KApache 2.0*8%价2倍速GitHub / HF
Gemma 4(31B/26B/12B/E4B/E2B)
Google
Google2026-04-0231B · 26B/3.8B · 12B · 4B · 2.3B2MApache 2.0Arena 1452HF / 官网

文本大模型 · 逐模型详情

统一字段模板:开源时间 → 地址 → 架构 → 能力 → 评测 → 部署 → 许可 → 社区评价 → 优化生态
1. DeepSeek V4-Flash-Vision-ExpDeepSeek
视觉Agent超OpusMIT多模态
开源时间
2026-08-31(API 08-21 上线,10 天后开源权重;V4 家族首个多模态模型)
开源地址
HF deepseek-ai/DeepSeek-V4-Flash-Vision-Exp | GitHub deepseek-ai | ModelScope
架构细节
305B 总 / 13B 激活 MoE(V4-Flash 284B 基座 + ~466M 视觉模块);基座 43 层、256 路由专家+1 共享、每 token 激活 6、hidden 4096、fp8 权重+fp4 专家;视觉塔 32 层、1024 hidden、16 头、patch 14、downsample 3、每图最多 384 vision tokens + Aligner;DFlash Attention + Hyper-Connections + DSpark
能力规格
原生图片输入(JPEG/PNG/GIF/WebP);图像描述/OCR/图表分析;完整保留 V4-Flash 文本推理/Agent/世界知识;1M 上下文(YaRN 16×),最大输出 384K
评测/排行
ZeroBench 视觉推理 35.0(超 Opus-4.8 34.0);DeepSWE 59.3%(超 Opus-4.8,V4-Flash 54.4%);Agents' Last Exam 27.3;ApexBench 36.5(+10 vs Flash-0731);Chartography 64.3;Toolathlon-Verified 75.9;Cybergym 75.3(-1.4 轻微回归)
部署
权重约 168GB(fp8+fp4),多 GPU 必需;官方 convert.py 张量并行(示例 MP=4);DeepSeek Harness 0.1.1 原生支持;SGLang 跟进适配;DGX Spark 版本即将推出;API 与 V4-Flash 同价($0.44/$1.32 peak,cache hit $0.014)
⚠️ "Exp" 实验版,官方建议谨慎用于生产;所有 benchmark 为厂商自报(DeepSeek Harness),无独立验证、无技术报告;FIM 补全不支持;Cybergym 较文本版轻微回归。
社区评价
DeepSeek 从纯文本向多模态 Agent 体系转型的标志;"连眼睛也一起交出来了";MIT 协议+完整推理代码,多模态 Agent 研发门槛大降
优化生态
官方最小化 PyTorch 推理实现(视觉编码器+Aligner+DFlash+MoE+Hyper-Connections+DSpark);Prompt Encoding 参考实现+等价测试;权重转换脚本;DeepSeek Harness 0.1.1;SGLang 适配中;DGX Spark 版将出
2. 腾讯 Hy4 Preview腾讯混元
社区许可Agent/编程
开源时间
2026-08-28(Hy3 295B/21B 为上一代,2026 早前开源)
开源地址
GitHub Tencent-Hunyuan | HF tencent | 混元官网 hy.tencent.com
架构细节
770B 总 / 49B 激活 MoE1M 上下文;定位"为生产力而生"
能力规格
Agent 与编程为主打;163 名专家、203 个工程任务内部盲测领先;超大上下文长文档/长程任务
部署
大显存多卡集群;腾讯云托管;社区整合包
社区评价
腾讯开源回归第一梯队;与 DeepSeek V4、Qwen3.8 同台竞争国产开源旗舰
⚠️ 许可以官方仓库为准(混元系历史用腾讯社区许可,大规模商用需读协议)。
优化生态
社区整合包 / 多卡部署教程;腾讯云托管一键部署;MoE 调度优化(论文级方案);与 DeepSeek V4、Qwen3.8 并列的国产旗舰适配生态
3. GLM-5.3(含 5.3-Flash)智谱 AI
AA 前三MITFlash=牛来
开源时间
GLM-5.3 主模型:2026-08-14 发布,权重 2026-08-28 开源;GLM-5.3-Flash:2026-08-26 直接开源
开源地址
HF zai-org(GLM-5.3 / GLM-5.3-Flash)| GitHub zai-org | ModelScope
架构细节
  • GLM-5.3(主):744B 总 / 40B 激活 MoE,与 5.2 同基座,纯后训练 Scaling;1M 上下文、最大输出 128K;目前纯文本
  • GLM-5.3-Flash:320B 总 / 18B 激活 MoE,首个原生多模态 GLM-5(文本+图像→文本);混合注意力 MLA + DSA 稀疏注意力 + KDA 线性注意力;45 层语言模型 + 24 层视觉编码器;FP8 权重约 328GB;1M 上下文
评测/排行
  • GLM-5.3 主:开源/即将开源模型中多项基准第一,编程能力较 5.2 +50%,社区称超越 Claude Opus 4.8
  • GLM-5.3-Flash:性能追平 Claude Opus 4.8,API 价格仅约其 1/40(输入 0.8 元 / 输出 2.8 元每百万 token,上线两周半价)
身份
5.3-Flash 即刷屏匿名模型 "Ox-Alpha"(中文社区"牛来")——2026-08-20~26 匿名内测 6 天处理 23T+ tokens 才认领
部署
主模型 744B 需多卡集群;Flash FP8 328GB,官方称可在国产芯片(昇腾)上跑;BF16/FP8 双档
社区评价
编程/工程场景开源 SOTA;Flash 以 1/40 价格打 Opus 4.8,"极致性价比"刷屏;混合注意力方案引发关注
优化生态
Unsloth GGUF 动态量化(1bit 93GB / UD-Q2 109GB 保 78% / Q8 近无损;BF16 642GB);vLLM 原生支持(MoE 路由 / 张量并行 / 专家并行 / flashinfer);MTP 投机解码(--speculative-config 5 token);llama.cpp / Ollama;七牛 / 腾讯云部署教程;FP8 量化;国产算力(昇腾)适配;CodeArena 生态
4. Qwen3.8-Flash-Next(Qwen4 预览)阿里
HF 热榜第1开放权重Qwen4架构
开源时间
2026-08-26(Qwen4 架构首个开源权重预览)
开源地址
HF Qwen/Qwen3.8-Flash-Next | ModelScope | 官方模型卡
架构细节
125B 总 / 6B 激活 MoE;另含 51B N-gram 嵌入表 + 4B MTP 层;512 专家(每 token 激活 10 routed + 1 shared);Gated DeltaNet + Qwen Sparse Attention(QSA,micro-block 级稀疏);48 层混合注意力(3 块 Gated DeltaNet + 1 块 QSA 循环);多 token 预测
能力规格
  • 256K(262,144)原生上下文,可扩展至 1M(YaRN)
  • 文本 + 图像输入(多模态 MoE)
  • 面向复杂推理 / Agent 任务
评测/排行
HF Trending 第 1(❤3.8k);社区称"6B 激活打 27B"
部署
本地推理需 Ada/Blackwell 架构 GPU(RTX 40 系及以上);社区以 FP8 量化为主;vLLM 适配中
⚠️ 定位:架构实验预览版,供社区提前适配 Qwen4;生产部署应等基于此架构的 Qwen3.8-Flash 正式版
社区评价
"Qwen4 架构先行者";提前适配新推理栈的窗口期
优化生态
QSA 稀疏注意力降长上下文延迟;MTP 支持投机解码;社区量化/部署教程
5. Qwen3.8(2.4T-A95B · 27B)阿里
Apache 2.0*Max级开源
开源时间
Qwen3.8-2.4T-A95B(2026-08-12,首个 Qwen-Max 级开源)| Qwen3.8-27B(2026-08-14,原生视觉语言)
开源地址
HF Qwen | GitHub QwenLM | ModelScope
架构细节
  • Qwen3.8-2.4T-A95B:2.4T 总 / 95B 激活 MoE,旗舰级(对标 Qwen-Max)
  • Qwen3.8-27B:27B dense,原生视觉语言模型(文本+图像+视频理解)
能力规格
262K 上下文;27B 支持多模态理解;2.4T 旗舰面向 Agent/长上下文/中文最强
评测/排行
Qwen3.8-2.4T 为开源梯队第一档;27B 代码/Agent 均衡、消费级可跑(Q4 约 17GB)
⚠️ 许可注意:Qwen3.8-27B 为 Apache 2.0Qwen3.8-2.4T-A95B 为自定义 revenue-gated 许可(非 Apache,高营收商用需注意门槛)。
社区评价
"首个 Max 级权重开源"引发关注;阿里"中低端开源、顶端开放权重(有条件)"路线
优化生态
unsloth GGUF / UD 动态量化(27B Q4 约 17GB);社区蒸馏生态(Qwen3.8-9B、Qwen3.8-Distilled-4B-NPU2 等);llama.cpp / Ollama / LM Studio / vLLM / TGI / TensorRT-LLM 全系支持;AWQ 4bit;vLLM 官方推理命令(TP4 / qwen3 reasoning parser / auto tool);Prompt 缓存 + 批处理 + 流式优化栈;LoRA 微调生态成熟
6. Ling-3.0-tiny蚂蚁百灵
端侧AgentMIT轻量MoE
开源时间
2026-08-11
开源地址
HF 蚂蚁百灵组织(Ling-3.0-tiny)| 官方三档权重
架构细节
7.9B 总 / 1.3B 激活(轻量级混合推理 MoE,Kimi 系技术路径)
能力规格
面向高效本地 Agent / 低成本部署;推理计算量极低(每 token 仅激活 1.3B)
评测/排行
社区称"1.3B 激活硬刚 26–31B";紧咬同规格更大模型(第三方实测口径)
部署
官方提供 BF16 / FP8 / INT4 三版本;已验证 Mac mini、M4 Pro MacBook、DGX Spark 可跑
许可
MIT
社区评价
端侧轻量 Agent 新选择;生态较新,LoRA/量化生态成熟度待观察
优化生态
官方三档权重适配多平台;社区部署教程
7. Meta Muse GlimmerMeta Superintelligence Labs
本地AgentApache 2.0单卡
开源时间
2026-08-10
开源地址
HF meta-models/Muse-Glimmer-30B(含 GGUF 转换)| llama.cpp / ExecuTorch / MLX 生态
架构细节
~29.6–30B dense(含 1.8B 视觉编码器);混合注意力(sliding-window 注意力块与全注意力交错);causal LM + 专用 perception encoder(图像/视频输入)
能力规格
  • 本地 Agent:规划 / 调用工具 / 从错误中自我恢复
  • 131,072(128K)上下文;多模态(图/视频理解)
评测/排行
AA Intelligence Index 35(比 Llama 4 Maverick 高 21 分、比同尺寸 Gemma 4 高 5 分)
部署
24GB 消费级 GPU(4-bit <20GB)或 M4/M5 Max Mac;DFlash 投机解码 RTX 5090 ~233 tok/s;Ollama / LM Studio / vLLM / Together / Fireworks day-0
许可
Apache 2.0,无 Llama 式 MAU 上限——商业嵌入零门槛;Muse Spark(旗舰)仍闭源 API,Glimmer 是权重可拥有版
社区评价
Meta 以 Apache 2.0 重返开源;端侧 Agent"小钢炮";Muse Spark 1.2 权重将跟进
优化生态
GGUF k-quants + ExecuTorch + 4-bit;llama.cpp / Apple MLX / vLLM;TorchTitan 微调
8. Ling-3.0-flash蚂蚁百灵
AA 38MIT智效比13.2
开源时间
2026-08-08(7-24 发布 API,8-5 ModelScope 上架,8-8 正式开源权重)
开源地址
HF 蚂蚁百灵组织(Ling-3.0-flash)| ModelScope | developer.ant-ling.com
架构细节
124B 总 / 5.1B 激活 MoE(专家激活比例 1/64,上代 1/32);原生混合推理模型;FP8/FP4/INT4 多精度版本
能力规格
推理/Agent 任务;以 1/12 算力对标上代 1T 旗舰 Ring-2.6-1T;低成本部署
评测/排行
AA 智能指数 38(较上代 Ling 2.6 Flash +24 分);追平 MiMo-V2.5 和 Qwen3.6 27B;智效比 13.2;全方位对标甚至超越上代 1T 旗舰 Ring-2.6-1T
部署
官方提供 BF16/FP8/FP4/INT4 多版本;量化版本可单台机器跑;API 调用 + 自部署 + 微调三种落地选择
许可
MIT
社区评价
"1/12 算力跑出旗舰性能";小身板大能量;从限时免费 API 到全面开源自部署
优化生态
官方多精度权重;ModelScope/HF 双平台;社区量化部署教程;蚂蚁百灵开发者生态
9. Kimi K3月之暗面 Moonshot
全球最大开源开放权重3T级
开源时间
2026-07-27(发布 07-16/17,按承诺 11 天后全量开源)
开源地址
HF moonshotai/Kimi-K3 | GitHub MoonshotAI | kimi.com
架构细节
2.8T 总 / 1040B(104 亿)激活 MoE;896 路由专家、每 token 激活 16;KDA(Kimi Delta Attention 线性注意力)+ Gated MLA 混合(约 3:1) + Attention Residuals(AttnRes)+ Stable LatentMoE;93 层、hidden 7168、max 位置 1M
能力规格
原生图文视频理解;1M 上下文;Agentic / 长程任务
评测/排行
GPQA Diamond 93.5%(接近 GPT-5.6 Sol);FrontierSWE 81.2%(高于 GPT-5.6 Sol 的 71.3%);SpreadsheetBench 2 领先;编程评测登顶
部署
MXFP4 量化感知训练权重(仅权重约 1.4TB);官方建议 64 卡以上超节点;本地部署约 200 万元起(8×H200 集群约 2800-3000 万元)
许可
开放权重(License 以官方仓库为准)
社区评价
全球首个 3T 级开源模型;开源半小时登顶 HF 刷新平台纪录;"中国的 Fable 5 时刻";阿里、华为等厂商首日适配
优化生态
权重 + 47 页技术报告 + MoonEP / FlashKDA / AgentEnv 三大训练 Infra 同步开源;MXFP4 量化感知训练;KDA 线性注意力降长上下文推理开销
10. 美团 LongCat-2.0美团
SWE超GPT-5.5MIT国产卡推理
开源时间
2026-06-30 发布,2026-07-06 完全开源(MIT);曾化名 Owl Alpha 在 OpenRouter 跑了两个月
开源地址
HF meituan | GitHub meituan | 美团技术团队 tech.meituan.com
架构细节
1.6T 总 / 48B 激活 MoE(动态激活 3B-56B);LongCat 稀疏注意力 + N-gram Embedding;原生 1M 上下文;Agentic Coding 定位
能力规格
真实 Agentic Coding 任务;代码理解/生成/执行;1M 长上下文;国内首个完全开源的超大规模 MoE
评测/排行
SWE-bench Pro 超越 GPT-5.5(国内大厂首个);化名 Owl Alpha 期间在 OpenRouter 表现亮眼;编程/Agent 场景为核心卖点
部署
业界首个在五万卡国产算力集群上完成推理的万亿参数模型;同步开放国产卡推理代码;针对显存与带宽受限的国产芯片深度协同优化;MIT 无使用限制
⚠️ 发布后存在"智能体能力翻车"争议(部分实测未达宣传水平),benchmark 与真实场景表现有差距,建议以官方技术报告+独立实测交叉验证。
社区评价
"国产算力炼出的万亿参数 Agentic 大模型";MIT 完全开源+国产卡推理是最大亮点;SWE-bench Pro 超 GPT-5.5 引发关注,但也有实测争议
优化生态
国产卡推理代码同步开源;LongCat 稀疏注意力降长上下文开销;N-gram Embedding 提升 Token 级表示;美团技术团队工程优化;模芯协同
11. MiniMax M3MiniMax
原生多模态开放权重*1M上下文
开源时间
2026-06-01 发布 → 2026-06-12 开源权重(HF + ModelScope)
开源地址
HF MiniMaxAI/MiniMax-M3 | ModelScope | GitHub | MSA 技术论文
架构细节
428B 总 / 23B 激活 MoEMSA(MiniMax Sparse Attention)稀疏注意力(长上下文计算量压到常规 1/3);首个从 Step 0 做多模态混合训练的开源模型
能力规格
原生多模态(文本+图像等);1M 上下文;Agentic Coding / 超长文档 / 私有化部署
评测/排行
SWE-Bench Pro ~59%(开源第一梯队);Swaybench Pro / SVG Bench / Kernel Bench Hard 优于 Opus 4.7;AA 综合智能指数全球开源最高排名
部署
API 输入 $0.30 / 输出 $1.20 每百万 token(约闭源 1/10);支持私有集群部署 + LoRA/QLoRA 微调;M3-highspeed 快速版
⚠️ 许可需核验:MiniMax 系 Apache 2.0 历史;M2.7/M3 新开源协议可能含商用限制,以官方仓库为准。
社区评价
国产首个原生多模态旗舰开源;代码能力追平国际顶尖;开源当天 HF 下载 5 万+、GitHub 24h 千星
优化生态
MSA 稀疏注意力降长上下文成本;LoRA/QLoRA 微调;GPUStack / Transformers 部署教程;自动 Cache
12. DeepSeek V4(Pro / Flash)DeepSeek
LiveCodeBench 93.5MIT1M上下文
开源时间
2026-04-24(预览版同步开源,官方模型卡 PDF)
开源地址
HF deepseek-ai | GitHub deepseek-ai | ModelScope | 官方模型卡 fe-static.deepseek.com
架构细节
MoE:Pro 1.6T/49B 激活、Flash 284B/13B 激活;MTP 多 token 预测;CSA+HCA 混合注意力(KV 缓存序列维压缩 + DeepSeek Sparse Attention + 重度压缩密集注意力,长上下文效率大提升);mHC 流形约束超连接(Birkhoff 多胞形);Muon 优化器
能力规格
  • 1M token 上下文;三种推理模式:Non-Think / Think High / Think Max
  • 预训练数据 33T tokens(Pro);纯文本 + 三推理档
评测/排行
LiveCodeBench 93.5 | Codeforces 3206 | MMLU-Pro 87.5 | SWE-bench Verified 80.6% | Agent Score 1554(超 Kimi K2.6 的 1484)
部署
华为昇腾首发适配(首次国产芯片扛旗舰);官方称推理成本 -75%、显存占用 -90%;vLLM / SGLang 生态跟进
社区评价
"百万上下文时代的开源宣言";GPT-5.5 同日发布,V4 用 1/8 价格对标;从追赶者到规则制定者
优化生态
昇腾 CANN 全链路:FP8+INT4 分层混合量化(体积 1/4、2×910B 跑 Pro);众智 FlagOS Day-0(1.6T & 284B 八芯适配、8/16 卡脚本、权重反量化工具);社区 DwarfStar 本地推理引擎(antirez,Metal/CUDA/ROCm);腾讯云 SGLang 量化 +3.9× 成本 -50%;vLLM DualPath / llama.cpp / GGUF / Ollama
13. Kimi K2.6月之暗面 Moonshot
SWE-Bench Pro 58.6%Apache 2.0*300子Agent
开源时间
2026-04-20(8 天预览后正式开源上线)
开源地址
GitHub MoonshotAI | HF moonshotai | kimi.com
架构细节
1T 总 / 32B 激活 MoE;384 路由专家 + 1 共享专家,每 token 激活 8;61 层;MLA 注意力;MuonClip 稳定训练;内置 400M MoonViT 视觉编码器,原生文本+图像+视频
能力规格
256K(262,144)上下文每集群最多 300 子 Agent 并行;12 小时长程运行;多文件编辑/终端操作/复杂工具链
评测/排行
SWE-Bench Pro 58.6% | Agent Score 1484 | 博士级"人类最后考试"领先 | 长周期高难度编程 Agent 场景领先
部署
大显存多卡;vLLM / SGLang
社区评价
最强开源原生多模态 Agent 模型;"12 小时运行"生产级;长程编码标杆
⚠️ K2 系 Apache 2.0;K2.6 具体许可以官方仓库为准。
优化生态
Ollama 直接支持(kimi-k2.6 标签);与 K2.5 架构一致可平滑升级;Bittensor 蒸馏子网 Distil-SN97(社区竞争蒸馏);社区三推理引擎部署指南;INT4 compressed-tensors 封装;300 子 Agent 编排 / Agent OS 工具链
14. MiniMax-M2(含 M2.7)MiniMax
AA 全球前五Apache 2.0*极致参数效率
开源时间
M2(2025-10-27 发布开源)| M2.7(2026-04-12)
开源地址
GitHub MiniMax-AI/MiniMax-M2(已确认)| HF MiniMaxAI/MiniMax-M2 | arXiv 2605.26494
架构细节
229.9B 总 / 9.8B 激活;62 层 decoder-only;256 细粒度专家 + sigmoid gating;GQA;192K 原生上下文;MTP 多 token 预测
能力规格
Agent / 代码 / 多文件编辑 / 终端操作 / 复杂工具链;M2.7 主打"自进化"概念与办公/Agent 协作
评测/排行
Artificial Analysis 全球前五;8% 价格、2 倍速度(对比 Claude Sonnet);代码智能逼近最强闭源
部署
10B 激活性价比极高;SGLang / vLLM 推荐;沐曦国产 GPU Day-0 适配(M2.7)
⚠️ 许可注意:M2 为 Apache 2.0;M2.7 采用新开源协议,商业用途需 MiniMax 书面授权
社区评价
"10B 激活实现 230B 性能"的极致参数效率;Agent 场景口碑好
优化生态
Unsloth 22 个 GGUF 量化(1-8bit,4bit 108GB 可跑 128GB 设备);AWQ + QLoRA 微调(DGX Spark Blackwell 实测);SGLang / vLLM;沐曦国产 GPU Day-0(vLLM≥0.13);Agent 工具链 / 多文件编辑生态;本地部署教程
15. Google Gemma 4Google DeepMind
Arena 1452Apache 2.0边缘部署
开源时间
2026-04-02(四款齐发);技术报告 2026-06-19
开源地址
HF google(gemma-4-31b / 26b-a4b / 12b / e4b / e2b)| ai.google.dev/gemma | DeepMind 官方页
架构细节
dense + MoE 家族:31B dense、26B A4B(3.8B 激活 MoE)、12B Unified dense、E4B、E2B;12B 用 35M 轻量视觉嵌入器替代传统 550M 视觉编码器(图片切 48×48 patch 当 token 直接进 Transformer);多 token 预测
能力规格
  • 原生多模态(文本+图像+音频理解/生成);2M 上下文(宣传口径)
  • 思考 / 无思考双模式
评测/排行
Arena AI:31B=1452 / 26B=1441 | MMLU 31B 88.4% | BigBench Extra Hard 74.4% | AIME 2026 89.2% | LiveCodeBench 80% | GPQA Diamond 84.3% | τ2-bench 86.4%
部署
E2B/E4B 端侧;12B 消费级(M5 Mac 16GB 可跑,32GB 更流畅);QAT 量化 12B ~7GB 质量近无损
社区评价
Google 称"最强开源",Nathan Lambert 评价"rivals Qwen3.5(匹敌非超越)";6 项 benchmark Qwen 赢 4 项,但边缘部署无对手;30B 级最强多语言+多模态+边缘
优化生态
LiteRT / Keras;ollama / llama.cpp;QAT 量化;Android 端侧

图像大模型 · 2026 开源一览表

聚焦 2026 年发布、权重可下载的图像生成模型。点击表头可排序。(带 ⚠️ gated 的仓库需登录 HF 接受许可,非死链)
模型厂商开源时间参数许可排行亮点核心标签规格开源地址
SenseNova U1.5
商汤
商汤2026-08-218B MoTApache 2.08B 对标闭源moT原生4KHF
Krea 2(RAW / Turbo)
Krea AI
Krea AI2026-06-22/23权重公开Krea 社区许可AA 独立实验室第1krea美学/2sGitHub / HF
Ideogram 4.0
Ideogram
Ideogram2026-06-03权重非商用DesignArena 开源第1ideogram文字之王GitHub
Cosmos3-Super-T2I
NVIDIA
NVIDIA2026-06-0164B(32B+32B)OpenMDW-1.1AA 开源第1 · Elo 1219cosmos物理AIHF / GitHub
HiDream-O1-Image
智象未来
智象未来2026-05-08MITAA 开源第2 · Elo 1183hidream无VAEGitHub / HF
ERNIE-Image
百度
百度2026-04-15Apache 2.0OneIG-ZH 0.554ernie中文指令HF / GitHub
SenseNova U1
商汤
商汤2026-04-288B MoTApache 2.08B 对标闭源sensenova原生4KGitHub
Wan2.7-Image
阿里
阿里2026-04Apache 2.0wan照片级HF
Qwen-Image 2.0
阿里
阿里2026-02-1020BApache 2.0AI Arena 开源最强qwen中文渲染HF / GitHub
FLUX.2 klein 4B/9B
Black Forest Labs
Black Forest Labs2026-01-194B / 9B4B:Apache 2.0flux亚秒级HF
GLM-Image
智谱 + 华为
智谱 + 华为2026-01-14MITCVTG-2K 文字第1glm自回归+扩散HF / GitHub
Qwen-Image-2512
阿里
阿里2025-12-3120BApache 2.0AI Arena 开源最强qwen中文渲染HF / GitHub
id="img-detail">

图像生成 · 逐模型详情

统一字段模板:基本信息 → 架构细节 → 能力规格 → 评测/排行榜 → 部署 → 许可 → 社区评价 → 优化生态
1. SenseNova U1 / U1.5商汤
8B 对标闭源Apache 2.0原生4K
开源时间
U1:2026-04-28;U1.5 Lite:2026-07-31 Preview → 2026-08-21 正式版
开源地址
GitHub OpenSenseNova/SenseNova-U1 | HF sensenova/SenseNova-U1.5-8B-MoT | ModelScope | sensetime.com
架构细节
NEO-Unify:去掉视觉编码器和 VAE,像素与文本同一 Transformer 原生共存;U1.5 为 8B MoT(Mixture of Tokens);U1 另有 A3B 版(38B 总 / 理解 3B + 生成 3B 激活 MoE);U1.5 按文字/美学/编辑训练专家后蒸馏融合
能力规格
  • 原生 4K 图像生成;3–4k 字符超长指令(两千字指令一字不落)
  • 图像编辑:Bounding Box / Visual Marker / 单图多图参考
  • 图像理解:OCR / 图表解析 / 多图对比
评测/排行
8B 达商业闭源生成与编辑质量;效果对标 GPT-Image-2;指令遵循与编辑保持度超越同量级(商汤自测 2026-08-30 对比表)
部署
8B 单卡可部署;GGUF 量化后更低;注意:3K/4K 显存压力大(社区实测两张 4090D 才较稳),1K 文字偏糊、2K 内容偶不全
社区评价
"终结缝合时代";"8B 小模型搞定 4K + 两千字指令";海外社区广泛讨论
优化生态
GGUF 量化;ComfyUI;预训练启动器/配置开源;10 家国产芯片适配;U1 Fast 信息图专用(2K,11 种宽高比)
2. Krea 2(RAW / Turbo)Krea AI
AA 独立实验室第1Krea 社区许可美学/2s
开源时间
2026-05-12 公告 → 05-18 GA → 2026-06-22/23 开放权重(同日发布技术报告)
开源地址
GitHub krea-ai/krea-2 | HF(Krea 2 RAW / Turbo 双 checkpoint)| krea.ai | FAL / ComfyUI / AWS / GCP
架构细节
12B 扩散 Transformer(DiT)完全从零训练(首个自研基础模型,非基于 FLUX 微调,Krea 1 才与 BFL 合作);文本编码器用 Qwen3-VL 多层特征聚合;两个 checkpoint:RAW(未蒸馏基础版,供 LoRA/后训练)+ Turbo(8 步蒸馏,约 2s 生成 2K)
能力规格
  • 美学优先("最美学开源图像模型");风格迁移 / 创意控制
  • "creativity" 参数:在字面提示遵循与模型自由度之间可调
  • 擅长胶片颗粒、金属表面、运动模糊、虹彩质感、微距细节
  • Turbo:8 步生成 2K 约 2 秒
评测/排行
  • Artificial Analysis 文生图 —— 独立实验室 #1
  • 第三方评测"120 亿参数登顶全球前十"
部署
Turbo 8 步 2K 约 2s;13B 参数 BF16 约 24GB 级,量化可更低;推荐工作流:RAW 上训 LoRA → Turbo 推理
社区评价
"美学优先颠覆 AI 绘图";独立实验室最强;从 FLUX 微调转向自研的标杆
⚠️ 许可注意:Krea 2 Community License(社区许可)——个人/小团队可商用;企业超 50 席位需另行购买商业许可。非 Apache/MIT。
优化生态
RAW(LoRA 微调)+ Turbo(推理)双 checkpoint;ComfyUI 原生(Floyo 2 workflows);FAL / AWS / GCP / Nous Research(Hermes)接入
3. Ideogram 4.0Ideogram
DesignArena 开源第1权重非商用文字之王
开源时间
2026-06-03
开源地址
GitHub ideotom/ideogram4 | HF 开放权重 | ideogram.ai
架构细节
完全单流 DiT(34 层 Transformer,文本+图像 token 统一序列,无独立分支);文本编码器用 Qwen3-VL-8B-Instruct 视觉语言模型(提取 13 个中间层 hidden states);从零训练
能力规格
  • 原生 2K 输出
  • 结构化 JSON 提示接口:指定文本位置、边界框布局、16 进制调色板
  • 英文 OCR 准确率 0.97;海报/标识/Logo"首生即用"
评测/排行
  • DesignArena 全球第 4、开源第 1
  • 专业盲测排版偏好率 47.9%(Gemini 3.1 Pro 30%、FLUX.2 15.5%)
  • SpatialGenEval 空间推理优秀
部署
NF4 量化版单张 RTX 4090 可跑;标准版 24GB 级
社区评价
彻底解决"AI 生图写字难";设计师圈强烈反响;"93 亿参数打爆 800 亿"(指文字能力)
⚠️ 许可注意:多数信源为权重非商用许可 + 推理代码 Apache 2.0;部分信源称 Apache 2.0。商用前必须核对官方仓库。
4. Cosmos3-Super-Text2ImageNVIDIA
AA 开源第1 · Elo 1219OpenMDW-1.1物理AI
开源时间
2026-06-01(随 Cosmos 3 全家桶发布)
开源地址
HF nvidia/Cosmos3-Super-Text2Image | GitHub NVIDIA/Cosmos | 技术报告 research.nvidia.com/labs/cosmos-lab/cosmos3
架构细节
64B = 32B reasoner + 32B generator;Mixture-of-Transformers(MoT)——自回归 Transformer 处理文本 + 扩散 Transformer 处理连续模态,mRoPE + 多模态注意力层统一语言/图像/视频/音频/动作
能力规格
  • Agentic 文生图(带推理规划)
  • 物理一致性专为机器人/自动驾驶合成数据设计
  • 物理基准:Unigraph ~91.3、前项动力学 26、Nano Policy 39.7
评测/排行
  • Artificial Analysis T2I Arena 开源权重第 1(Elo 1219,2026-07 快照)
  • 8 项物理 AI 基准开放模型排名第 1
部署
64B 需数据中心(8×H100/H200/GB200);另有 Cosmos3-Nano 16B 单 GPU 可跑(Project DIGITS GB10 实测);推理栈 PyTorch / vLLM-Omni / Diffusers / NIM
社区评价
物理 AI"核弹"级发布;机器人/自动驾驶首选;普通创作者门槛过高
优化生态
代码+权重+合成数据集+评估基准全开源;Cosmos Coalition 联盟;Nano/Edge 轻量档
5. HiDream-O1-Image智象未来
AA 开源第2 · Elo 1183MIT无VAE
开源时间
2026-05-08(Dev-2604 于 05-14 追加开源)
开源地址
GitHub HiDream-ai/HiDream-O1-Image | HF HiDream/HiDream-O1-Image(gated 需登录接受许可) | ModelScope | hidreamai.app
架构细节
UiT(Unified Transformer)——像素级统一 Transformer,彻底抛弃 VAE 和分离式文本编码器,像素/文本/task 条件共享 token 空间端到端建模;RMSNorm+SwiGLU+RoPE;隐藏层 4096、注意力头 32
能力规格
  • 最高 2048×2048 原生 2K
  • 单一模型完成:文生图 + 指令编辑 + 主体个性化 + 多镜头
  • 内置 prompt_agent.py 自动扩提示词;中文长文渲染接近完美
评测/排行
  • GenEval 0.90 —— 开源第 1(超 GPT Image 2 的 0.89)
  • HPSv3 10.37(超 GPT Image 2);DPG-Bench 89.83
  • AA Arena 全球第 8 / 开源第 2(2026-05);1.5 版升至中国第 1、全球第 2(2026-06)
部署
8B 消费级 GPU 可跑;FP8 版 RTX 40xx/H100 加速;Distilled 28 步推理速度翻倍
社区评价
上线 6 天 3000+ 赞;"没有 VAE 的革命性架构";8B 性价比之王;复杂提示词偶尔需手动细化
优化生态
ComfyUI 官方教程;Diffusers;FP8 量化;IP 加速(layout/skeleton conditioning);Dev editing scheduler
6. ERNIE-Image百度
OneIG-ZH 0.554 追平闭源Apache 2.0中文指令
开源时间
2026-04-15
开源地址
HF baidu/ERNIE-Image | GitHub baidu/ernie-image | ernie-image.github.io | arXiv 2605.25347
架构细节
8B 单流 DiT 骨干 + 3B Prompt Enhancer(PE);采用 FLUX.2 VAE;两档:SFT 版(50 步,guidance 4.0)+ Turbo 版(8 步,DMD+RL 蒸馏,6× 更快)
能力规格
  • 1024² 默认;832×1216 / 1216×832;分辨率 64–2048(步长16)
  • 最大 prompt 2048 字符;中英日图内文字渲染
  • 结构化输出(海报/漫画/多格分镜);多元风格
评测/排行
  • OneIG-ZH 0.554 —— 开源第 1,与闭源 Seedream 4.0 总分持平
  • LongText-Bench 中文长文本领先;GenEval 0.8667(Turbo w/o PE)
  • 复杂指令遵循强于 Qwen-2512 / Z-Image(第三方实测)
部署
BF16 ~16–29.5GB;GGUF Q8_0 ~15GB;24GB(RTX 4090)单卡流畅;Turbo 8 步数秒/张,SFT 50 步约 4s/张
社区评价
"最懂中文的文生图模型";8B 叫板 Nano Banana 2.0 与 Seedream 5.0
优化生态
ComfyUI Day-0;Diffusers;SGLang;ControlNet/IP-Adapter 管线;Unsloth GGUF;LiblibAI;国产算力适配
7. Wan2.7-Image阿里
Apache 2.0照片级
开源时间
2026-04(随 Wan2.7 全家桶)
开源地址
HF Wan-AI/Wan2.7-Image(gated 需登录接受许可) | ModelScope | 阿里云百炼 API
架构细节
14B(27B 总 / 14B 激活 MoE);MoE DiT + 流匹配;与 Wan2.7 视频共享骨干
能力规格
  • 标准 2048×2048(2K);Pro 版 4096×4096(4K)
  • 统一文生图 + 图像编辑
  • thinking mode(链式推理)默认开启——先思考再生成
评测/排行
开源照片级真实感第一梯队;Artificial Analysis 相关榜单前列
部署
14B 24GB+;32GB+ 系统内存;thinking mode 显著增加耗时
社区评价
照片级真实感强;复杂指令遵循佳
优化生态
ComfyUI;LoRA;社区 4K 工作流
8. Qwen-Image 2.0 / 2512阿里
AI Arena 开源最强Apache 2.0中文渲染
开源时间
2512:2025-12-31(基准);2.0:2026-02-10
开源地址
GitHub QwenLM/Qwen-Image | HF Qwen/Qwen-Image-2.0(gated 需登录接受许可) / Qwen-Image-2512 | ModelScope | arXiv:2605.10730
架构细节
~7B(第三方口径);MMDiT 骨干 + Qwen2.5-VL 7B 文本编码器(编辑路径)
能力规格
  • 原生 2048×2048(2K);2512 支持 2512² 以上
  • 1000 token 长提示词;专业排版;生成+编辑统一
  • 2512 重点:更真实人像、更细纹理、更强文字渲染
评测/排行
  • 2512:AI Arena 最强开源文生图(10,000+ 轮盲测)
  • 2.0:DPG-Bench 88.32;AI Arena 文生图+编辑双榜第一;DataLearner 1139 分
部署
2512:FP16 21.3GB / INT8 13.7GB(30 步 FP16 142.6s / INT8 87.9s);2.0:12–16GB;GGUF 量化 6GB 可跑
社区评价
开源中文文生图第一选择;中文提示词理解强(无需翻译式写法);生态成熟
优化生态
GGUF 多档量化(含 uint4 信创方案);ComfyUI;LoRA;FP16/INT8 实测
9. FLUX.2 klein 4B / 9BBlack Forest Labs
4B: Apache 2.09B: FLUX 许可亚秒级
开源时间
2026-01-19
开源地址
HF black-forest-labs/FLUX.2-klein | bfl.ai | ComfyUI 官方文档
架构细节
整流流(Rectified Flow)Transformer,蒸馏 4 步;版本矩阵:4B/9B × Base/蒸馏 + 9B FP8
能力规格
1024–2048;文生图 + 图像编辑 + 多参考合成统一(最多 4 张参考图);单模型 All-in-One
评测/排行
ELO ~1066(FLUX.2 Pro ~1170 为闭源对照)
部署
4B:13GB(8GB 显存+16GB 内存可跑);9B:29GB(16GB+32GB);9B FP8 更低;蒸馏版 4 步 0.5–1.2s 亚秒级
社区评价
消费级 GPU 实时生成首选;"AI 绘图万能工厂";电商视觉提效
优化生态
ComfyUI day-0;unsloth GGUF;FP8/NVFP(与 NVIDIA 合作);LoRA;Nunchaku 4-bit(提速 3–5×);9B KV 多图融合
10. GLM-Image智谱 + 华为
CVTG-2K 文字第1MIT自回归+扩散
开源时间
2026-01-14
开源地址
HF zai-org/GLM-Image | GitHub zai-org/GLM-Image | ModelScope | 昇腾社区
架构细节
16B = 9B 自回归(GLM-4-9B 基础)+ 7B DiT 扩散解码器;Semantic-VQ 语义离散化 token;GRPO + Flow-GRPO 强化学习;华为昇腾 Atlas 800T A2 + 昇思 MindSpore 全流程训练(首个国产芯片训练 SOTA 多模态)
能力规格
  • 上下文 4K;模型文件 35.8GB
  • 海报/PPT/科普图等知识密集型场景;"认知型生成"范式
  • 图生图全家:编辑/风格迁移/身份保持/多主体一致性
评测/排行
CVTG-2K 文字渲染 0.9116 第 1;DataLearner 1013 分;首个开源工业级离散自回归图像生成
部署
推理速度与消费级同级别相当;GQA + Flash Attention;API 单图约 0.1 元
社区评价
知识密集型任务优势明显;国产全栈算力验证里程碑
优化生态
权重+训练代码+评估脚本全开源;GQA+Flash Attention;昇腾国产算力验证

视频生成 · 2026 开源一览表

点击表头可排序。
模型厂商开源时间参数 / 架构许可排行榜亮点显存核心标签开源地址
LTX-2.5
Lightricks
Lightricks2026-0822B 非对称双流LTX 许可速度第一梯队32–80GB4K/原生音画HF
MAGI-2 Preview
Sand.ai
Sand.ai2026-08-05114B / 6B 激活 MoEApache 2.0AA I2V 第68×H100(307GB)千亿MoE官网
MiniMax H3
MiniMax
MiniMax2026-07-31/08-0333B DenseH3 社区许可开源第一梯队~130GB原生音画HF / GitHub
LingBot-Video
灵波智能
灵波智能2026-071.3B / 30B-A3B待核具身视频新玩家消费级机器人待核
Cosmos3-Super-Image2Video
NVIDIA
NVIDIA2026-06-0164B · MoTOpenMDWAA I2V 开源第1数据中心物理AIHF
MAGI-1
Sand.ai
Sand.ai2026-044.5B / 24BResearch首个主流自回归视频24GB+/多卡无限长度GitHub
Wan2.7
阿里
阿里2026-0414B MoE(27B总)Apache 2.0AA T2V 首发 Elo 1762
I2V Elo 1090
24GB+全家桶HF / GitHub
LTX-2.3
Lightricks
Lightricks2026-0322BLTX 许可4K 原生音画24–32GB22B 双流HF
SkyReels V2
昆仑万维
昆仑万维20261.3B / 14BApache 2.0开源 I2V 最高分14.7–51GB无限长度GitHub

视频生成 · 逐模型详情

统一字段模板同上。
1. LTX-2.5 / 2.3Lightricks
速度第一梯队LTX 许可4K/原生音画
开源时间
LTX-2.3:2026-03;LTX-2.5:2026-08
开源地址
HF Lightricks/LTX-2.5 / LTX-2.3 | ltx.io | ComfyUI-LTXVideo | LTX Studio
架构细节
22B 非对称双流扩散 Transformer(双向交叉注意力);2.5 新增:新扩散视频解码器(替代 VAE,面部/纹理/文字更清晰)、自定义 Gemma 4 12B 文本编码器、Prompt enhancer、Duration predictor
能力规格
  • 原生 4K(3840×2160);Auto Duration
  • 24/25/48/50fps;原生同步音频(单模型 pass 音视频同生)
  • T2V / I2V / 首尾帧;竖屏 1080×1920 原生训练
评测/排行
速度:1080P 5s 约 50s 生成;8s 视频 57s;2K 视频 47s;ltx.dev 称业界首个实时(2–4s)视频模型
部署
32GB(FP8),80GB 推荐;社区 8G 显存整合包可跑
社区评价
速度快但提示词遵从度一般、复杂人物动作/手部/多人交互易崩;适合过场素材/大场景/无远距离人像
优化生态
ComfyUI day-0(dev+distilled);LTX Studio;原生 macOS 应用;HF 下载 79 万/月;IC-LoRA(HDR);物理仿真 checkpoint
2. MAGI-2 PreviewSand.ai / 清华系
AA I2V 第6Apache 2.0千亿MoE
开源时间
2026-08-05
开源地址
GitHub(MAGI 系列)| HF | magi-1.ai | SGLang PR #35014 | Sand.ai 博客
架构细节
114B 总 / 每 token 激活约 6B(MoE);宽度 3072,路由 12 heads × 256 维,每 head 256 专家 / Top-6 激活,专家 FFN 256→1280→256(fused SwiGLU);40 层单流 Transformer + 36 层细粒度 MoE;统一音视频生成;推理优化 Head Parallel + MagiMoE
能力规格
时长 10s1080P(先 512×896 再 refiner 至 1088×1920);联合生成视频+音频;文本或文本+首帧输入;运镜/对焦/人物表现达闭源第一梯队
评测/排行
Artificial Analysis Image-to-Video 榜第 6(2026-08 快照);全球首个参数过百亿开源视频模型
部署
8 张 H100/Hopper,权重合计约 307GB;按 8 卡 H100 月租折算,10s 1080P 推理成本约 0.5 元/条
⚠️ 注意:6B 激活 ≠ 6B 小模型成本;MoE 调度开销 + 307GB 权重加载是实际门槛。
社区评价
"用得起"的千亿 MoE 视频;发布当天刷屏;"ComfyUI 生态要变天"
优化生态
SGLang 官方支持(fused_experts);ComfyUI 适配中;社区部署教程;MoE 调度优化论文级方案
3. MiniMax H3MiniMax
开源第一梯队H3 社区许可原生音画
开源时间
2026-07-31 发布 → 2026-08-03 HF 开放权重
开源地址
HF MiniMaxAI/MiniMax-H3 | GitHub MiniMax-AI/MiniMax-H3 | ComfyUI Wiki | Hailuo AI
架构细节
33B Dense 单流 Omni Transformer(约 13B 在 AdaLN 分支,推理时可预计算缓存);多模态编码器复用 Qwen3-VL-32B;系统三层:context2(闭源)+ H3-Base(开源)+ regenerate2K(超分)
能力规格
  • 时长 4–15s;最高 2K(默认短边 768);24fps
  • 原生 32kHz 立体声同一前向生成(非后配音);11 种语言
  • 输入最多 9 图 / 3 视频 / 3 音频 + 提示词(参考生成视频最强)
  • 视频编辑(精准剪辑/替换/扩展)、风格迁移;一次出 8 个
评测/排行
文生/图生视频进入开源第一梯队;视频编辑尤其亮眼;"完整镜头生成工具"
部署
33B 全模型约 130GB(Mac M5 Max 实测可跑);bf16/INT8/pruned/NVFP4 多档;社区 8G 整合包(量化)可跑;API $0.13/s
社区评价
"这次真不是吹的";保真度有短板(特殊生物外观 2 秒后跑偏变普通老虎);开源一周衍生近 300 个模型、ComfyUI 版下载逼近 700 万次,"视频模型重演 DeepSeek 的故事"
⚠️ 许可注意:H3 Community License 排除美欧商业使用,务必阅读协议。
优化生态
量化全家桶:GGUF(Q2~Q8 各档,消费级 15.6-23.9GB)+ INT4 / INT8 / MIXED / NVFP4 统一仓库(Abiray / realrebelai / DiffSynth-NF4 等);显存压缩:ComfyUI 团队裁减调制权重 + INT8 + 定制内核,最低占用 123.6GB→42.5GB,INT8 24GB 单卡按层 offload、NF4 8-12GB 可跑;推理加速:SageAttention2 / TE-Speed / TeaCache 等(潜力 2-3 倍);Turbo LoRA 采样 20 步→4-8 步;Apple Silicon 原生推理引擎(antirez);开源当天即 ComfyUI 原生支持 + 六套工作流(文生/图生/首尾帧/参考视频);设计期即适配国产芯片
4. LingBot-Video灵波智能
待核具身/机器人
开源时间
2026-07(2026 全景盘点新发布)
开源地址
GitHub / HF(以官方仓库为准)
架构细节
Dense 1.3B;MoE 30B-A3B + Refiner
能力规格
T2V / TI2V / 具身视频;物理行为、机器人、第一人称数据导向
部署
1.3B 消费级可跑;30B-A3B 需多卡
社区评价
新发布、生态成熟度待观察;具身智能研究新选择
优化生态
生态仍在早期
5. Cosmos3-Super-Image2VideoNVIDIA
AA I2V 开源第1OpenMDW-1.1物理AI
开源时间
2026-06-01
开源地址
HF nvidia/Cosmos3-Super-Image2Video | GitHub NVIDIA/Cosmos
架构细节
64B(MoT 混合 Transformer,Cosmos3 全模态世界模型一部分)
能力规格
图 → MP4;推荐 480p(832×480,16:9);默认 189 帧;物理一致性、时间连贯
评测/排行
Artificial Analysis Image-to-Video 榜开源第 1(2026-07-17 快照)
部署
64B 数据中心级(8×H100/H200/GB200);Cosmos3-Nano 16B 单 GPU;PyTorch/vLLM-Omni/Diffusers/NIM
社区评价
物理 AI 世界仿真首选;普通创作者门槛过高
优化生态
代码+权重+数据集+基准全开源;Nano/Edge 轻量档;AtomGit 镜像
6. MAGI-1Sand.ai
Research 许可自回归
开源时间
2026-04
开源地址
GitHub isl-org/MAGI-1 | HF | magi-1.ai
架构细节
自回归 + Diffusion Transformer;4.5B / 24B;24 帧/块流式生成
能力规格
无限长度(24 帧/块流式);精确秒级时间线控制;强提示遵循
部署
4.5B 单 GPU 24GB+(RTX 4090);24B 需 8×H100 或 8×4090;distill+fp8 版 4×H100 或 8×4090
社区评价
无限长度生成标杆;长叙事/纪录片场景;生成慢、分辨率选择有限
优化生态
4.5B 单卡版;24B 多卡版;distill+fp8 量化;T5+VAE 配套
7. Wan2.7阿里
AA T2V 首发 Elo 1762Apache 2.0全家桶
开源时间
2026-04(4-07 曾以匿名 HappyHorse-1.0 登 Arena 历史第一)
开源地址
HF Wan-AI/Wan2.7(gated 需登录接受许可)| ModelScope | GitHub Wan-Video(官方组织,Wan2.7 独立推理仓库未建,代码沿用 Wan2.2/diffusers)| 阿里云百炼 API
架构细节
14B MoE(27B 总 / 14B 激活);DiT + MoE + 流匹配 + T5 编码器;图像 2D VAE+空间注意力,视频因果 3D VAE+全时空注意力;另有 1.3B 轻量版
能力规格
  • 时长:默认 5–10s,最短 2s 素材续写至 15s;首尾帧控制
  • 720P/1080P;24fps 默认(15/30 可调);6 种宽高比
  • 指令式视频编辑(删物体/换背景/改风格/改光照/改运镜/重写台词带口型)
  • 声画同步(r2v 多主体可配音色);9 宫格图像转视频;动作模仿
评测/排行
  • AA T2V 首发 Elo 1762(超 LTX-2.3 Pro 1484 / HappyHorse-1.0 1446)
  • Awesome Agents I2V 榜 Elo 1090 第 4($6/min);社区编辑评分 8.5/10
部署
14B 24GB+;1.3B 8GB+;RTX 4090 可跑(FP8/GGUF);5B TI2V 720P 5s:多卡 ~155s / 单卡 ~534s
社区评价
"视频生成瑞士军刀——功能最全";"开源第一次领先商业(首发 AA 榜首)";唯一同时具备帧控制+音频同步+多参考
优化生态
ComfyUI 原生(Kijai);GGUF(INT4/INT8);LoRA 丰富;阿里云 PAI 一键部署;社区 4K 工作流
8. SkyReels V2昆仑万维
开源 I2V 最高分Apache 2.0无限长度
开源时间
2026(V1 为 2025)
开源地址
GitHub skyworkai/skyreels-v2 | HF | 社区 fork
架构细节
Diffusion Forcing + 流匹配(Wan2.1 血统);1.3B / 14B;电影级光影(好莱坞级影视数据训练)
能力规格
演示最长 60s(1457 帧),理论无限长度;540P/720P;9:16 竖屏默认;24fps;T2V/I2V
评测/排行
开源 I2V 最高分(ChatForest 口径)
部署
1.3B-540P ~14.7GB;14B-540P ~51.2GB;T2V-14B-540P ~43.4GB
社区评价
无限长度生成开源标杆;电影级光影美学;情绪/氛围感强
优化生态
ComfyUI;无限长度工作流;电影级风格 LoRA

重要基准 · 2025 年末发布、仍居第一梯队

虽是 2025 年发布,但替换现有模型时必然要对标的基线,故单列。
HunyuanImage-3.0(腾讯,2025-09-28)
  • 80B 总 / 13B 激活(MoE),开源最大多模态生图之一
  • 发布时 LMArena 文生图全球登顶(最佳综合+最佳开源)
  • 图像编辑 / 多轮交互 / 复杂图文排版 / 长文本小文字
  • 许可:腾讯社区许可
  • 地址:GitHub / HF | 注:2026 年无新版,仍是腾讯最新开源图像
HunyuanVideo 1.5(腾讯,2025-11-21)
  • 8.3B,DiT + CFG 蒸馏 + SSTA 注意力 + 内置 1080p 超分
  • 5–10s / 720P / 24fps / T2V+I2V+超分;14GB 单卡可跑
  • 许可:Apache 2.0
  • 地址:GitHub / HF | 注:无 2.0(2026-08 核验最新仍为 1.5)
Qwen-Image-2512(阿里,2025-12-31)
  • AI Arena 10,000+ 轮盲测最强开源;Apache 2.0
  • FP16 21.3GB / INT8 13.7GB;GGUF 6GB 可跑
  • 2026 上半年最常被对比的基线(详见图像详情 #4)
FLUX.2 dev(BFL,2025-11)
  • 32B MMDiT;LM Arena #9(1149)
  • 1024–2048+;文生图+单图/多图参考;中文提示词
  • Q4 GGUF 19GB / FP8 32GB;许可:FLUX 非商用
Kandinsky 5.0(SberAI,2025-09)
  • 图像 Lite 6B(MIT,4090 可跑);视频 Pro 19B(LMArena 开源 T2V #1)/ Lite 2B(同类 #1,12GB+offload)
  • 10s HD;可控运镜(Camera Control LoRAs);英俄双语
  • GitHub kandinskylab/Kandinsky-5

排行榜数据源与口径说明

不同榜单/任务不可直接比较,这里标注快照与口径供交叉验证。
榜单网址口径快照注意
AA T2I Arenaartificialanalysis.aiElo 盲测(人类偏好投票)2026-07过滤到开源权重后 NVIDIA 第 1
AA I2V/T2V Arenaartificialanalysis.aiElo 盲测2026-07/08MAGI-2 第 6 是 I2V 榜
LMArenalmarena.ai / arena.aiArena 分数2026-08-04qwen-image-3.0-pro 第 5(~1263,未开源,仅参考)
DesignArenadesignarena.ai设计导向盲测2026-06/07Ideogram 4 开源第 1 / 全球第 4
DataLearnerdatalearner.com综合评分2026开源/可商用过滤
ChatForest 视频榜chatforest.ai开源 I2V2026SkyReels V2 最高分
⚠️ 关键口径(避免误读):
  • Wan2.7 的"1762"是首发匿名 T2V 测试(2026-05);Awesome Agents I2V 榜为 Elo 1090 第 4——不同榜单、不同任务
  • NVIDIA Cosmos3"开源第一"指 AA 榜单过滤到开源权重后;与闭源混排时榜首仍是 GPT Image 2 / Veo
  • Ideogram 4"全球第 4"是 DesignArena,非 AA 通用榜
  • MAGI-2 第 6 是 114B/6B 激活 MoE,与 dense 模型成本口径不同
  • HiDream-O1 有"全球第 8"(5 月)和"全球第 2"(6 月 1.5 版)两个版本差异

按部署场景的选型建议

针对"跟踪最新 → 评估 → 替换现有模型"的决策路径。
🖼️ 图像生成(自部署)
场景首选
可商用+实时高吞吐FLUX.2 klein 4B(Apache,13GB,亚秒级)
可商用+中文文字/版式ERNIE-Image(Apache,8B,OneIG-ZH 0.554)
文字排版设计Ideogram 4(OCR 0.97)⚠️权重非商用
可商用+统一架构性价比HiDream-O1(MIT,8B,GenEval 开源第1)
可商用+原生4KSenseNova U1.5(Apache,8B,单卡)
照片级真实感Wan2.7-Image(Apache,2K/4K Pro)
知识密集型图文GLM-Image(MIT,CVTG-2K 第1)
物理AI/机器人数据Cosmos3-Super-T2I(OpenMDW)
🎬 视频生成(自部署)
场景首选
可商用+全家桶全能Wan2.7(Apache,14B,2–15s,编辑/续写/音画)
可商用+无限长度SkyReels V2(Apache,60s+)
可商用+原生音画LTX-2.5(4K,极快)⚠️遵从度一般
全模态参考生成MiniMax H3(33B,2K/15s)⚠️排除美欧商用
千亿 MoE 极致参数MAGI-2 Preview(Apache,114B/6B激活,0.5元/条)
物理AI/未来预测Cosmos3-Super-I2V(OpenMDW)
消费级轻量快速LTX-Video 1.x / Wan2.7-1.3B

信息源与聚合站

排行榜与模型情报的权威一手来源 / 聚合站。

⚠️ 模型迭代极快,替换前务必在官方仓库二次核验权重、许可与量化生态。整理:2026-08-31。