小米的全模态长程智能体模型,309B 只激活 15B,1M 上下文,MIT 许可开源。
时间全部时间
所属全部所属
筛选全部
2026 年 9 月 8
Apple 的镜头式视觉模型,9B 面向端侧细粒度图像问答。
V2.6 代的强化学习版本,推理链更长更稳,是小米当前最强的开放权重模型。
Intern-S 科学模型第二代正式版,397B MoE 在科学推理与多模态任务上全面换代。
上海 AI Lab 的 Atria 系列预览版,面向代码与工具使用的通用模型。
V4.1 代的 Flash 版本,长程任务稳定性与工具调用明显加强,仍是 MIT 许可。
Ling 3.0 的视觉版本,在快速档上补上图像输入。
端侧第一个原生支持 1M 上下文的 4B 模型,全国产算力训练,本地办公与机器人场景可直接部署。
2026 年 8 月 15
V4-Flash 的视觉实验版,第一次给这条线接上图像输入。
智谱专攻智能体编程与防御性网络安全的旗舰,权重开放,但超大规模对外服务需要先过安全审查。
混元第四代的预览版,长程推理与多轮 agent 表现提升,沿用 Apache-2.0。
GLM-5.3 的快速版,用更低成本提供同代推理质量,适合高频调用。
Qwen3.8 代的轻量旗舰,180B 激活 6B,把 Max 的能力压到单机可部署的体量。
Qwen3.8 的 27B 稠密版,发布几天下载就冲到四十多万,端侧与单卡部署的主力。
V4-Pro 的 8 月更新版,长程 agent 与仓库级任务继续加强。
百灵第三代的迷你版,把 MoE 压到端侧可跑的量级。
North 系列的微型视觉指令模型,端侧做文档与界面理解。
Meta 重回开源路线的作品,30B 稠密多模态模型,Apache-2.0 直接可商用,专为本地智能体优化。
Qwen 把旗舰 Max 的文本权重放了出来:2.4T 总参激活 95B,开放权重里的参数天花板。
Granite 4.2 的 30B 档,进一步强化代码与 agent 能力,仍是全开源权重加宽松许可。
Granite 4.2 的 8B 版本,强化代码与推理的小尺寸企业模型。
百灵第三代的快速版本,延续极小激活的 MoE 路线,面向高并发 agent 调用。
Nemotron 3.5 代的轻量档,30B 激活 3B,主打极低延迟的 agent 执行。
2026 年 7 月 8
V4-Flash 的 7 月更新版,把 agent 与代码能力又推一档,仍是百万上下文里最便宜的开源选择。
盘古 2.0 代的旗舰开放权重版本,连同训练与推理代码一起放出,面向昇腾生态。
LG 与韩国政府合作的第二代旗舰,750B 激活 37B,韩语能力最强档。
Apertus 1.5 的 70B 版本,权重与训练配方继续全公开。
Apertus 1.5 代的 8B 版本,把多模态输入加进瑞士国家级开源模型。
韩国自主 AI 项目的第二代成果,250B MoE 从零训练。
1.8T 规模、全程用昇腾 910 训练的开源模型,证明国产算力能撑起万亿级预训练。
腾讯混元第三代开源基座,换成 Apache-2.0 后商用门槛降到最低。
2026 年 6 月 7
在开源模型里第一个把 1M 上下文和接近 Opus 级的编程规划能力做到同一档,MIT 许可。
2.8T 只激活 104B 的巨量 MoE,稀疏度拉到 896 选 16,原生多模态并支持 1M 上下文。
K2.7 的代码专用版本,面向终端里的长程编码 agent,百万上下文里直接跑仓库任务。
用扩散方式生成文本的 Gemma,非自回归解码把吞吐拉高一个量级,Apache-2.0。
Cohere 面向编码 agent 的小尺寸模型,能在本地仓库里做补全与重构。
550B 的混合 Mamba-MoE 旗舰,NVFP4 训练加 1M 上下文,是 2026 年美国开源权重线的代表。
428B 只激活 23B,稀疏注意力把 1M 上下文的多模态推理成本压到上一代的二十分之一。
2026 年 5 月 7
Gemma 4 的 12B 档,任何输入到任何输出,单卡就能跑的多模态助手。
Step 3.7 代的多模态快速版,把截图理解接进低延迟推理链路。
1B 级别的第五代端侧模型,把推理能力压进手机与嵌入设备。
Intern-S2 科学模型的预览版,先放出 36B 档权重供试跑,正式版同期有 397B。
Ring 2.6 代的万亿推理模型,本轮推理能力最强的开源尺寸之一。
Cohere 的旗舰开放权重模型,218B 激活 25B,面向企业 RAG 与多语言检索。
全流程在 AMD GPU 上训练的 8B MoE(激活 0.6B),证明非 NVIDIA 路线可行。
2026 年 4 月 16
百灵 2.6 代的万亿基座,训练数据与配方继续公开。
Ling 2.6 的快速版,低延迟面向在线 agent。
V2.5 代的旗舰档,面向代码与终端 agent 的长程任务,继续 Apache/MIT 宽松许可。
284B 只激活 13B,1M 上下文下的单 token 推理成本只有上一代的一成,MIT 许可。
1.6T 只激活 49B 的旗舰,在编码与 Agent 基准上第一次和闭源顶配正面持平。
扩散式文本生成模型,同一份权重支持自回归 / 扩散 / 自推测三种解码。
Qwen3.6 代的 27B 稠密模型,编码与 agent 表现比上一代明显提升,依旧 Apache-2.0。
K2 系列的多模态迭代,把 Agent 集群横向扩到数百个子智能体,长程编码可靠性继续加强。
Granite 4.1 的视觉版本,4B 做文档与图表理解。
Qwen3.6 代的中量级 MoE,35B 激活 3B,多模态输入本地就能跑。
混元第三代开源基座的预览版,为 Hy3 正式版做能力探路。
M2 代的第三次迭代,激活仍只 10B,面向长程 agent 调用。
Granite 4.1 的 30B 版本,企业级长上下文与 agent 能力的主力档。
Granite 4.1 的主力尺寸,企业工具调用与 RAG 场景专门优化,许可证依旧宽松。
EXAONE 4.5 的 33B 多模态版本,LG 首个公开的视觉语言模型。
GLM-5 代的第一次迭代,长程规划与仓库级重构能力继续加强,仍是 MIT 权重。
2026 年 3 月 9
Mistral Medium 首次放权重,128B 稠密面向企业私有化部署。
华为盘古的 718B 开源 MoE(权重实测 734B),全流程在昇腾上训练,是国产算力栈里体量最大的开放权重模型。
级联式推理的 30B 实验模型,把简单问题交给小模型、难题再上大模型。
Gemma 4 的 26B 激活 4B MoE 基座,为二次训练与蒸馏准备。
Gemma 4 的稠密旗舰,改用 Apache-2.0 后终于可以放心商用,多模态与 agent 能力同代领先。
LatentMoE 架构的 120B 激活 12B,原生 NVFP4 预训练,单台 8 卡机就能跑百万上下文。
Reka 面向机器人与边缘设备的视觉模型,2603 批次。
Nemotron 3 Super 的 BF16 权重版,LatentMoE 加多 token 预测的旗舰档。
Gemma 4 的端侧档,运行时只加载约 4B 有效参数,手机就能跑多模态。
2026 年 2 月 14
Qwen3.5 代的 4B 稠密版,端侧与轻量部署的主力尺寸。
Qwen3.5 代的 9B 稠密版,单张 24G 卡可跑的多模态助手。
Qwen3.5 的 122B 档,激活 10B 换来接近旗舰的效果,是企业自部署的常见落点。
Qwen3.5 的稠密 27B,单卡可跑且多模态,是本地部署最省心的一档。
Qwen3.5 的中量级 MoE,原生多模态输入,单机就能部署的旗舰级效果。
阿里新一代原生多模态基座,397B 只激活 17B,1M 上下文能直接吃下两小时视频。
百灵 2.5 代的万亿参数基座,激活 50B 级别,MIT 许可。
覆盖 70 多种语言的端侧小模型,把多语言覆盖做到手机可跑的程度。
M2 代的第二次迭代,编码与工具调用稳定性提升,仍是低激活的 MoE 路线。
744B 只激活 40B,把编码与长程 Agent 任务做到开源第一,MIT 许可可直接商用。
Ring 2.5 代的万亿推理模型,长思维链强化学习路线。
Nemotron Nano 9B 的日语特化版,面向日本企业的本地化部署。
Intern-S1 的科学推理加强版,面向专业学科的长链推理。
Step 3.5 代的快速版本,196B 激活 11B,主打低延迟的 agent 与工具调用。
2026 年 1 月 8
接替 Qwen3-Coder 的新一代代码模型,agent 化工具调用与长仓库任务明显更强。
原生多模态的 1T MoE,加上可自主编排上百个子智能体的 Agent 集群,视觉与代码能力第一次合流。
Mistral Small 4 代:119B 激活 7B 的 MoE,把旗舰能力压到单机可跑。
Phi-4 的视觉推理版本,看图做题与图表理解在 15B 尺寸里表现突出。
腾讯优图的 4B 视觉语言模型,端侧做图像问答与 OCR。
GLM-4.7 代的低延迟版本,牺牲一点深度换吞吐,适合当常驻 agent 的执行模型。
Step 3 的 10B 视觉版本,小尺寸做图文理解与推理。
1.2B 的端侧小模型,CPU 解码约 239 tok/s、内存不到 1GB,在同尺寸上反超不少更大模型。
2025 年 12 月 15
LG 与韩国政府合作的 236B MoE,激活 23B,主打韩语与多语言企业场景。
中国电信第三代开源模型,36B 带思考模式,面向政务与行业私有化部署。
2025 年末的编码旗舰,强化学习后训练把复杂工程任务的完成度明显拉高。
M2 代的第一次迭代,编码与工具调用稳定性提升。
小米第一代大尺寸开源 MoE,309B 激活 15B,把端侧经验带到旗舰级推理。
NVIDIA 的异构 MoE 小模型,1M 上下文加数倍吞吐,专为多智能体调度场景优化。
OLMo 3.1 的 32B 思考版,完全开源路线上的旗舰推理尺寸。
韩国政府自主 AI 项目的首个成果,从零训练的 100B MoE,韩语能力突出。
GLM-4.6 的多模态版本,把截图/文档理解与代码 agent 合到一个模型里。
GLM-4.6V 的快速视觉版,低延迟跑截图理解与文档问答。
欧盟资助的 EuroLLM 22B 版本,覆盖全部官方语言的开源模型。
Nemotron 3 Nano 的 BF16 权重版,混合 Mamba-Transformer 的 30B 激活 3B。
Mistral 3 代的小尺寸视觉模型,笔记本上就能跑多模态助手。
Mistral 第一次把旗舰级 675B 权重开放出来,Apache-2.0 许可,MoE 激活 41B。
用稀疏注意力把长上下文成本降一个量级,思考与工具调用融合的 Agent 基座。
2025 年 11 月 11
V3.2 的长思考特化版,把推理链拉到极限而不追求吞吐。
Devstral 2 的大尺寸版本,123B 面向长程编码 agent。
Devstral 第二代的 24B 版本,SWE 类仓库任务成绩在同尺寸领先。
把「自我验证」训练进模型里的数学推理模型,开源模型里少见的 IMO 级证明能力。
扩散式语言模型 LLaDA 2.0 的迷你版,16B 激活 1B,非自回归生成路线。
Allen AI 的完全开放模型,连训练数据与代码一起放出,适合做可复现的研究与教学。
OLMo 3 7B 的指令版,连同 Dolma 3 数据与训练代码一起公开。
OLMo 3 7B 的思考版,可复现的推理模型训练流程。
同 28B-A3B 的视觉思考版,把推理链接进多模态输入。
把思考过程与多步工具调用交织在一起的 1T MoE,把开源推理能力再往前推一步。
OLMo 3 的 32B 基座(11 月 25 日版),用于复现与二次训练。
2025 年 10 月 16
Ministral 3 的 14B 指令版,单卡可跑的多模态小模型。
Ministral 3 的 14B 思考版,小尺寸上做多步推理。
用混合线性注意力做的长上下文模型,1M 上下文下解码速度几乎不衰减。
7B 的推理模型,在同尺寸里推理成绩领先,Apache 系许可可商用。
把体量砍到 230B 激活 10B 的 agent 专用模型,用十分之一的成本拿到同代效果。
Qwen3-VL 的 32B 指令版,视觉 agent 与长文档理解在单机尺寸里最强的一档。
用「视觉 token 压缩」读文档的开源 OCR 模型,把长文档塞进极少 token,单卡就能跑。
Qwen3-VL 的 4B 版本,消费级显卡就能跑截图理解与 OCR。
Qwen3-VL 4B 的思考版,小尺寸上也保留视觉推理链。
把视觉语言能力压到 8B 的尺寸,单张消费级卡就能跑截图理解与 OCR。
Qwen3-VL 8B 的思考版,用长思维链做图像推理与界面定位。
Ling-1T 的推理版本,万亿 MoE 上做长思维链强化学习,数学与代码成绩突出。
1B 的混合 Mamba-2 模型,为企业在 CPU 与边缘设备上跑而设计,Apache-2.0。
混合 SSM-Transformer 的 3B 推理模型,长上下文吞吐好,Apache-2.0 可商用。
IBM 的企业向混合 Mamba 架构,32B 只激活 9B,显存和推理成本都压得很低。
蚂蚁首个万亿参数开源基座,激活 50B,MIT 许可把万亿级权重开放出来。
2025 年 9 月 20
把上下文拉到 200K 的 GLM 旗舰,代码与 agent 能力在开源里进入第一梯队。
Qwen3-VL 的 30B 激活 3B 版本,多模态吞吐与成本最平衡的一档。
同 30B-A3B 的思考版,把视觉推理链接进低激活的 MoE。
第一次把 DeepSeek Sparse Attention 放出来的实验版,长文本推理成本明显下降而效果几乎不掉。
V3.1 的 Terminus 版,把中英语言一致性与 agent 稳定性修了一轮。
一个模型同时吃文本、图像、音频和视频,开源全模态里少见的端到端方案。
Qwen3-VL 的旗舰尺寸,视觉 agent 与长视频理解都能做,可识别图像类目里最强的一档。
Qwen3-VL 旗舰的思考版,长视频与复杂图表推理的开源上限。
LongCat-Flash 的推理版本,针对工具调用与长思维链做了专门强化。
Ling-flash-2.0 的推理版,把长思维链专门训进模型,MIT 权重可直接商用。
蚂蚁的第二代主力开源模型,103B 激活 6.1B,用极小激活成本换通用能力。
Qwen3-Omni 的思考版,文本 / 图像 / 音频统一进一个模型并带推理链。
Magistral Small 的 2509 版本,多语言推理与可追溯推理轨迹。
OLMo 3 的小尺寸版本,把完整训练流程与 Dolma 3 数据一起公开,适合研究复现。
用混合线性注意力换效率的下一代架构,80B 只激活 3B,长上下文吞吐比同级稠密模型高一个量级。
ERNIE 4.5 的 21B 思考版,激活 3B 做推理链。
百灵的 16B 激活 1.4B 迷你 MoE,端侧高并发场景的开源选择。
Ring-mini 的 2.0 版本,小激活量下做推理链。
K2 的 9 月更新版,把上下文从 128K 扩到 256K 并加强代码 agent,仍是万亿参数级开源模型。
瑞士国家级开源模型,权重、数据与配方全公开,并尊重网页抓取的退出声明。
2025 年 8 月 18
美团第一次开源基座:560B 激活 27B,用动态激活把推理成本压到同级的三分之一。
InternVL3.5 的 38B 档,GUI 与文档理解做得扎实,Apache-2.0 可商用。
8B 的端侧视觉语言模型,OCR 与文档问答打得很准,手机级别设备就能跑。
Apple 的快速视觉语言模型,7B 以低延迟做端侧图像理解。
xAI 首次放出的开放权重模型,Grok-2 的 269B MoE 权重公开下载。
混合推理的 V3 升级版,思考与非思考模式合一,为后面几代的 Agent 能力打好底子。
Nemotron Nano 的 12B 视觉版,混合 Mamba 架构加图像输入。
字节 Seed 的 36B 稠密模型,512K 上下文配可控思考预算,Apache-2.0 可商用。
Seed-OSS 的基座版本,512K 上下文,方便团队自己继续做后训练。
Mamba-Transformer 混合的 9B 模型,长上下文推理吞吐高,NVIDIA 连训练数据一起放了出来。
只有 270M 的 Gemma 3,专门给端侧微调与分类任务用,量化后不到 200MB。
Apertus 的 8B 指令版,端侧可跑的多语言开源模型。
Command A 的推理版本,企业场景下的长思维链与工具调用。
GLM-4.5 的视觉版,把图像与视频理解接进同一套 MoE 里,MIT 许可可商用。
OpenAI 时隔六年重新放出开放权重模型,MXFP4 原生量化后单张 80G 卡就能跑。
OpenAI 的 21B 开放权重模型,原生 MXFP4 量化后 16G 显存就能跑。
Qwen3 的 4B 指令版,4B 尺寸里通用的本地助手首选。
Qwen3 4B 的思考版,端侧也能跑推理链。
2025 年 7 月 19
同一代代码模型的小尺寸版,本地 24G 卡就能跑起仓库级补全。
混元稠密系列的 7B 指令版,端侧与高并发场景的开源选择。
30B-A3B 的 2507 思考版,小激活量下保留完整推理链。
智谱把旗舰做成 MIT 许可的 355B MoE,把开源 Agent 基座的门槛直接拉低一档。
GLM-4.5 的轻量版:106B 总参只激活 12B,MIT 许可,单机 8 卡就能跑旗舰级效果。
30B-A3B 的 2507 指令版,上下文扩到 256K,本地部署的主流选择。
235B 旗舰的 2507 思考版,长思维链质量比 4 月首发版明显提升。
321B 激活 38B 的多模态推理模型,把图像理解与长思维链放进同一个 MoE。
面向科学发现的多模态推理模型,241B 激活 8B,把化学与生物知识专门训了进去。
蚂蚁百灵的轻量 MoE,16.8B 激活 2.75B,MIT 许可下做端侧与高并发场景。
480B 激活 35B 的代码模型,原生 256K 上下文,把仓库级代码 agent 能力开源了出来。
2507 版把上下文从 128K 抬到 256K 并去掉思考开关,一个模型直接当通用旗舰用。
LG 的混合推理模型,32B 支持思考与非思考模式,许可证只允许研究用途。
把语音理解接进语言模型的 24B 版本,长音频转写与问答一步到位。
1T 参数只激活 32B 的超大 MoE,工具调用与 Agent 能力第一次逼近闭源旗舰。
面向代码 agent 的 24B 模型,能在本地仓库里自己改代码跑测试。
基于 Gemma 3 的医疗专用模型,医学问答与影像报告理解专门调过。
3B 的全开源小模型,训练配方与数据都公开,支持思考/非思考双模式与六种语言。
扩散式代码生成模型,7B 用非自回归解码做代码补全。
2025 年 6 月 14
百度 ERNIE 4.5 开源家族里的中量级 MoE,21B 激活 3B,Apache-2.0 可商用。
百度把文心 4.5 系列十个模型一次性开源,300B 旗舰用 Apache-2.0 放开商用。
ERNIE 4.5 的异构多模态旗舰,424B 激活 47B,文本与视觉参数分开承载。
ERNIE 4.5 的中量级视觉模型,28B 激活 3B 做多模态理解。
GLM-4.1V 的 9B 视觉思考版,小尺寸做图表与界面推理。
腾讯混元首个开源的 MoE 模型,80B 激活 13B,支持 256K 上下文与双模式推理。
为手机与笔记本设计的 MatFormer 模型,权重 7.8B 但运行时只加载约 4B 有效参数,能吃图、音、文。
24B 的通用小模型,指令跟随与函数调用经过专门修整,单张 24G 卡就能跑。
Decoder 与扩散混合的推理小模型,解码速度比同尺寸自回归模型快数倍。
456B 的 MoE 推理模型,用闪电注意力把 1M 上下文的自注意力成本压到能接受的范围。
MiniMax 的第一个开源推理模型,80K 思维链长度配上百万上下文,Apache-2.0 可商用。
Mistral 第一个开源推理模型,24B 稠密做多步推理,Apache-2.0 可商用。
小红书开源的 142B 激活 14B MoE,训练数据与中间 checkpoint 一并公开,MIT 许可。
面壁的端侧主力模型,8B 稠密配上稀疏注意力加速,长文本推理明显提速。
2025 年 5 月 4
MiMo 的视觉版本,7B 就能做界面理解与文档问答,MIT 许可可商用。
R1 的 5 月更新版,把思考深度与代码能力再推一档,MIT 许可。
并行 Attention + Mamba-2 的混合架构,34B 支持 18 种语言与 256K 上下文。
字节的统一多模态模型,7B 同时做图像理解与图像生成。
2025 年 4 月 20
把 685B 基座专门压到 Lean 4 形式化证明上的数学证明模型,定理证明通过率刷新开源记录。
小米第一个开源推理模型,7B 稠密靠 RL 训练在数学与代码上超过更大的蒸馏模型。
把 14B 的 Phi-4 用推理数据继续训练,数学与科学题上追平大几十倍的模型。
把推理能力压到 3.8B 的版本,端侧做数学与逻辑题。
235B 的 MoE 旗舰,同一个模型里同时支持深度思考与快速回答两种模式,Apache-2.0 可商用。
总参 30B 只激活 3B 的 MoE,速度快到能在本地当日常助手用。
Qwen3 里最实用的稠密尺寸,单卡可部署且支持思考/非思考双模式切换。
Qwen3 的 14B 稠密版,单卡可跑且思考 / 非思考双模式。
Qwen3 的 4B 稠密版,手机与开发板级别的部署选择。
Qwen3 的 8B 稠密版,下载量最大的开源尺寸之一。
字节的 8B 开源代码模型,用模型自己筛数据训出来的,MIT 许可本地可跑。
Phi-4-reasoning 的加强版,用更多 RL 换更长的推理链与更高数学成绩。
智谱第一代开源推理模型,32B 稠密靠 RL 把数学与代码推理拉到同尺寸领先。
GLM-Z1 的沉思版本,先想清楚再答,面向复杂研究型问题。
Kimi 的第一代开源视觉语言模型,激活 3B 就能做长文档与界面理解,MIT 许可。
Granite 3.3 的 8B 版本,工具调用与 RAG 场景专门加强。
GLM-4 的 32B 稠密版,0414 批次的基座模型,MIT 许可。
Meta 第一个 MoE 开源旗舰,400B 总参数只激活 17B,原生多模态并带 1M 上下文。
Meta 第一代原生多模态 MoE,16 专家版本把上下文做到 10M,单张 H100 就能跑。
Llama 4 Scout 的预训练基座,为自建后训练与蒸馏提供起点。
2025 年 3 月 13
V3 的 3 月升级版,推理与前端代码明显变强,仍是 MIT 的 671B MoE。
Qwen2.5 时代的端到端全模态模型,文本 / 图像 / 音频 / 视频一个模型吃下。
Qwen2.5-VL 补上的 32B 中量级尺寸,效果逼近 72B 而显存要求低一半。
24B 的稠密多模态模型,视觉理解加上函数调用,Apache-2.0 许可可以直接进产品。
完全开源的代表作:权重、训练数据、代码与中间 checkpoint 全都放出来。
EXAONE Deep 的 32B 推理模型,数学与代码在同尺寸领先,仅限研究用途。
Gemma 3 的中量级尺寸,单张消费级卡就能跑多模态与 128K 上下文。
单张显卡就能跑的 27B 多模态模型,128K 上下文加 140 种语言,Google 开源线里性价比最高的一档。
Command A 的 111B 开放权重版,256K 上下文面向企业 agent,非商业许可。
Reka 从零训练的 21B 通用推理模型,小尺寸里对标 o1-mini 的一档。
32B 稠密模型靠强化学习追平 671B 级推理模型,消费级显卡也能跑的开源推理选择。
Aya Vision 的 32B 版本,覆盖 23 种语言的多模态开源模型。
Aya Vision 的 8B 版本,端侧做多语言图文理解。
2025 年 2 月 5
3.8B 的小模型靠高质量数据在推理上压过更大的同级模型,MIT 许可随便用。
5.6B 同时吃文本、图像与语音,是当时最小的开源全模态模型。
Kimi 放出的 Muon 优化器验证模型,16B 只激活 3B,训练效率与效果都写进了技术报告。
Gemma 3 的 4B 多模态版本,笔记本与单张消费卡就能跑。
Granite 3.2 的 8B 版本,第一次把 thinking 开关带进企业小模型。
2025 年 1 月 10
Mistral Small 3 的首发版本,24B 稠密以低延迟见长,Apache-2.0 可商用。
Qwen2.5-VL 最大的开源尺寸,能读长视频与文档里的表格,是 2025 年初最强的开源视觉语言模型。
把图像理解与图像生成解耦到两条路径的统一模型,7B 就能双向做。
Qwen2.5-VL 的 3B 版本,端侧做 OCR 与界面理解最省资源的一档。
Qwen2.5-VL 的 7B 版本,文档解析与视觉定位在本地尺寸里口碑最好。
第一个把长思维链纯强化学习路线开源出来的推理模型,能力对标闭源 o1,MIT 许可可直接商用。
不做 SFT、纯强化学习训出来的 R1-Zero,是整套推理路线的原始实验样本。
第一个把百万级上下文与线性注意力结合并开源的旗舰,456B 激活 45.9B。
MiniMax-Text-01 的视觉版本,同一套百万上下文架构上加图像理解。
InternLM3 的 8B 指令版,上海 AI Lab 通用对话模型的开源主力。