JetBrains发布Mellum2.1模型 智能体编程增强

AI 驱动中国 温言 286次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

JetBrains上线Mellum2.1模型,延续12B混合专家架构与Apache 2.0许可,重点增强智能体编程能力,并通过强化学习训练与多Token预测提升性能,高负载推理吞吐接近Qwen3.5-9B两倍。

驱动中国10月9日消息,JetBrains于10月8日发布Mellum2.1模型,重点增强智能体编程能力。该模型延续Mellum2的12B混合专家架构,拥有2.5B活跃参数,并继续以Apache 2.0许可证发布。

在训练层面,Mellum2.1将预训练后的强化学习从短期收尾环节扩展为主体训练阶段,并围绕数学、算法竞赛、科学、工具使用与软件工程等任务补充训练数据。

JetBrains为模型搭建内部强化学习环境基础设施,训练期间启动数百万个沙盒,覆盖数千个环境。训练前,团队还筛选开放数据集,剔除测试缺陷、不可验证答案及难度失当的任务。

能力方面,Mellum2.1可探索代码库、编辑文件并检查自身修改。JetBrains表示,最大改进集中在智能体编程场景,模型可识别失败测试的根因,起草修复方案并验证结果。

性能方面,Mellum2.1与Mellum2架构一致,速度保持不变;多Token预测(MTP)进一步提升响应速度,单请求场景下速度提高约1.6倍。

在相同评估设置下,JetBrains将Mellum2.1与Mellum2、Qwen3.5-9B及Gemma 4 E4B进行比较。结果显示,高负载时Mellum2.1推理吞吐Token数量接近Qwen3.5-9B的两倍,并在编程、算法竞赛、数学、工具调用和通用知识等维度均有提升。

Mellum2.1已登陆Hugging Face,支持本地或自有基础设施部署,企业可将代码和数据保留在自身环境中。官方后续将推出面向llama.cpp、Ollama和LM Studio的GGUF版本,以及vLLM的MTP推测解码组件。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525740.html
本文价值 ★★★★★ — 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友

分享卡已生成

长按下方图片保存,转发到朋友圈或微信群

分享卡