Redian新闻
>
Stability AI开源3B代码生成模型:可补全,还能Debug

Stability AI开源3B代码生成模型:可补全,还能Debug

公众号新闻
机器之心报道
机器之心编辑部

Stable Diffusion 3 还没全面开放,这家公司的代码生成模型先来了。


本周一,Stability AI 开源了小体量预训练模型 Stable Code Instruct 3B。


Stable Code Instruct 3B 是一个基于 Stable Code 3B 的指令调整编码语言模型(Code LM)。给出自然语言 prompt,该模型可以处理各种任务,例如代码生成、数学和其他软件工程相关的任务。


Stability AI 宣称,该模型在 3B 规模上提供了 SOTA 性能,并且优于 CodeLlama 7B Instruct 等更大规模的模型,甚至在软件工程相关任务中,性能与 StarChat 15B 相当。



  • 模型:https://huggingface.co/stabilityai/stable-code-instruct-3b

  • HuggingFace 试用:https://huggingface.co/spaces/stabilityai/stable-code-instruct-3b

  • Stable Code 技术报告:https://static1.squarespace.com/static/6213c340453c3f502425776e/t/6601c5713150412edcd56f8e/1711392114564/Stable_Code_TechReport_release.pdf


Stable Code Instruct 3B 增强了代码补全能力,并支持自然语言交互,旨在提高编程和软件开发相关任务的效率和直观性。实验测试表明,该模型在各种与编码相关的任务中优于 Codellama 7B Instruct 和 DeepSeek-Coder Instruct 1.3B 等同类模型。


方法介绍


Stable Code 建立在 Stable LM 3B 的基础上。Stable Code 是一个因果纯解码器 transformer,类似于 LLaMA 架构,与 LLaMA 的主要区别如下:


  • 位置嵌入,旋转位置嵌入应用于头嵌入维度的前 25%,以提高吞吐量;

  • 标准化,带有学得偏差项的 LayerNorm;

  • 偏差,除了键、查询和值投影的偏差,Stable Code 从前馈网络和多头自注意力层中删除了所有偏差项。



下表给出了预训练语料库数据集的采样权重、 epoch、类别等信息。




根据 Stack Overflow 2023 开发者调查报告,Stable Code Instruct 3B 重点关注 Python、Javascript、Java、C、C++ 和 Go 等语言,这些语言对于各种开发人员来说是最流行和最有影响力的。虽然这些语言被选为训练的重点,但该模型还针对其他广泛采用的语言(例如 SQL、PHP 和 Rust)进行了训练。



即使对于最初未包含在训练集中的语言(例如 Lua),Stable Code Instruct 3B 也能提供强大的测试性能。这种熟练程度可能源于其对底层编码原理的理解,以及利用编码任务固有的可预测性,在不同编程环境中适应概念的能力。


Stable Code Instruct 3B 不仅精通代码生成,还精通 FIM(Fill in the Middle)任务、数据库查询、代码翻译、解释和创建。其指令调整使其能够理解并按照细致入微的指令采取行动,促进除简单代码完成之外的广泛编码任务,包括数学理解、逻辑推理和围绕软件开发处理复杂的技术描述。


性能评估


与 Codellama 7B Instruct 和 DeepSeek-Coder Instruct 1.3B 等领先模型相比,Stable Code Instruct 3B 在一系列编码任务中展现出卓越的性能。



研究团队还在 Multi-PL 基准上比较了三种模型。尽管参数量较少,但 Stable Code Instruct 3B 在所有语言上的表现均明显优于 CodeLlama Instruct。



下表 8 展示了几种模型在 FIM 任务上的性能:



实验测试表明,Stable Code Instruct 3B 在代码完成准确性、对自然语言指令的理解以及跨不同编程语言的能力方面可与其他模型媲美甚至超越。



Stable Code Instruct 3B 的参数规模和低硬件要求使其可供广泛的受众使用,使开发人员能够更高效地工作。值得一提的是,Stable Code Instruct 3B 现在可以通过 Stability AI 会员资格用于商业目的。


参考链接:

https://stability.ai/news/introducing-stable-code-instruct-3b

https://twitter.com/StabilityAI/status/1772345514023116828




© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
冬樱 - 迟爱 三​NUS团队提出X-Ray:一种看透物体的3D表示和生成模型!懒倔混什么都是两面性 .离开跟不离开,只是每个人的选择. 合适自己最好.大佬出走后首个发布!Stability官宣代码模型Stable Code Instruct 3B看透物体的3D表示和生成模型:NUS团队提出X-Ray几行代码稳定UNet ! 中山大学等提出ScaleLong扩散模型:从质疑Scaling到成为Scaling谷歌发布“Vlogger”模型:单张图片生成10秒视频马未都保持童心,避免大而空问题 法律是行为的底线,道德是内心的底线,一生要遵循 一开始不要指责,再分析Stability AI开源上新:3D生成引入视频扩散模型,质量一致性up,4090可玩日记年轻人的第一个多模大模型:1080Ti轻松运行,已开源在线可玩OpenAI官宣开源Transformer Debugger!不用写代码,人人可以破解LLM黑箱Suno v3音乐生成模型发布,几秒钟生成完整歌曲;富士通用生成式AI加速药物研发丨AIGC日报揭秘最强视频生成模型 Sora,OpenAI 是怎么实现 1 分钟一镜到底的?AI早知道|淘天集团自研大模型“淘宝星辰”上线;Gemini Pro1.5向所有人开放;Suno正式发布V3音乐生成模型集体出走的Stability AI 发布全新代码大模型,3B以下性能最优,超越Code Llama和DeepSeek-Coder晚点独家丨蚂蚁投资视频生成模型公司爱诗科技;奈雪投资人加入茶颜悦色面壁低调开源新模型:早于Llama 3、比肩Llama 3、推理超越Llama 3!博士申请 | 多伦多大学孙强教授招收生成模型/LLM方向全奖博士/博后/实习生【租房】Watertown中心高级公寓 Studio$2.6k+1b$2.8k+ 2b2b$3.1k 3b3b$5.4k随时入住效果炸裂!OpenAI 发布首个视频生成模型,这就是 AI 视频的 GPT 时刻六一带孩子挖宝了!亲手挖出沙金串珠手链!考古盲盒玩法,老少咸宜,还能DIY国风首饰年轻人的第一个多模态大模型:1080Ti轻松运行,已开源在线可玩首个全开源时序预测基础模型:Zero-shot预测能力比肩从零训练最优模型最强开源多模态生成模型MM-Interleaved:首创特征同步器直播网友AI写歌征婚,实测最新登榜音乐SOTA模型:免费无限次,一键生成OpenAI CEO最新演讲:GPT-5性能远超GPT-4;媲美Sora,视频生成模型EMO上线通义APP丨AIGC日报天道有常(19)AI早知道|百度将免费开放长文本能力;Suno推出音乐生成模型Suno V3最强开源大模型 Llama 3震撼发布!开源模型将追上GPT-4,4000亿参数模型也在路上最强开源多模态生成模型MM-Interleaved:首创特征同步器,刷新多项SOTA曝小扎写信“挖角”DeepMind;我国10亿级参数大模型超百个;Stability AI开源代码生成模型丨AIGC大事日报Meta、微软、Mistral AI、Hugging Face、通义、港中文六路进发开源大模型 | 大模型一周大事OpenAI小规模开放语音生成模型,上海发放电脑家电补贴,搜狗发布硬件产品服务下线公告,这就是今天的其他大新闻!以蒸馏的名义:“从去噪自编码器到生成模型”重出江湖
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。