国内AI企业DeepSeek发布的代码大模型DeepSeek-Coder-V2近日在国际权威代码评测基准上登顶,在HumanEval数据集上准确率达93.2%,超越OpenAI旗舰模型GPT-4o的92.0%;在MBPP数据集上准确率为92.5%,同样领先竞品。这一突破标志着国产代码大模型已跻身全球第一梯队,引发行业对其技术路线的广泛关注。
当地时间6月12日,国际代码模型评测平台EvalAI的最新榜单更新,一条数据引发AI行业震动——DeepSeek-Coder-V2以93.2%的准确率拿下HumanEval数据集的榜首,这一成绩比OpenAI刚刚发布的GPT-4o高出1.2个百分点,也是国产代码大模型首次在核心评测基准上超越OpenAI的旗舰模型。
随着企业数字化转型的深入,代码生成工具已成为提升研发效率的核心刚需。IDC数据显示,2024年全球AI代码生成市场规模将同比增长47%,达到18.7亿美元;国内市场增速更快,预计同比增长62%至5.2亿元。此前,OpenAI的GPT-4、谷歌的Gemini Code等国际模型长期垄断代码评测榜单,国产模型虽有布局但始终未进入第一梯队。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录
12 小时前
2026年5月19日,蚂蚁集团自研的智能终端可信连接技术框架GPASS迎来新落地场景:搭载该技术框架的乐奇AI眼镜新版本正式上线城市伴游功能。作为杭州文旅、支付宝与乐奇联合打造的“镜游杭州”项目核心载体,首个文旅官方智能体“杭小忆”同步入驻,可实时为用户提供周边景点讲解、交互问答、导航等全链条服务。

12 小时前
北京时间2026年5月19日,大模型独角兽Anthropic正式宣布对旗下两款核心AI产品Claude Design、Claude Code完成重磅功能升级。本次调整覆盖Pro、Max、Team、Enterprise全量订阅套餐,将所有付费用户的Token使用上限直接翻倍,同时将Claude Code快速模式的底层模型默认切换为最新Opus 4.7,不加价的前提下大幅降低创作者与开发者的使用门槛。

12 小时前
2026年5月,亚马逊正式为其大模型重构的新一代语音助手Alexa+推出名为Alexa Podcasts的AI定制播客功能,该功能首批面向美国地区用户开放公测,用户仅通过一句简单语音指令,无需上传素材、编写脚本,即可在数分钟内获得完全匹配个人兴趣的专属播客内容,大幅拓展了消费级AI语音助手的落地边界。

12 小时前
2026年5月,谷歌分拆企业SandboxAQ宣布与大模型厂商Anthropic达成深度合作,将自研科学AI模型集成至Claude平台,无需专业计算背景即可调用药物研发工具。背靠前谷歌CEO埃里克·施密特担任主席的团队,SandboxAQ已累计融资超9.5亿美元,此次合作直指传统药物研发平均耗时十年、耗资数十亿美元的行业痛点。

12 小时前
国内头部大模型创业公司月之暗面(旗下拥有Kimi大语言模型)近期完成股东名单重大更新,国智投、北京人工智能基金等国资机构及中国移动正式入局,总额20亿美元的新一轮融资已步入收尾阶段,不到半年其累计融资额突破39亿美元,最新估值较去年11月的43亿美元实现4倍增长,成为国内资本关注度最高的AI创业项目之一。

12 小时前
近日谷歌旗下整合了新一代Gemini大模型的秘密终端项目GoogleBook引发全行业热议,据上游供应链披露的不完全参数显示,该设备可实现70%的AI运算本地离线完成,近期第三方调研机构针对120名AI行业分析师的问卷显示,仅38%受访者看好其成为现象级产品,本文将拆解该项目的市场机会与现存争议。

12 小时前
据行业测算,2024年全球终端侧AI芯片出货量同比增幅将超过72%,苹果为快速扩大自研生成式AI功能Apple Intelligence的落地覆盖范围,在新款消费电子设备中采用了定制化算力调配方案,OpenAI、谷歌、DeepSeek等头部厂商也同步推进GPT-5、Google Gemini等大模型的端侧适配研发,AI终端赛道竞争正进入全新落地阶段。

12 小时前
2026年5月19日腾讯云正式官宣,旗下智能体开发平台ADP搭载的两款核心大模型Hy3preview、DeepSeek-V4-Pro,将于2026年5月27日10点结束全用户免费公测,全面转入正式商业化运营,后续采用实际调用量按量计费规则,配套四档梯度订阅套餐覆盖不同规模用户需求,为国内智能体落地的成本体系划定了新的参考标尺。