上海交大发布大模型双语编程评估基准 CodeApex|币安Binance交易所

据机器之心报道，上海交通大学 APEX 实验室推出了 CodeApex，一个专注于评估 LLMs 的编程理解和代码生成能力的双语基准数据集。

在评估大语言模型的编程理解能力上，CodeApex 设计了三种类型的选择题：概念理解、常识推理和多跳推理。此外，CodeApex 也利用算法问题和相应的测试用例来评估 LLMs 的代码生成能力。CodeApex 总共评估了 14 个大语言模型在代码任务上的能力。其中 GPT3.5-turbo 表现出最好的编程能力，在这两个任务上分别实现了大约 50% 和 56% 的精度。可以看到，大语言模型在编程任务上仍有很大的改进空间。

原文链接

币安Binance交易所_全球最大交易量的数字平台app

币新闻

上海交大发布大模型双语编程评估基准 CodeApex

相关币新闻

学而思：将推出基于 MathGPT 的产品级应用 AI Tutor

对话火山引擎谭待：坚持云优先，做好大模型时代的摆渡人

万兴科技首发 AI 演示新品“万兴智演”，官网已开放下载

半年多过去了，ChatGPT的排名快“垫底”了

Base生态系统基金首批六项投资项目一览

美国加州将监管该地区生成式 AI 的使用