在编码评估中去伪存真
内容摘要
OpenAI 对 SWE-Bench Pro 编码基准测试进行了审计,旨在确保对模型能力的评估准确无误。通过自动化管道和资深软件工程师的人工审核,研究发现约 30% 的任务存在过度严苛的测试、提示词模糊、测试覆盖率不足或误导性信息等问题。鉴于这些发现,OpenAI 已撤回对使用 SWE-Bench Pro 的建议,并强调需要由资深开发者构建更严谨、更能真实反映模型能力的基准测试。
(来源:OpenAI)
OpenAI 对 SWE-Bench Pro 编码基准测试进行了审计,旨在确保对模型能力的评估准确无误。通过自动化管道和资深软件工程师的人工审核,研究发现约 30% 的任务存在过度严苛的测试、提示词模糊、测试覆盖率不足或误导性信息等问题。鉴于这些发现,OpenAI 已撤回对使用 SWE-Bench Pro 的建议,并强调需要由资深开发者构建更严谨、更能真实反映模型能力的基准测试。
(来源:OpenAI)
Dave Eggers 告诉 OpenAI 员工,ChatGPT 正在“让整整一代人失语”
Kimi:威胁还是祸患?
每个读者都需要用到的应用程序、小工具和工具
当人工智能深度伪造使用你的脸时该怎么办
Neil Rimer 认为人工智能赚来的钱终将回流
谷歌人工智能重现贝利最精彩的进球
Vertu 希望高管们支付 6,880 美元购买一款 AI 代理——其实际表现如何
Databricks 估值达到 1880 亿美元,延续其作为 AI 最受欢迎“第二春”的表现
消息人士称,白宫正在掌控前沿人工智能模型的访问权限,将权力从科技巨头手中转移
习近平呼吁加强开源人工智能:“中国准备更加开放”