新
SWE-bench
官网入口 GitHub
官网入口
国家/地区:美国🇺🇸
AI功能描述:源自真实 GitHub 问题的软件工程基准,要求模型定位缺陷并提交能通过测试的补丁,是衡量模型编程实战能力的权威榜单。
用户评分:
0分
说明: 官网入口 官方网站主页; IOS App Store 下载,支持 iPhone/iPad/Mac; 安卓 Google Play / 应用宝下载; 客户端 Mac/Windows/iOS/Android 官方下载; 插件 浏览器插件(默认 Chrome); GitHub / HuggingFace / ModelScope 模型或项目托管地址; API 模型/软件接口地址; MCP 官网的 MCP 栏目入口。 若未显示,表示暂无对应渠道,欢迎补充或纠错。
关注公众号
AIGC官网收录 │ 2026-09-29 │ 2 次 │ 人工核对 │ 官网认证 │ 定期更新 │ AI实验室

SWE-bench 主要功能:

Ai大模型Ai代码助手LLM 大语言模型

SWE-bench 图文介绍:

SWE-bench是一款来自美国的AI 实验平台,源自真实 GitHub 问题的软件工程基准,要求模型定位缺陷并提交能通过测试的补丁,是衡量模型编程实战能力的权威榜单。

适合评估编程 Agent 能力的研发团队与学术研究者。

主要功能:

  • 题目来自真实开源仓库的 GitHub Issue
  • 以能否通过单元测试作为客观判定标准
  • 提供 SWE-bench Verified 人工核验子集
  • 公开各模型解题率与提交详情
  • 配套开源评测框架,可自行复现结果

应用场景:

  • 评估 AI 编程助手能否独立修复真实缺陷
  • 团队在选型编码 Agent 时对比解题率
  • 研究者复现并改进自动化修复方法
  • 媒体报道引用其榜单衡量模型编程实力

平台兼容性:

Web / 开源评测框架。

优缺点:

  • 优点:真实任务,含金量高
  • 优点:判分客观,不易刷分
  • 优点:已成为行业事实标准
  • 不足:只覆盖 Python 等部分仓库
  • 不足:评测耗时较长,门槛偏研究向

费用价格:

完全免费。

©️版权声明:
本网站(AIGC官网)刊载的所有内容,包括文字、图片、音频、视频等均在网上搜集。
访问者可将本网站提供的内容或服务用于个人学习、研究或欣赏,以及其他非商业性或非盈利性用途,但同时应遵守著作权法及其他相关法律的规定,不得侵犯本网站及相关权利人的合法权利。除此以外,将本网站任何内容或服务用于其他用途时,须征得本网站及相关权利人的书面许可,并支付报酬。
本网站内容原作者如不愿意在本网站刊登内容,请及时通知本站,予以删除。

为此AIGC软件打分

平均评分 0 / 5. 打分人数: 0

暂无人打分!为此AI工具打分。

相关导航

最新Ai工具

热门AI推荐