Claude Opus 4.8이 SWE-bench Verified에서 88.6%를 기록했다는 발표 이후, 개발자들 사이에서 같은 질문이 반복됐다. 그 점수가 실제 프로젝트에서도 그대로 나오는지, 그리고 경쟁 모델 대비 얼마나 우위인지다. 이 글에서는 벤치마크 수치가 실제로 무엇을 측정하는지, 어디까지 믿을 수 있는지를 짚는다.
SWE-bench가 코딩 능력 평가의 기준이 된 이유

SWE-bench는 AI 모델의 소프트웨어 엔지니어링 능력을 측정하는 벤치마크다. GitHub 공개 저장소에서 실제 제출된 버그 리포트와 수정 패치 쌍을 수집해 만든 과제 묶음으로, 기존 HumanEval 같은 평가 도구와 결정적으로 다른 점이 있다. 새 함수를 처음부터 작성하는 것이 아니라 기존 코드베이스를 받아서 버그를 직접 고쳐야 한다. 개발자가 매일 하는 일에 훨씬 가깝다.
현재 운영되는 주요 버전은 두 가지다.
- SWE-bench Verified: 500개 Python 문제. 인간 검증자가 품질을 확인한 기본 버전. 모델 간 비교에 가장 많이 인용된다.
- SWE-bench Pro: 활성 유지 저장소 기반, 멀티 파일 수정, 정답 데이터 사전 유출 없음. 현재 업계에서 실무에 가장 가까운 버전으로 평가받는다.
두 버전 사이의 점수 격차가 나중에 얼마나 중요한 신호가 되는지는 아래에서 설명한다.
Claude 코딩 능력 최신 점수 — 2026년 6월 기준
Claude 주요 모델의 SWE-bench 점수는 다음과 같다. 모델 버전은 빠르게 업데이트되므로 최신 수치는 Anthropic 공식 페이지에서 확인하는 것을 권장한다.
| 모델 | Verified 점수 | Pro 점수 |
|---|---|---|
| Claude Opus 4.8 | 88.6% | 69.2% |
| Claude Opus 4.7 | 87.6% | 64.3% |
| Claude Code (Opus 4.6 기반) | 약 80.8% | – |
| Claude Sonnet 4 | 72.7% | – |
Claude 3.5 Sonnet이 같은 벤치마크에서 약 49%를 기록했던 것과 비교하면, 1년 반 사이 최신 모델이 40포인트 가까이 올랐다. 속도가 빠르다. 다만 이 숫자를 실무 기대치로 바로 번역하기 전에 한 단계가 더 있다.
Verified 88.6%가 실무에서 의미하는 것

SWE-bench Verified 88.6%는 “소프트웨어 개발 업무 중 88.6%를 자동화할 수 있다”는 의미가 아니다. 정확하게는 “명확하게 범위가 정해진 Python 버그 수정 과제 중 약 10개 중 9개를 처리했다”는 뜻이다. 과제에 이미 무엇을 고쳐야 하는지 명시되어 있고, 단일 파일 수정이 중심이며, 정답 패치도 존재한다.
이 맥락에서 Verified와 Pro 사이의 점수 격차를 보면 더 많은 것이 보인다.
- 약 23포인트 낙폭: Opus 4.7 기준 Verified 87.6% → Pro 64.3%. 문제가 조금만 복잡해져도 성능이 크게 떨어진다는 신호다.
- 벤치마크 특화 최적화 가능성: 2024~2025년 Verified 점수 상승의 일부는 벤치마크 패턴에 맞춘 학습 결과일 수 있다. OpenAI 내부 감사에서 여러 최전선 모델이 Verified의 일부 Python 정답을 학습 데이터에서 “기억”해 풀어내는 현상이 확인됐다. Claude만의 문제가 아니라 업계 전반의 이슈다.
실무 근접 정밀도를 가늠하려면 Verified보다 Pro 점수를 참고하라. Pro에서도 모든 모델이 약 20포인트 하락한다는 사실을 기억하라.
실제 프로덕션 환경에서는 벤치마크 과제 구조가 재현하지 않는 상황이 많다. 수천 개 파일이 얽힌 의존성 추적, 여러 모듈에 걸친 리팩토링, 컨텍스트가 누적되면서 발생하는 지시 망각 등이 대표적이다. 사용자 피드백에서도 단순 버그 수정은 잘 처리하지만 대규모 코드베이스 이해와 복잡한 멀티 파일 변경에서는 성능이 눈에 띄게 떨어진다는 보고가 이어지고 있다.
경쟁 모델과의 비교 — Claude의 현재 위치
2026년 6월 기준 SWE-bench Verified 리더보드에서 Claude는 최상위권을 유지하고 있다. 주요 경쟁 모델과의 수치를 직접 비교하면 다음과 같다.
| 모델 | 개발사 | SWE-bench Verified |
|---|---|---|
| Claude Opus 4.8 | Anthropic | 88.6% |
| Claude Opus 4.7 | Anthropic | 87.6% |
| GPT-5.3 | OpenAI | 85.0% |
| Gemini 3.1 Pro | 80.6% | |
| GitHub Copilot (GPT-4o 기반) | Microsoft | 72.5% |
Claude가 선두를 유지하고 있지만, GPT-5.3과의 격차는 3~4포인트 수준으로 경쟁이 빠르게 좁혀졌다. 1년 전과 비교하면 훨씬 치열해졌다.
주의할 점이 있다. 모델 단독 API 점수와 에이전트 도구로서의 성능은 다르다. Claude Code는 Claude 모델 위에 파일 시스템 접근·터미널 실행·컨텍스트 관리 레이어를 얹은 에이전트 스택이다. 같은 Opus 모델을 API로 직접 호출했을 때와 Claude Code로 사용했을 때 체감 성능 차이가 날 수 있다. Claude Code 도입 전 API 연동이 필요한 분에게는 클로드 API 초보 완전 정복이 참고가 된다. 요금제 선택을 먼저 정리하고 싶다면 클로드 무료 버전 Pro 기능 비교를 먼저 보는 것도 좋다.
자주 묻는 질문

Q. Claude 코딩 능력 평가 정확도 88%면 실무에서도 그 수준을 기대할 수 있나요?
그렇지 않다. Verified 점수는 명확하게 범위가 정해진 단일 Python 버그 수정 과제 기준이며, 다중 파일 리팩토링·대형 코드베이스 탐색은 측정 범위 밖이다. 실무에 더 가까운 지표를 원한다면 SWE-bench Pro 점수(Opus 4.8 기준 69.2%)를 참고하는 것이 현실적이다.
Q. Claude Code와 GitHub Copilot 중 어느 쪽이 코딩 성능이 더 뛰어난가요?
SWE-bench Verified 기준으로 Claude Code(Opus 4.6 기반 약 80.8%)가 GitHub Copilot(GPT-4o 기반 72.5%)보다 높은 점수를 기록했다. 다만 어떤 에디터에서 어떤 코드베이스로 사용하느냐에 따라 체감 차이는 달라지므로, 자신의 실제 저장소에서 직접 비교 테스트해보는 것이 가장 정확하다.
Q. Claude 모델 버전이 자주 바뀌는데 최신 점수는 어디서 확인하나요?
Anthropic 공식 페이지(anthropic.com)와 SWE-bench 공식 리더보드를 직접 확인하는 것이 가장 정확하다. 블로그나 비교 정리 글은 발행 이후 수치가 바뀌어도 업데이트되지 않는 경우가 많다.
점수가 아니라 내 코드베이스로 판단해야 하는 이유
리더보드 1위 모델이 내 프로젝트에서도 최고 성능을 낸다는 보장은 없다. 언어, 프레임워크, 코드 스타일, 테스트 커버리지 수준에 따라 모델별 실제 성능 순위가 달라진다는 사실이 실제 사용자 피드백에서 반복적으로 확인된다.
직접 평가하려면 실제 버그 10~20개를 골라 각 모델에게 같은 과제를 준 뒤, 첫 시도 정확도·처리 시간·사람 수정 횟수·최종 diff 품질을 기록하면 된다. 1~2주 테스트로 수개월 치 라이선스 결정을 더 정확하게 내릴 수 있다. Claude Code 요금제와 플랜별 세부 조건은 Anthropic 공식 페이지에서 확인하는 것을 권장한다.