ChatGPT vs Claude, 코딩은 누가 더 잘할까
이 질문에 숫자로 답하는 글이 많지만, 그 숫자 대부분은 당신의 코드베이스에 대해 아무것도 말해주지 않습니다. 직접 재는 방법을 씁니다.
먼저, 정직하게
"Java는 A가 낫고 Python은 B가 낫다" 같은 표를 만들고 싶었습니다. 그런데 그 표를 뒷받침할 신뢰할 만한 공개 데이터를 찾지 못했습니다.
떠도는 언어별 비교의 출처를 따라가 보면 대개 이 셋 중 하나입니다.
- 표본 몇 건짜리 개인 후기
- 공개 벤치마크 총점을 언어별로 임의 분해한 것
- 출처가 다시 다른 블로그인 것
그래서 없는 표를 지어내는 대신, 왜 그 표가 존재하기 어려운지와 그럼 뭘 재야 하는지를 쓰겠습니다.
공개 벤치마크가 당신에게 답을 못 주는 이유
1. 벤치마크 과제는 당신 코드와 다릅니다. 대부분의 코딩 벤치마크는 자족적인 문제입니다. 함수 하나, 알고리즘 하나. 실무 코드의 어려움은 그게 아닙니다. 6년 된 서비스에서 이 인터페이스를 왜 이렇게 뒀는지, 이 필드를 바꾸면 어디가 깨지는지가 어려운 부분입니다.
2. 점수 차이가 대체로 작고, 자주 뒤집힙니다. 상위 모델들의 격차는 몇 %p 수준에서 오가고 새 버전마다 순위가 바뀝니다. 오늘 쓴 비교 글이 다음 달에 틀린 글이 됩니다.
3. 도구 사용이 모델보다 결과를 더 크게 흔듭니다. 같은 모델이라도 파일을 읽고 테스트를 돌릴 수 있는 하네스 안에 있을 때와 채팅창에 붙여 넣을 때는 완전히 다릅니다. "어느 모델이 낫나"를 물었지만 실제로 측정되는 건 대개 어느 하네스가 낫나입니다.
그래서 직접 재야 합니다
30분이면 만들 수 있는 최소 평가 세트입니다.
1단계 — 과제를 당신의 저장소에서 가져옵니다. 지어낸 문제가 아니라 실제로 처리했던 이슈 10~20개를 씁니다. 이미 정답(머지된 PR)이 있는 게 핵심입니다.
2단계 — 채점 기준을 코드로 만듭니다. 사람이 읽고 판단하면 편향이 들어갑니다. 자동으로 채점되게 합니다.
통과 = 테스트 통과 ∧ 타입체크 통과 ∧ 린트 통과
여기에 하나만 더하면 훨씬 날카로워집니다.
변경 범위 = 수정된 파일 수, 추가/삭제된 줄 수
같은 이슈를 통과시키면서 30줄을 고친 모델과 400줄을 고친 모델은 다릅니다. 정답률만 보면 이 차이가 안 보입니다.
3단계 — 같은 조건에서 돌립니다. 같은 프롬프트, 같은 도구 접근 권한, 같은 저장소 상태. 조건이 하나라도 다르면 모델 비교가 아니라 설정 비교가 됩니다.
4단계 — 비용까지 같이 기록합니다. 정답률이 3%p 높은데 비용이 두 배면 그건 "더 낫다"가 아니라 트레이드오프입니다. 참고로 현재 API 단가는 이렇습니다 (100만 토큰당, 환율 1,340원 기준 세전 환산).
| 모델 | 입력 | 출력 |
|---|---|---|
| Claude Opus 5 | 6,700원 | 33,500원 |
| Claude Sonnet 5 | 2,680원 | 13,400원 |
| Claude Haiku 4.5 | 1,340원 | 6,700원 |
API도 원화 정가가 없습니다. 달러로 청구되고 개인 결제라면 부가세가 붙으며, 매달 환율만큼 금액이 흔들립니다. 사업자로 등록해 쓰면 부가세 처리가 달라지니 세무 쪽 확인이 필요합니다.
재보면 대개 이런 결론이 나옵니다
여러 팀의 경험이 수렴하는 지점이 있습니다. "어느 모델이 더 낫다"보다 "어느 작업에 어느 등급이 충분하다"가 훨씬 쓸모 있는 결론입니다.
정형적인 변환, 테스트 작성, 보일러플레이트에는 작은 모델로 충분한 경우가 많습니다. 설계 판단이 얽힌 작업에서만 큰 모델의 차이가 드러납니다. 이걸 알면 비용 구조가 바뀝니다 — 모델을 하나 고르는 게 아니라 작업별로 배분하게 됩니다.
정리
- 언어별 우열표는 대체로 근거가 약합니다. 저도 만들지 않았습니다.
- 공개 벤치마크는 당신의 코드베이스를 대변하지 않습니다.
- 실제로 필요한 건 자기 저장소의 실제 이슈 + 자동 채점 + 비용 기록입니다.
- 결론은 보통 "무엇이 더 낫다"가 아니라 **"어디에 무엇으로 충분하다"**로 나옵니다.
직접 재보신 적 있으신가요? 어떤 기준으로 채점하셨는지 궁금합니다.
출처
- SWE-bench — 실제 GitHub 이슈로 채점하는 코딩 벤치마크. 본문에서 말한 "공개 벤치마크"의 대표격입니다.
- Aider polyglot 코딩 리더보드 — 여러 언어에 걸쳐 편집 성공률을 재는 리더보드.
- Anthropic API 가격 문서 — Claude 모델 단가.
- OpenAI API 가격 — OpenAI 모델 단가.