GPT-5.5 · 동일 모델로 세 스캐폴드 비교 · 단일 시도, 실행 피드백 없음, 기억층 탑재 · 공식 하네스 채점
자세히 ↓Polyglot 122/122(Python + Go + JS) · HumanEval+ 93.9% · JARVIS CODE 풀스택 통과, 아무것도 안 잃음
자세히 ↓장거리 대화 생존을 재는 공개 벤치마크는 없습니다. 우리가 만듭니다. RFC 작성 중 · github.com/longhaul-bench
자세히 ↓JARVIS CODE는 에이전트 아래에 영속 기억층(JLC)을 깔고 다닙니다. 당연한 걱정: 그거 끌고 다니면 모델이 느려지지 않나? 이 페이지가 그 답입니다 — 표준 코딩 벤치마크를 JARVIS CODE로 끝까지 돌리되, 채점은 공식 하네스가 하고 에이전트는 절대 자기 점수를 매기지 않습니다. 전 런 공통 구성: 챗 = GPT-5.5(정액 구독 경로), 인코더 = gpt-5.4-mini, 중고 노트북 한 대(i5-8500, 8GB RAM).
현세대 에이전트들이 측정받는 그 벤치마크: 열두 개 파이썬 코드베이스(django, sympy, astropy…)에서 나온 실제 GitHub 이슈 500건. 에이전트는 버그 시점의 저장소와 이슈 본문을 받아 작동하는 패치를 만들어야 합니다. 판정은 공식 SWE-bench 하네스 — 에이전트가 볼 수 없는 숨겨진 테스트를 컨테이너에서 실행합니다.
같은 뇌, 세 개의 몸. 스캐폴드를 분리해내는 유일한 비교는 모델을 고정하는 것 — 그래서 이 차트는 GPT-5.5 단일 모델을 세 가지 하네스로 돌린 결과만 담습니다:
| GPT-5.5를 돌린 스캐폴드 | % 해결 | 조건 |
|---|---|---|
| mini-SWE-agent Vals AI 실측 · 2026-07 | 82.6 | 독립 · bash 단일 도구 미니멀 에이전트 (SWE-bench 공식 레퍼런스 에이전트) · n=500 |
| OpenHands OpenHands Index · 2026-04 | 78.2 | 가장 널리 쓰이는 오픈소스 에이전트 · 테스트 실행 단계 + critic/재시도 인프라 · reasoning_effort=high · n=500 · 공개 tarball 직접 검증 |
| JARVIS Code 이 결과 | 75.6 | 단일 시도생성 중 테스트 실행 0회중고 노트북정액 구독기억층 탑재추론 강도 medium자체 실측 |
세 행을 절제 실험(ablation)으로 읽으십시오: 같은 모델, 같은 500문제, 다른 스캐폴드. mini-SWE-agent는 모델에게 bash 하나만 줍니다 — repo 테스트를 돌릴 자유까지 포함해서. OpenHands는 테스트 실행 단계와 critic/재시도 인프라가 붙은 풀 에이전트 SDK입니다(인스턴스별 공개 아카이브가 내려받아지고, 391/500은 우리가 직접 검증했습니다). JARVIS Code는 눈 감고 한 방이었습니다 — 노트북에 저장소별 테스트 환경이 없어 생성 중 테스트 실행이 0회였고, 그동안 기억층은 내내 탑재 상태였습니다. 명시할 비대칭이 하나 더 있습니다: OpenHands는 reasoning_effort=high로 달렸고(자체 tarball 메타데이터), 우리 턴은 라우트 기본값 medium이었습니다 — 실행 루프와 나란한 두 번째 회수 가능 레버입니다. 실행 피드백을 통째로 포기하고도 가장 널리 쓰이는 오픈소스 에이전트의 2.6점 아래에 착지한 것 — 그게 이 페이지가 존재하는 이유입니다: 이 스프레드는 피드백 루프의 값이지 기억층의 값이 아닙니다. 그리고 천장이 아니라 바닥입니다: 실행 루프는 로드맵 항목이지만, 망각은 로드맵으로 안 고쳐집니다. (제외: 애그리게이터에 도는 GPT-5.5 "Verified 88.7%"는 원출처 추적이 안 되는 숫자입니다 — OpenAI 공식 출시 보고에는 SWE-Bench Pro 58.6%만 있고 Verified 수치 자체가 없으며, OpenAI는 2026년 2월부로 Verified 보고를 중단했습니다. 참고, 타 모델 포함 전체 필드: 현재 Verified 절대 1위는 Claude Mythos 5 95.5%, 벤더 공개 5회 평균.)
런 무결성: 500/500 생성(노트북 무인 33시간), 패치 적용 성공 498, 빈 패치 2건은 실패로 집계 — 제외한 것 없음. 채점: 공식 swebench 4.1.0 하네스, 498/498 평가, 에러 0, 인스턴스별 로그 전량 보존. 실패 인스턴스 ID는 증거 팩에 공개.
이 오래된 벤치들은 모든 프론티어 모델의 학습 데이터에 들어 있어 최신 모델 순위를 가릴 수 없습니다 — 리더보드도 2024년 말에 동결됐습니다. 대신 증명할 수 있는 것: 스캐폴드 무해성. 기억층까지 얹은 JARVIS CODE 풀스택을 통과해도 모델은 아무것도 잃지 않습니다.
HumanEval+를 공식 EvalPlus 리더보드 역대 최강 엔트리들과 나란히:
| 모델 | base | + 추가 테스트 | 출처 |
|---|---|---|---|
| JARVIS Code + GPT-5.5 이 결과 | 98.2 | 93.9 | 이 런 · 에이전틱 |
| o1-preview 2024-09 | 96.3 | 89.0 | EvalPlus 리더보드 |
| GPT-4o 2024-08 | 92.7 | 87.2 | EvalPlus 리더보드 |
| Qwen2.5-Coder-32B | 92.1 | 87.2 | EvalPlus 리더보드 |
| Claude 3.5 Sonnet 2024-06 | 87.2 | 81.7 | EvalPlus 리더보드 |
Polyglot 판정은 에이전트 종료 후 러너가 직접 돌리는 클린 테스트(pytest / go test / npm test)이며 테스트 파일은 SHA-256으로 변조 검사합니다. HumanEval+는 공식 evalplus 하네스 채점 — 전 풀이에서 evalplus 참조 0건(스캔), 실패 10건 전부 공개. Polyglot은 Python/Go/JS 슬라이스(6언어 225태스크 중 122) — C++, Java, Rust는 미포함이라 풀셋 비교는 성립하지 않습니다.
위 벤치들은 전부 태스크마다 새 세상을 줍니다 — 실전은 정확히 그 반대입니다. 실전은 몇 주를 이어지는 하나의 대화입니다. 거기서 에이전트는 죽지 않습니다. 조용히 잊습니다(컴팩션이 디테일을 떨굽니다). 아니면 비용 곡선이 폭발합니다. 장거리 대화 생존을 재는 공개 벤치마크는 없습니다. 그래서 우리가 만듭니다.
LongHaul-Bench — "LongHaul measures agents, not foundation models." 시드 생성 합성 세계에 조어 토큰으로 만든 사실을 심고(세상지식으로 못 때려맞힘), 거리를 늘려가며 소환을 시험합니다. 대본의 이벤트 타임라인이 곧 답지 — 채점은 결정적, LLM 심판 없음. 에이전트는 각자의 기억 전략을 들고 옵니다: 컴팩션, RAG, 메모, DB 전부 합법. 금지는 답지 접근 하나. 정확도 옆에 비용을 나란히 잽니다: 턴별 토큰 원장으로 리더보드는 2축 — 더 기억하되, 얼마 들었는지 보이십시오.
헌법: 이것은 JARVIS 벤치마크가 아닙니다 — 설계부터 에이전트 중립이며, 누구나 돌릴 수 있는 공개 하네스로 갑니다. 런칭 베이스라인: Claude Code, Codex CLI, bare-LLM 풀리플레이 대조군 — 우리가 지는 축도 그대로 공개합니다. 공개 인스턴스 + 비공개 시드(공개 대본을 외워도 새 시드에선 0점 — 심는 토큰이 바뀌고 구조만 유지). 상태: RFC 작성 중 · github.com/longhaul-bench
이 페이지의 모든 벤치마크에 같은 규칙이 적용됩니다:
| 규칙 | 의미 |
|---|---|
| 에이전트는 자기 점수를 매기지 않음 | 판정은 공식 하네스(swebench, evalplus) 또는 에이전트 종료 후 러너가 직접 돌리는 클린 테스트. |
| 단일 시도, 단일 런 | 태스크당 한 번, 벤치당 한 런. 벤더 플래그십 숫자는 다회 시도 평균인 경우가 많고, 아는 한 병기. |
| SWE-bench에서 실행 피드백 없음 | 생성 중 저장소 테스트 실행 0회 — 전 패치가 눈 감고 한 방. 상위 하네스들은 테스트를 돌려가며 고칩니다. 차트에 병기. |
| 변조 검사 | 벤치 테스트 파일 해시 검증 · 풀이의 벤치 데이터 접근 스캔 · SWE 패치의 테스트 파일 수정 필터링. |
| 제외 없음 | 빈 생성·실패 생성도 실패로 집계. 실패 인스턴스 ID 전부 공개. |
| 오염 명시 | HumanEval(2021)과 Exercism은 모든 모델의 학습 데이터에 포함 — 그 점수들은 모델 지능이 아니라 스캐폴드 무해성의 증명. 현세대 비교의 무대는 SWE-bench Verified. |
| 하드웨어 정직성 | 생성은 중고 노트북 한 대(i5-8500, 8GB RAM) + 정액 구독 — 서버 플릿 없음, 토큰당 과금 없음. |
러너 코드(bench/)는 저장소에 포함되어 있고, 모든 런의 결과·로그·인스턴스별 리포트가 보존되어 있습니다. 당신의 AI에게 물어보십시오: