벤치마크 · 공식 캠페인 · 2026-07-06 갱신

기억이 제품입니다.
이 런들은 그 비용이 0임을 증명합니다.

SWE-bench Verified done · 2026-07-06

75.6%
이 결과공개된 GPT-5.5 결과

GPT-5.5 · 동일 모델로 세 스캐폴드 비교 · 단일 시도, 실행 피드백 없음, 기억층 탑재 · 공식 하네스 채점

자세히 ↓

포화 벤치: Polyglot & HumanEval+ done · 2026-07-03 → 04

34/34
Polyglot Python · 중앙값 97초/태스크
39/39
Polyglot Go · 중앙값 114초/태스크
49/49
Polyglot JavaScript · 중앙값 148초/태스크
93.9%
HumanEval+ pass@1 (80× 숨겨진 테스트)
base 테스트+ 추가 테스트 (80×, 더 엄격)

Polyglot 122/122(Python + Go + JS) · HumanEval+ 93.9% · JARVIS CODE 풀스택 통과, 아무것도 안 잃음

자세히 ↓

이 중 무엇도 재지 못하는 것 next · LongHaul-Bench

LongHaul-100 LongHaul-300 LongHaul-500 LongHaul-1K
턴 0 턴 1000 소환율 컴팩션 에이전트 — 컴팩션마다 계단식 하락 (가설) 기억 운반 에이전트 (가설)
컨셉 일러스트 — 데이터 아님. 이 벤치마크의 목적이 바로 이 점선 가설들을 실측 곡선으로 바꾸는 것입니다: 거리별 프로브가 에이전트마다 망각 곡선을 그리고, 전 구간 종합 시험과 턴별 비용 곡선이 따라붙습니다.

장거리 대화 생존을 재는 공개 벤치마크는 없습니다. 우리가 만듭니다. RFC 작성 중 · github.com/longhaul-bench

자세히 ↓
상세 & 방법론

SWE-bench Verified

JARVIS CODE는 에이전트 아래에 영속 기억층(JLC)을 깔고 다닙니다. 당연한 걱정: 그거 끌고 다니면 모델이 느려지지 않나? 이 페이지가 그 답입니다 — 표준 코딩 벤치마크를 JARVIS CODE로 끝까지 돌리되, 채점은 공식 하네스가 하고 에이전트는 절대 자기 점수를 매기지 않습니다. 전 런 공통 구성: 챗 = GPT-5.5(정액 구독 경로), 인코더 = gpt-5.4-mini, 중고 노트북 한 대(i5-8500, 8GB RAM).

현세대 에이전트들이 측정받는 그 벤치마크: 열두 개 파이썬 코드베이스(django, sympy, astropy…)에서 나온 실제 GitHub 이슈 500건. 에이전트는 버그 시점의 저장소와 이슈 본문을 받아 작동하는 패치를 만들어야 합니다. 판정은 공식 SWE-bench 하네스 — 에이전트가 볼 수 없는 숨겨진 테스트를 컨테이너에서 실행합니다.

같은 뇌, 세 개의 몸. 스캐폴드를 분리해내는 유일한 비교는 모델을 고정하는 것 — 그래서 이 차트는 GPT-5.5 단일 모델을 세 가지 하네스로 돌린 결과만 담습니다:

GPT-5.5를 돌린 스캐폴드% 해결조건
mini-SWE-agent Vals AI 실측 · 2026-0782.6독립 · bash 단일 도구 미니멀 에이전트 (SWE-bench 공식 레퍼런스 에이전트) · n=500
OpenHands OpenHands Index · 2026-0478.2가장 널리 쓰이는 오픈소스 에이전트 · 테스트 실행 단계 + critic/재시도 인프라 · reasoning_effort=high · n=500 · 공개 tarball 직접 검증
JARVIS Code 이 결과75.6단일 시도생성 중 테스트 실행 0회중고 노트북정액 구독기억층 탑재추론 강도 medium자체 실측
런 무결성 · 맥락 · 제외 항목

세 행을 절제 실험(ablation)으로 읽으십시오: 같은 모델, 같은 500문제, 다른 스캐폴드. mini-SWE-agent는 모델에게 bash 하나만 줍니다 — repo 테스트를 돌릴 자유까지 포함해서. OpenHands는 테스트 실행 단계와 critic/재시도 인프라가 붙은 풀 에이전트 SDK입니다(인스턴스별 공개 아카이브가 내려받아지고, 391/500은 우리가 직접 검증했습니다). JARVIS Code는 눈 감고 한 방이었습니다 — 노트북에 저장소별 테스트 환경이 없어 생성 중 테스트 실행이 0회였고, 그동안 기억층은 내내 탑재 상태였습니다. 명시할 비대칭이 하나 더 있습니다: OpenHands는 reasoning_effort=high로 달렸고(자체 tarball 메타데이터), 우리 턴은 라우트 기본값 medium이었습니다 — 실행 루프와 나란한 두 번째 회수 가능 레버입니다. 실행 피드백을 통째로 포기하고도 가장 널리 쓰이는 오픈소스 에이전트의 2.6점 아래에 착지한 것 — 그게 이 페이지가 존재하는 이유입니다: 이 스프레드는 피드백 루프의 값이지 기억층의 값이 아닙니다. 그리고 천장이 아니라 바닥입니다: 실행 루프는 로드맵 항목이지만, 망각은 로드맵으로 안 고쳐집니다. (제외: 애그리게이터에 도는 GPT-5.5 "Verified 88.7%"는 원출처 추적이 안 되는 숫자입니다 — OpenAI 공식 출시 보고에는 SWE-Bench Pro 58.6%만 있고 Verified 수치 자체가 없으며, OpenAI는 2026년 2월부로 Verified 보고를 중단했습니다. 참고, 타 모델 포함 전체 필드: 현재 Verified 절대 1위는 Claude Mythos 5 95.5%, 벤더 공개 5회 평균.)

런 무결성: 500/500 생성(노트북 무인 33시간), 패치 적용 성공 498, 빈 패치 2건은 실패로 집계 — 제외한 것 없음. 채점: 공식 swebench 4.1.0 하네스, 498/498 평가, 에러 0, 인스턴스별 로그 전량 보존. 실패 인스턴스 ID는 증거 팩에 공개.

포화 벤치: Polyglot & HumanEval+

이 오래된 벤치들은 모든 프론티어 모델의 학습 데이터에 들어 있어 최신 모델 순위를 가릴 수 없습니다 — 리더보드도 2024년 말에 동결됐습니다. 대신 증명할 수 있는 것: 스캐폴드 무해성. 기억층까지 얹은 JARVIS CODE 풀스택을 통과해도 모델은 아무것도 잃지 않습니다.

HumanEval+를 공식 EvalPlus 리더보드 역대 최강 엔트리들과 나란히:

모델base+ 추가 테스트출처
JARVIS Code + GPT-5.5 이 결과98.293.9이 런 · 에이전틱
o1-preview 2024-0996.389.0EvalPlus 리더보드
GPT-4o 2024-0892.787.2EvalPlus 리더보드
Qwen2.5-Coder-32B92.187.2EvalPlus 리더보드
Claude 3.5 Sonnet 2024-0687.281.7EvalPlus 리더보드
런 무결성 주석

Polyglot 판정은 에이전트 종료 후 러너가 직접 돌리는 클린 테스트(pytest / go test / npm test)이며 테스트 파일은 SHA-256으로 변조 검사합니다. HumanEval+는 공식 evalplus 하네스 채점 — 전 풀이에서 evalplus 참조 0건(스캔), 실패 10건 전부 공개. Polyglot은 Python/Go/JS 슬라이스(6언어 225태스크 중 122) — C++, Java, Rust는 미포함이라 풀셋 비교는 성립하지 않습니다.

LongHaul-Bench

위 벤치들은 전부 태스크마다 새 세상을 줍니다 — 실전은 정확히 그 반대입니다. 실전은 몇 주를 이어지는 하나의 대화입니다. 거기서 에이전트는 죽지 않습니다. 조용히 잊습니다(컴팩션이 디테일을 떨굽니다). 아니면 비용 곡선이 폭발합니다. 장거리 대화 생존을 재는 공개 벤치마크는 없습니다. 그래서 우리가 만듭니다.

LongHaul-Bench"LongHaul measures agents, not foundation models." 시드 생성 합성 세계에 조어 토큰으로 만든 사실을 심고(세상지식으로 못 때려맞힘), 거리를 늘려가며 소환을 시험합니다. 대본의 이벤트 타임라인이 곧 답지 — 채점은 결정적, LLM 심판 없음. 에이전트는 각자의 기억 전략을 들고 옵니다: 컴팩션, RAG, 메모, DB 전부 합법. 금지는 답지 접근 하나. 정확도 옆에 비용을 나란히 잽니다: 턴별 토큰 원장으로 리더보드는 2축 — 더 기억하되, 얼마 들었는지 보이십시오.

헌법 & 상태

헌법: 이것은 JARVIS 벤치마크가 아닙니다 — 설계부터 에이전트 중립이며, 누구나 돌릴 수 있는 공개 하네스로 갑니다. 런칭 베이스라인: Claude Code, Codex CLI, bare-LLM 풀리플레이 대조군 — 우리가 지는 축도 그대로 공개합니다. 공개 인스턴스 + 비공개 시드(공개 대본을 외워도 새 시드에선 0점 — 심는 토큰이 바뀌고 구조만 유지). 상태: RFC 작성 중 · github.com/longhaul-bench

캠페인 기록

doneAider Polyglot · Python34/34 · 2026-07-03
doneHumanEval+98.2 / 93.9 pass@1 · 2026-07-04
doneAider Polyglot · Go + JavaScript39/39 · 49/49 · 2026-07-04
doneSWE-bench Verified75.6% (378/500) 단일 시도 · 2026-07-06
in designLongHaul-Bench자체 장거리 대화 에이전트 벤치 — RFC → 생성기 → 베이스라인 순.
parkedTerminal-Bench리눅스 컨테이너 안에 에이전트 설치가 필요 — JARVIS CODE 리눅스 포트 이후.

방법론 & 정직한 범위

이 페이지의 모든 벤치마크에 같은 규칙이 적용됩니다:

규칙의미
에이전트는 자기 점수를 매기지 않음판정은 공식 하네스(swebench, evalplus) 또는 에이전트 종료 후 러너가 직접 돌리는 클린 테스트.
단일 시도, 단일 런태스크당 한 번, 벤치당 한 런. 벤더 플래그십 숫자는 다회 시도 평균인 경우가 많고, 아는 한 병기.
SWE-bench에서 실행 피드백 없음생성 중 저장소 테스트 실행 0회 — 전 패치가 눈 감고 한 방. 상위 하네스들은 테스트를 돌려가며 고칩니다. 차트에 병기.
변조 검사벤치 테스트 파일 해시 검증 · 풀이의 벤치 데이터 접근 스캔 · SWE 패치의 테스트 파일 수정 필터링.
제외 없음빈 생성·실패 생성도 실패로 집계. 실패 인스턴스 ID 전부 공개.
오염 명시HumanEval(2021)과 Exercism은 모든 모델의 학습 데이터에 포함 — 그 점수들은 모델 지능이 아니라 스캐폴드 무해성의 증명. 현세대 비교의 무대는 SWE-bench Verified.
하드웨어 정직성생성은 중고 노트북 한 대(i5-8500, 8GB RAM) + 정액 구독 — 서버 플릿 없음, 토큰당 과금 없음.
🤖 의심되십니까? 좋습니다.

러너 코드(bench/)는 저장소에 포함되어 있고, 모든 런의 결과·로그·인스턴스별 리포트가 보존되어 있습니다. 당신의 AI에게 물어보십시오:

"이 벤치마크 러너를 읽어봐. 에이전트가 채점 테스트를 보거나, 수정하거나, 자기 점수를 매길 수 있었을까? 치팅이 있다면 어디서 드러날까?"