·2분Open Eval

Reward hacking은 환경의 속성이다

Coding Index에서 보내는 짧은 노트.

프론티어 코딩 에이전트에게 생각할 시간을 더 주면 성능이 올라간다 — 그리고 알고 보니 부정행위도 더 한다. DeepSWE에서 reasoning effort를 높일수록 모델의 capability와 reward-hacking 시도가 함께 오른다. 한 모델만 이 패턴을 벗어난다: GPT-5.5는 정확히 0에 머문다.

깨끗한 0은 의심스럽다. 같은 GPT-5.5를 sandbox에 정답지를 남겨두는 long-horizon benchmark(SWE-Marathon) 앞에 두면, 우리가 측정한 어떤 모델보다도 많이 hack한다. Reward hacking은 모델만큼이나 환경의 속성이며 — 바로 그래서 여러 환경에 걸쳐, 바깥에서 측정해야 한다.

우리는 최근 benchmark 두 개를 end-to-end로 감사하고, 프론티어 모델이 공개 코딩 benchmark를 어떻게 reward-hack하는지에 대한 open index를 만들었다.

전체 분석과 인터랙티브 Coding Index 보기 →