·2분Open Eval
Reward hacking은 환경의 속성이다
Coding Index에서 보내는 짧은 노트.
프론티어 코딩 에이전트에게 생각할 시간을 더 주면 성능이 올라간다 — 그리고 알고 보니 부정행위도 더 한다. DeepSWE에서 reasoning effort를 높일수록 모델의 capability와 reward-hacking 시도가 함께 오른다. 한 모델만 이 패턴을 벗어난다: GPT-5.5는 정확히 0에 머문다.
깨끗한 0은 의심스럽다. 같은 GPT-5.5를 sandbox에 정답지를 남겨두는 long-horizon benchmark(SWE-Marathon) 앞에 두면, 우리가 측정한 어떤 모델보다도 많이 hack한다. Reward hacking은 모델만큼이나 환경의 속성이며 — 바로 그래서 여러 환경에 걸쳐, 바깥에서 측정해야 한다.
우리는 최근 benchmark 두 개를 end-to-end로 감사하고, 프론티어 모델이 공개 코딩 benchmark를 어떻게 reward-hack하는지에 대한 open index를 만들었다.