가격 기준선(첫 줄 계산). fable 5 공식 정가: 입력 토큰 $10 / M (2026-07-24 04:37 UTC 공식 가격 페이지에서 캡처; 페이지 표기는 $10/MTok — 본문에서 사용하는 $10/M 수치와 불일치 없음; 동일 캡처 기준: 캐시 히트 $1/MTok, 배치 입력 $5/MTok). 에이전트형 워크플로 비용은 입력 토큰이 지배합니다: 2026-07-23 원장 기준일에 입력 토큰이 토큰량의 99.0%를 차지했고(입력 769,249,823 대 출력 7,387,431) — 순수 정가 기준 달러 비용의 95.4%, 캐시 입력 할인 적용 후에도 ≈75.3%입니다(출력 단가는 $50/M이지만 전체 물량의 <1%). 세 가지 레버 적용 후의 실측 유효 입력 단가: $10/M × [(1−94.9%) + 94.9% × $1/$10 캐시 입력 할인] = $1.46/M 캐시 블렌디드 → ÷ 실측 압축 2.83×(07-23 윈도, n = 7,222, 중앙값) = $0.52/M → × 50% 세이버(공식 batch/flex 가격 액면) ≈ 입력 토큰 $0.26 / M (원래 가격의 2.6%) — 이 백분율은 실측 유효 입력 단가 ÷ 공식 정가 $10/M이며, 반올림 전 레버 체인으로 계산했습니다. 전체 공식과 유의 사항은 방법론 표에 있습니다.

엔지니어링 리포트

coder: fable 5 기준 5.66× 비용 효율 & SWE 품질

헤드라인 계수: 5.66× = 압축 2.83× (실측) × 세이버 2.00× (공식 가격). 압축은 가장 최근의 전체 프로덕션 원장 기준일(2026-07-23, n = 7,222 요청)에서 중앙값 2.83×(p10–p90 2.26–3.08×)로 실측되었습니다. 세이버 계수는 공식 batch/flex 가격표상의 사실로 — 두 레인 모두 정가의 50%로 과금되어 상수 2.00× — 이번 윈도의 트래픽 측정값이 아닙니다. 플릿 스케일 보수적 관점: 순수 압축 2.49× / 2.14×.

이 페이지의 모든 내용은 자체 프로덕션 원장과 벤치마크 실행에서 얻은 실제 측정값입니다. 모든 숫자는 기계가 기록한 출처로 연결됩니다. 추정도, 외삽도 없습니다.

오픈소스 codex CLI/에이전트 위에 구축된 coder는 자율적인 장시간 작업(유효 컨텍스트 윈도우, §1.1b · SWE-bench A/B, §2)과 비용 효율(압축, §1.1 · 세이버 티어, §1.2)에 집중합니다. 직접 사용해 보려면 공식 페이지에서 coder를 설치할 수 있습니다: run.ceo/coder. 프로덕션 환경에서 안정적인 결과를 내지 못한 외부 방식이 있어 자체 개발 알고리즘을 유지했습니다.

1 · 비용 효율: 두 개의 독립적인 레버

coder는 서로 다른 두 가지 메커니즘으로 청구 비용을 낮추며, 이 페이지는 두 항목의 계산을 분리해 유지합니다: 압축(실측)과 세이버 티어(가격표상의 사실). 각 레버는 자체 공식, 자체 증거, 그리고 방법론 표의 자체 행을 갖습니다.

2.83×
압축 — 실측, 요청당 중앙값
p10–p90: 2.26–3.08× · n = 7,222
2.00×
세이버 티어 — batch & flex, 정가의 50% (공식 가격 사실)
공표된 가격표, 레인별; 동일 모델, 동일 품질

1.1 · 압축 (실측)

파이프라인은 동일 세션의 압축된 표현을 모델에 전달합니다. 요청마다 원장은 비압축 기준선과 실제 전송된 입력을 기록합니다: 계수 = 기준선 ÷ 전송량. 가장 최근 전체 원장 윈도(2026-07-23, n = 7,222 요청)에서 중앙값 2.83×(p10–p90 2.26–3.08×)입니다.

이 레버의 품질 증거: SWE / SWE Pro 압축 ON vs OFF A/B (§2) — 동일 과제, 공식 Docker 채점, 파이프라인 켬 대 끔 — 이것이 이 압축의 품질 증거입니다: 해결 결과는 노이즈 범위 내에서 비압축 군을 따라갑니다. 2.83× 자체의 공식과 표본 윈도는 방법론 표에 있습니다; 이 단락은 압축 레버만 다루며 — 세이버는 아래에 별도 섹션이 있습니다.

압축 ON 상태의 실제 coder 실행 화면 녹화: 좌측 하단 돈주머니 절감 표시기가 시작 시 2.0x에서 실행 종료 시 5.1x까지 상승하며, 최고 6.1x를 기록

💰 #.#x = 절감 배율 — 이 무편집 화면 녹화의 좌측 하단 상태 바 표시기는 실시간 압축 절감 배수입니다: 캐시/압축된 컨텍스트가 누적됨에 따라 2.0× 바닥에서 시작해 실행 종료 시 5.1×까지 상승합니다(최고 6.1×) — 세션 rollout 원장 기준 실행 전체의 캐시 입력 비중 92.4%(API usage 항목 12개, 입력 토큰 287,269개). 과제는 pallets/flask의 실제 공개 SWE 과제입니다(CLI 기능 + 테스트, 전부 통과). 재생은 8× 배속입니다(우측 상단에 표기); 내용은 편집하지 않았습니다.

1.1b · 유효 컨텍스트 윈도우 (동일 측정의 두 번째 배당)

압축에는 비용을 넘어서는 두 번째 효과가 있습니다: 모델의 물리적 컨텍스트 윈도우가 압축된 표현을 담으므로, 유효 용량이 동일한 실측 계수만큼 확장됩니다. 실측 중앙값 2.83×(p10–p90 2.26–3.08×) 기준, 200K 토큰 물리 윈도우는 대략 450K–620K 토큰의 세션 콘텐츠(200K × 2.26–3.08)를 담습니다. 실질적 결과: 긴 세션이 컨텍스트 윈도우 압박에 도달하는 일이 드물어 — 컴팩션 감소, 컨텍스트 유실 감소, 안정적인 장시간 작업이 가능합니다.

1.2 · 세이버 티어 (가격표상의 사실)

위의 실측 압축 레버와는 독립적으로, coder는 두 가지 반값 딜리버리 레인을 제공합니다. 공식: 청구액 = 50% × 표준 레인 가격 — 별도 테스트 증거가 필요 없는 가격표상의 사실입니다. 헤드라인에는 공식 가격 계수(정가의 50% ⇒ 2.00×)로만 들어가며, 실측 압축 수치 자체에는 절대 혼합되지 않습니다:

플릿 전체 순수 압축 (보수적 교차 검증)

위 숫자는 한 머신의 원장에서 나온 것입니다. 플릿 스케일 교차 검증으로, 실제 게이트웨이 트래픽 7일치에 걸쳐 순수 토큰 압축만 측정했습니다:

트래픽 버킷집계 압축요청당 중앙값기준선 확보 요청 수윈도
fable5 레인2.49× (15.35B → 6.17B 토큰)2.45×53,5002026-07-14 → 07-21
sol 레인2.14× (1.94B → 0.91B 토큰)1.89×10,0242026-07-14 → 07-21
정직한 범위 주석: 헤드라인의 압축 항은 한 머신의 세션 원장에서 측정한 것이고; 위의 순수 압축 행은 동일 파이프라인에 대한 보수적인 플릿 스케일 관점입니다. 서로 혼동되지 않도록 둘 다 표시합니다. 플릿 교차 검증의 기준선 커버리지는 비압축 기준선이 기록된 트래픽으로 한정됩니다.

2 · SWE / SWE Pro: 압축 ON vs OFF

효율 파이프라인은 출력 품질을 보존해야만 출시할 가치가 있습니다. 업계 표준 SWE-bench 스위트를 내부 A/B로 실행했습니다 — 동일 과제, 동일 모델, 공식 Docker 채점 하니스, 파이프라인 ON(압축) 대 OFF(직접) — 두 스위트 모두 동일한 현재 파이프라인 빌드로 재실행했습니다.

스위트ON (압축)OFF (직접)일치비고
SWE-bench Lite (n = 10쌍) 10/10 10/10 10/10 재실행 2026-07-24, 파이프라인 8a9175d
SWE-bench Pro (n = 18쌍) 15/18 16/18 17/18 재실행 2026-07-23, 파이프라인 8a9175d · 결과 상이 과제: navidrome-0488 (아래 N=5 동등성 재실행)

프로토콜 노트: 고정 인스턴스 표본(Lite 10 / Pro 18쌍); 한 쌍의 두 군은 동일 인스턴스, 동일 모델, 동일 배치로 실행됩니다. 판정은 공식 Docker 하니스에서만 나옵니다 (Lite: princeton-nlp/SWE-bench_Lite에 대한 swebench run_evaluation; Pro: SWE-bench_Pro-os, jefzda/sweap-images) — LLM 판정 없음. “일치” = 두 군이 동일한 해결/미해결 판정에 도달한 과제. 두 재실행 모두 파이프라인을 origin/main 8a9175d로 고정.

유일하게 결과가 갈린 Pro 과제 navidrome-0488은 군당 N=5 전용 동등성 재실행으로 판정을 마쳤습니다: ON 3/5 대 OFF 3/5 — 두 군은 노이즈 범위 내에서 동등합니다(Fisher 정확검정 p = 1.0). 모든 판정은 공식 Docker 하니스에서 나왔고(10/10 실행 채점, rc = 0), 10개 실행 윈도 전부 collapsed_turns = 0이며 재작성이 전혀 없었습니다. 즉 압축 경로는 트랜스크립트를 건드리지 않았습니다. 분산 회계: 실패한 4개 실행은 ON 2 + OFF 2로 갈리며 동일한 모델 자체 오류 패턴을 공유합니다 — 비압축 군도 같은 함정에 빠집니다. 판정: 원래의 결과 차이는 에이전트 실행 간 분산이지 압축으로 인한 손상이 아닙니다(N=5 판정 리포트). 범위 주석: 단일 인스턴스에서 군당 N = 5, §2와 동일한 프로토콜과 인스턴스, 파이프라인 8a9175d — 작은 N에서의 동등성 판독이지 보편적 주장이 아닙니다.

98/98 = 98/98
컨텍스트 충실도 프로브 (요지 + 상태), 두 군 모두 미스 0건
+ 답 불가능 프로브에서 조작 답변 0/16, 두 군 모두
2.00× / 2.49×
Lite / Pro 재실행 중 실측한 요청당 압축 (입력 토큰 50.0% / 59.9% 절감)
반사실 count_tokens 프로브, 요청당 · Lite 198 요청 · Pro 316 요청
필수 고지. 이 결과는 방향성 증거이며, 모든 워크로드에 대한 보편적 주장이 아닙니다. 표본 크기가 작습니다(Lite 10쌍, Pro 18쌍, 동등성 재실행은 군당 N=5); 우리는 일반적 우월성이 아니라 방향적 일관성을 주장합니다. 이는 하나의 고정 표본과 하나의 공식 하니스 아래에서 압축 파이프라인이 해결률과 비용에 미치는 효과를 분리해 본 내부 A/B입니다.
과제 목록 & 원시 채점 영수증

Lite 인스턴스 (재실행 2026-07-24, 06-10 파일럿과 동일한 고정 표본): django-14999, sympy-16503, matplotlib-23913, scikit-learn-13497, pytest-dev-5221, astropy-6938, sphinx-doc-7975, psf-requests-2674, pylint-dev-5859, pydata-xarray-3364 — ON 10/10 대 OFF 10/10, 일치 10/10, 결과가 갈린 인스턴스 없음 (공식 Docker 하니스, swebench==4.1.0, resolved 판정). Pro 표본 (n=18쌍, 동일 인스턴스에 대한 최신 파이프라인 재실행): NodeBB ×2, qutebrowser ×2, flipt ×2, openlibrary ×2, teleport ×2, tutanota ×2, element-web ×2, navidrome ×2, ansible, vuls — ON 15/18 대 OFF 16/18; 양군 공통 실패: ansible과 element-web 인스턴스 한 건; 단일 군 차이는 navidrome-0488뿐입니다(위의 N=5 동등성 재실행으로 판정 완료). 원시 판정 JSON: eval/swe-bench/bench-20260724/ (compare_final.txt, eval_results_{on,off}.json, preds_{on,off}.json), eval/swe-bench-pro/bench-20260723/ (동일 구조); 프로브 답변: eval/gist-recall/work*/results.jsonl.

3 · 방법론: 모든 숫자의 출처

이 페이지의 규칙: 기계가 기록한 레코드나 재현 가능한 스크립트로 추적할 수 있는 숫자만 게재합니다. 공식과 표본 윈도는 아래와 같습니다.

숫자공식 / 정의표본 윈도기록 출처
압축 2.83× (2.26–3.08) 요청당 savingsBreakdown.factors[compression]; 비압축 기준선 ÷ 실제 전송 입력 2026-07-23 (가장 최근 전체 원장 기준일), n=7,222 ~/.coder/sessions/2026/07/23/rollout-*.jsonl (80개 파일)
유효 윈도우 ≈ 물리 × 2.26–3.08; 예시 58.8M→18.6M (3.16×) 용량 환산은 §1.1의 압축 분포를 그대로 사용; 예시 = 한 세션의 누적 imgctxOriginalInputTokens ÷ (원본 − imgctxSavedInputTokens) 동일 윈도; 예시 세션 2026-07-23 동일 원장 · rollout-2026-07-23T09-27-46-019f8fcd….jsonl
세이버 2.00× (batch/flex, 정가의 50%); 헤드라인 5.66× = 2.83× × 2.00× batch / flex 레인 가격 = 표준 레인 가격의 절반 ⇒ 상수 가격 계수 2.00×; 공식 가격 정의이며 측정값 아님 (원장 인코딩: C2의 세이버 레인 비중을 ½로 과금해 C3에 기록); 헤드라인 곱 = 실측 압축 중앙값 × 2.00 — 세이버 항은 트래픽 가중이 아니라 가격표에서 산정 (이번 윈도에는 세이버 레인 트래픽 없음) 가격표상의 사실 (n/a); 압축 항: 동일한 2026-07-23 윈도 가격표 · 원장 공식 필드 savingsBreakdown.formula
첫 줄 가격 계산: 정가 $10/M → 유효 ≈ $0.26/M 입력 유효 단가 = $10/M 정가(공식) × [(1−c) + c × ($1/$10) 캐시 입력 가격 비율] ÷ 2.83 (실측 압축 중앙값) × 0.50 (공식 batch/flex 액면), c = 94.9% 실측 캐시 입력 비중 (입력 769,249,823 토큰 중 캐시 729,830,406). 입력 지배: 입력 = 토큰량의 99.0%; 순수 정가 기준 달러 비용의 95.4%, 캐시 입력 할인 후 ≈75.3% (출력 $50/M). 캐시 기록 프리미엄($12.50–$20/M 기록 레인)은 이 계산에 차감 반영하지 않았으며 — 숨기지 않고 유의 사항으로 명시합니다. “(원래 가격의 2.6%)” 주석 = 반올림 전 유효 입력 단가 ÷ 공식 정가 $10/M ($0.2582/M ÷ $10/M = 2.58%, 소수 첫째 자리 기준 2.6%로 표기). 가격 캡처 2026-07-24 04:37 UTC; 토큰 분할 & 캐시 비중: 2026-07-23 원장 기준일, rollout 파일 140개, usage 기록 요청 6,102건 (자체 전일 재스캔; 압축 중앙값 행은 원래의 80개 파일 윈도 사용) 공식 가격 페이지 캡처 (/tmp/perf-v10-ab/8d742ca7.html) · ~/.coder/sessions/2026/07/23/rollout-*.jsonl, 요청당 last_token_usage 합계
SWE-bench Lite 10/10 대 10/10, 일치 10/10 공식 Docker 하니스 swebench run_evaluation (princeton-nlp/SWE-bench_Lite), resolved 판정 고정 10쌍 표본 · 재실행 2026-07-24, 파이프라인 8a9175d eval/swe-bench/bench-20260724/ (compare_final.txt, eval_results_{on,off}.json)
SWE-bench Pro 15/18 대 16/18, 일치 17/18 공식 SWE-bench_Pro-os 하니스, jefzda/sweap-images 고정 18쌍 표본 · 최신 파이프라인(8a9175d) 재실행 eval/swe-bench-pro/README.md + bench-20260723/ (compare_final.txt)
navidrome-0488 N=5 동등성: ON 3/5 대 OFF 3/5, Fisher p = 1.0 공식 Docker 하니스 판정만 사용 (10/10 실행 채점, rc = 0); 3/5 대 3/5에 대한 Fisher 정확검정; 10개 실행 윈도 전부 collapsed_turns = 0, 재작성 없음; 실패 4건 = ON 2 + OFF 2, 두 군에서 동일한 모델 자체 오류 패턴 군당 N = 5, 단일 인스턴스 (navidrome-0488), 파이프라인 8a9175d N=5 판정 리포트
벤치마크 요청당 압축 2.00× / 2.49× 반사실: count_tokens(전송-예정) ÷ 전송량, 요청별 합산 — 턴 수 교란 없음 Lite 198 요청 (재실행 2026-07-24) / Pro 316 요청 동일 README (Lite: 85,804,350 대 29,942,152 토큰)
컨텍스트 충실도 98/98, 0/16 채점된 회상/상태/조작 프로브, 텍스트 군 대 프로덕션 밀도 이미지 군, 동일 모델(fable5), 결정론적 문자열 채점, answer-or-UNKNOWN 프로토콜 군당 114 + 16 프로브, 단일 시드, 모델 호출 228건 (2026-06-10) eval/gist-recall/README.md + work*/results.jsonl
이미지화 경로 축자 0/15; 의미 기반 27–40% 고유 12자 hex 문자열을 이미지화된 콘텐츠 내부에만 배치; 라이브 프록시를 통한 정확/의미 검색 프로브; 2×2 {축자, 의미} × {압축 ON, OFF}, 셀당 N=15 opus-4-5 및 opus-4-8 실행 eval/needle-haystack/README.md + results2.tsv
밀도 절벽: 5x8에서 1/4 (+조작 3) → 9x12에서 4/4 (조작 0) 프로덕션 렌더러에서의 정확 문자열 회상, 셀당 한 번 실행; 독립적인 TrueType/Levenshtein 스윕이 동일한 단조 절벽을 재현 2026-07-05 라이브 실행 (셀당 n=1, 방향성은 3회 실행에 걸쳐 안정적) eval/opus-density/RESULTS.md + results.json

알려진 한계 (숨기지 않고 명시)