가격 기준선(첫 줄 계산). fable 5 공식 정가: 입력 토큰 $10 / M (2026-07-24 04:37 UTC 공식 가격 페이지에서 캡처; 페이지 표기는 $10/MTok — 본문에서 사용하는 $10/M 수치와 불일치 없음; 동일 캡처 기준: 캐시 히트 $1/MTok, 배치 입력 $5/MTok). 에이전트형 워크플로 비용은 입력 토큰이 지배합니다: 2026-07-23 원장 기준일에 입력 토큰이 토큰량의 99.0%를 차지했고(입력 769,249,823 대 출력 7,387,431) — 순수 정가 기준 달러 비용의 95.4%, 캐시 입력 할인 적용 후에도 ≈75.3%입니다(출력 단가는 $50/M이지만 전체 물량의 <1%). 세 가지 레버 적용 후의 실측 유효 입력 단가: $10/M × [(1−94.9%) + 94.9% × $1/$10 캐시 입력 할인] = $1.46/M 캐시 블렌디드 → ÷ 실측 압축 2.83×(07-23 윈도, n = 7,222, 중앙값) = $0.52/M → × 50% 세이버(공식 batch/flex 가격 액면) ≈ 입력 토큰 $0.26 / M (원래 가격의 2.6%) — 이 백분율은 실측 유효 입력 단가 ÷ 공식 정가 $10/M이며, 반올림 전 레버 체인으로 계산했습니다. 전체 공식과 유의 사항은 방법론 표에 있습니다.
엔지니어링 리포트
이 페이지의 모든 내용은 자체 프로덕션 원장과 벤치마크 실행에서 얻은 실제 측정값입니다. 모든 숫자는 기계가 기록한 출처로 연결됩니다. 추정도, 외삽도 없습니다.
오픈소스 codex CLI/에이전트 위에 구축된 coder는 자율적인 장시간 작업(유효 컨텍스트 윈도우, §1.1b · SWE-bench A/B, §2)과 비용 효율(압축, §1.1 · 세이버 티어, §1.2)에 집중합니다. 직접 사용해 보려면 공식 페이지에서 coder를 설치할 수 있습니다: run.ceo/coder. 프로덕션 환경에서 안정적인 결과를 내지 못한 외부 방식이 있어 자체 개발 알고리즘을 유지했습니다.
coder는 서로 다른 두 가지 메커니즘으로 청구 비용을 낮추며, 이 페이지는 두 항목의 계산을 분리해 유지합니다: 압축(실측)과 세이버 티어(가격표상의 사실). 각 레버는 자체 공식, 자체 증거, 그리고 방법론 표의 자체 행을 갖습니다.
헤드라인 계수의 구성. 압축 항: 요청당 중앙값 실측, 세션 원장 2026-07-23 (n = 7,222, ~/.coder/sessions/2026/07/23/rollout-*.jsonl, 80개 파일). 세이버 항: 공식 batch/flex 가격표(두 레인 모두 정가의 50% ⇒ 2.00×) — 가격표상의 사실이며, 이번 윈도의 트래픽 측정값이 아닙니다.
파이프라인은 동일 세션의 압축된 표현을 모델에 전달합니다. 요청마다 원장은 비압축 기준선과 실제 전송된 입력을 기록합니다: 계수 = 기준선 ÷ 전송량. 가장 최근 전체 원장 윈도(2026-07-23, n = 7,222 요청)에서 중앙값 2.83×(p10–p90 2.26–3.08×)입니다.
이 레버의 품질 증거: SWE / SWE Pro 압축 ON vs OFF A/B (§2) — 동일 과제, 공식 Docker 채점, 파이프라인 켬 대 끔 — 이것이 이 압축의 품질 증거입니다: 해결 결과는 노이즈 범위 내에서 비압축 군을 따라갑니다. 2.83× 자체의 공식과 표본 윈도는 방법론 표에 있습니다; 이 단락은 압축 레버만 다루며 — 세이버는 아래에 별도 섹션이 있습니다.
💰 #.#x = 절감 배율 — 이 무편집 화면 녹화의 좌측 하단 상태 바 표시기는 실시간 압축 절감 배수입니다: 캐시/압축된 컨텍스트가 누적됨에 따라 2.0× 바닥에서 시작해 실행 종료 시 5.1×까지 상승합니다(최고 6.1×) — 세션 rollout 원장 기준 실행 전체의 캐시 입력 비중 92.4%(API usage 항목 12개, 입력 토큰 287,269개). 과제는 pallets/flask의 실제 공개 SWE 과제입니다(CLI 기능 + 테스트, 전부 통과). 재생은 8× 배속입니다(우측 상단에 표기); 내용은 편집하지 않았습니다.
압축에는 비용을 넘어서는 두 번째 효과가 있습니다: 모델의 물리적 컨텍스트 윈도우가 압축된 표현을 담으므로, 유효 용량이 동일한 실측 계수만큼 확장됩니다. 실측 중앙값 2.83×(p10–p90 2.26–3.08×) 기준, 200K 토큰 물리 윈도우는 대략 450K–620K 토큰의 세션 콘텐츠(200K × 2.26–3.08)를 담습니다. 실질적 결과: 긴 세션이 컨텍스트 윈도우 압박에 도달하는 일이 드물어 — 컴팩션 감소, 컨텍스트 유실 감소, 안정적인 장시간 작업이 가능합니다.
rollout-2026-07-23T09-27-46-019f8fcd….jsonl, 누적 imgctxOriginalInputTokens 대 전송량).위의 실측 압축 레버와는 독립적으로, coder는 두 가지 반값 딜리버리 레인을 제공합니다. 공식: 청구액 = 50% × 표준 레인 가격 — 별도 테스트 증거가 필요 없는 가격표상의 사실입니다. 헤드라인에는 공식 가격 계수(정가의 50% ⇒ 2.00×)로만 들어가며, 실측 압축 수치 자체에는 절대 혼합되지 않습니다:
요청당 실측 압축 계수 분위수. 헤드라인 행: 세션 원장 2026-07-23 (가장 최근 전체 원장 기준일, 80개 파일, n = 7,222). 플릿 행: 실제 게이트웨이 트래픽 7일치(2026-07-14 → 07-21)에 대한 요청당 분위수 (reports/CHECK-gateway-real-compression-20260721.md, scratch/gw-real-compression-0721/). 플릿 행의 기준선 커버리지는 비압축 기준선이 기록된 트래픽으로 한정됩니다.
위 숫자는 한 머신의 원장에서 나온 것입니다. 플릿 스케일 교차 검증으로, 실제 게이트웨이 트래픽 7일치에 걸쳐 순수 토큰 압축만 측정했습니다:
| 트래픽 버킷 | 집계 압축 | 요청당 중앙값 | 기준선 확보 요청 수 | 윈도 |
|---|---|---|---|---|
| fable5 레인 | 2.49× (15.35B → 6.17B 토큰) | 2.45× | 53,500 | 2026-07-14 → 07-21 |
| sol 레인 | 2.14× (1.94B → 0.91B 토큰) | 1.89× | 10,024 | 2026-07-14 → 07-21 |
효율 파이프라인은 출력 품질을 보존해야만 출시할 가치가 있습니다. 업계 표준 SWE-bench 스위트를 내부 A/B로 실행했습니다 — 동일 과제, 동일 모델, 공식 Docker 채점 하니스, 파이프라인 ON(압축) 대 OFF(직접) — 두 스위트 모두 동일한 현재 파이프라인 빌드로 재실행했습니다.
| 스위트 | ON (압축) | OFF (직접) | 일치 | 비고 |
|---|---|---|---|---|
| SWE-bench Lite (n = 10쌍) | 10/10 | 10/10 | 10/10 | 재실행 2026-07-24, 파이프라인 8a9175d |
| SWE-bench Pro (n = 18쌍) | 15/18 | 16/18 | 17/18 | 재실행 2026-07-23, 파이프라인 8a9175d · 결과 상이 과제: navidrome-0488 (아래 N=5 동등성 재실행) |
공식 Docker 하니스만으로 집계한 군별 해결 건수 (Lite: princeton-nlp/SWE-bench_Lite에 대한 swebench run_evaluation; Pro: SWE-bench_Pro-os, jefzda/sweap-images) — LLM 판정 없음; 두 재실행 모두 파이프라인을 8a9175d로 고정. 출처: eval/swe-bench/bench-20260724/, eval/swe-bench-pro/bench-20260723/ (compare_final.txt, eval_results_{on,off}.json). 표본 크기가 작습니다(10 + 18쌍): 차트는 동등성/일치를 보여주는 것이지 우월성이 아닙니다.
유일하게 결과가 갈린 Pro 과제 navidrome-0488은 군당 N=5 전용 동등성 재실행으로 판정을 마쳤습니다: ON 3/5 대 OFF 3/5 — 두 군은 노이즈 범위 내에서 동등합니다(Fisher 정확검정 p = 1.0). 모든 판정은 공식 Docker 하니스에서 나왔고(10/10 실행 채점, rc = 0), 10개 실행 윈도 전부 collapsed_turns = 0이며 재작성이 전혀 없었습니다. 즉 압축 경로는 트랜스크립트를 건드리지 않았습니다. 분산 회계: 실패한 4개 실행은 ON 2 + OFF 2로 갈리며 동일한 모델 자체 오류 패턴을 공유합니다 — 비압축 군도 같은 함정에 빠집니다. 판정: 원래의 결과 차이는 에이전트 실행 간 분산이지 압축으로 인한 손상이 아닙니다(N=5 판정 리포트). 범위 주석: 단일 인스턴스에서 군당 N = 5, §2와 동일한 프로토콜과 인스턴스, 파이프라인 8a9175d — 작은 N에서의 동등성 판독이지 보편적 주장이 아닙니다.
Lite 인스턴스 (재실행 2026-07-24, 06-10 파일럿과 동일한 고정 표본): django-14999, sympy-16503, matplotlib-23913, scikit-learn-13497, pytest-dev-5221, astropy-6938, sphinx-doc-7975, psf-requests-2674, pylint-dev-5859, pydata-xarray-3364 — ON 10/10 대 OFF 10/10, 일치 10/10, 결과가 갈린 인스턴스 없음 (공식 Docker 하니스, swebench==4.1.0, resolved 판정). Pro 표본 (n=18쌍, 동일 인스턴스에 대한 최신 파이프라인 재실행): NodeBB ×2, qutebrowser ×2, flipt ×2, openlibrary ×2, teleport ×2, tutanota ×2, element-web ×2, navidrome ×2, ansible, vuls — ON 15/18 대 OFF 16/18; 양군 공통 실패: ansible과 element-web 인스턴스 한 건; 단일 군 차이는 navidrome-0488뿐입니다(위의 N=5 동등성 재실행으로 판정 완료). 원시 판정 JSON: eval/swe-bench/bench-20260724/ (compare_final.txt, eval_results_{on,off}.json, preds_{on,off}.json), eval/swe-bench-pro/bench-20260723/ (동일 구조); 프로브 답변: eval/gist-recall/work*/results.jsonl.
이 페이지의 규칙: 기계가 기록한 레코드나 재현 가능한 스크립트로 추적할 수 있는 숫자만 게재합니다. 공식과 표본 윈도는 아래와 같습니다.
| 숫자 | 공식 / 정의 | 표본 윈도 | 기록 출처 |
|---|---|---|---|
| 압축 2.83× (2.26–3.08) | 요청당 savingsBreakdown.factors[compression]; 비압축 기준선 ÷ 실제 전송 입력 |
2026-07-23 (가장 최근 전체 원장 기준일), n=7,222 | ~/.coder/sessions/2026/07/23/rollout-*.jsonl (80개 파일) |
| 유효 윈도우 ≈ 물리 × 2.26–3.08; 예시 58.8M→18.6M (3.16×) | 용량 환산은 §1.1의 압축 분포를 그대로 사용; 예시 = 한 세션의 누적 imgctxOriginalInputTokens ÷ (원본 − imgctxSavedInputTokens) |
동일 윈도; 예시 세션 2026-07-23 | 동일 원장 · rollout-2026-07-23T09-27-46-019f8fcd….jsonl |
| 세이버 2.00× (batch/flex, 정가의 50%); 헤드라인 5.66× = 2.83× × 2.00× | batch / flex 레인 가격 = 표준 레인 가격의 절반 ⇒ 상수 가격 계수 2.00×; 공식 가격 정의이며 측정값 아님 (원장 인코딩: C2의 세이버 레인 비중을 ½로 과금해 C3에 기록); 헤드라인 곱 = 실측 압축 중앙값 × 2.00 — 세이버 항은 트래픽 가중이 아니라 가격표에서 산정 (이번 윈도에는 세이버 레인 트래픽 없음) |
가격표상의 사실 (n/a); 압축 항: 동일한 2026-07-23 윈도 | 가격표 · 원장 공식 필드 savingsBreakdown.formula |
| 첫 줄 가격 계산: 정가 $10/M → 유효 ≈ $0.26/M 입력 | 유효 단가 = $10/M 정가(공식) × [(1−c) + c × ($1/$10) 캐시 입력 가격 비율] ÷ 2.83 (실측 압축 중앙값) × 0.50 (공식 batch/flex 액면), c = 94.9% 실측 캐시 입력 비중 (입력 769,249,823 토큰 중 캐시 729,830,406). 입력 지배: 입력 = 토큰량의 99.0%; 순수 정가 기준 달러 비용의 95.4%, 캐시 입력 할인 후 ≈75.3% (출력 $50/M). 캐시 기록 프리미엄($12.50–$20/M 기록 레인)은 이 계산에 차감 반영하지 않았으며 — 숨기지 않고 유의 사항으로 명시합니다. “(원래 가격의 2.6%)” 주석 = 반올림 전 유효 입력 단가 ÷ 공식 정가 $10/M ($0.2582/M ÷ $10/M = 2.58%, 소수 첫째 자리 기준 2.6%로 표기). | 가격 캡처 2026-07-24 04:37 UTC; 토큰 분할 & 캐시 비중: 2026-07-23 원장 기준일, rollout 파일 140개, usage 기록 요청 6,102건 (자체 전일 재스캔; 압축 중앙값 행은 원래의 80개 파일 윈도 사용) | 공식 가격 페이지 캡처 (/tmp/perf-v10-ab/8d742ca7.html) · ~/.coder/sessions/2026/07/23/rollout-*.jsonl, 요청당 last_token_usage 합계 |
| SWE-bench Lite 10/10 대 10/10, 일치 10/10 | 공식 Docker 하니스 swebench run_evaluation (princeton-nlp/SWE-bench_Lite), resolved 판정 |
고정 10쌍 표본 · 재실행 2026-07-24, 파이프라인 8a9175d | eval/swe-bench/bench-20260724/ (compare_final.txt, eval_results_{on,off}.json) |
| SWE-bench Pro 15/18 대 16/18, 일치 17/18 | 공식 SWE-bench_Pro-os 하니스, jefzda/sweap-images |
고정 18쌍 표본 · 최신 파이프라인(8a9175d) 재실행 | eval/swe-bench-pro/README.md + bench-20260723/ (compare_final.txt) |
| navidrome-0488 N=5 동등성: ON 3/5 대 OFF 3/5, Fisher p = 1.0 | 공식 Docker 하니스 판정만 사용 (10/10 실행 채점, rc = 0); 3/5 대 3/5에 대한 Fisher 정확검정; 10개 실행 윈도 전부 collapsed_turns = 0, 재작성 없음; 실패 4건 = ON 2 + OFF 2, 두 군에서 동일한 모델 자체 오류 패턴 |
군당 N = 5, 단일 인스턴스 (navidrome-0488), 파이프라인 8a9175d | N=5 판정 리포트 |
| 벤치마크 요청당 압축 2.00× / 2.49× | 반사실: count_tokens(전송-예정) ÷ 전송량, 요청별 합산 — 턴 수 교란 없음 |
Lite 198 요청 (재실행 2026-07-24) / Pro 316 요청 | 동일 README (Lite: 85,804,350 대 29,942,152 토큰) |
| 컨텍스트 충실도 98/98, 0/16 | 채점된 회상/상태/조작 프로브, 텍스트 군 대 프로덕션 밀도 이미지 군, 동일 모델(fable5), 결정론적 문자열 채점, answer-or-UNKNOWN 프로토콜 | 군당 114 + 16 프로브, 단일 시드, 모델 호출 228건 (2026-06-10) | eval/gist-recall/README.md + work*/results.jsonl |
| 이미지화 경로 축자 0/15; 의미 기반 27–40% | 고유 12자 hex 문자열을 이미지화된 콘텐츠 내부에만 배치; 라이브 프록시를 통한 정확/의미 검색 프로브; 2×2 {축자, 의미} × {압축 ON, OFF}, 셀당 N=15 | opus-4-5 및 opus-4-8 실행 | eval/needle-haystack/README.md + results2.tsv |
| 밀도 절벽: 5x8에서 1/4 (+조작 3) → 9x12에서 4/4 (조작 0) | 프로덕션 렌더러에서의 정확 문자열 회상, 셀당 한 번 실행; 독립적인 TrueType/Levenshtein 스윕이 동일한 단조 절벽을 재현 | 2026-07-05 라이브 실행 (셀당 n=1, 방향성은 3회 실행에 걸쳐 안정적) | eval/opus-density/RESULTS.md + results.json |