주장하지 않고 증명합니다
20개 공개 데이터셋에서 의사결정 복원력을 측정하고 그 결과로 모든 평결의 신뢰 등급을 보정합니다.
아래 수치는 공개 데이터셋 백테스트 실측값입니다. 실제 고객 캠페인과의 예측·실결과 대조(paired-pilot)는 아직 수집 전이며 완료 전까지 증거 등급은 directional입니다.
척도 불변 의사결정 복원
절대 수치가 아니라 운영자가 실제로 내리는 결정을 채점합니다.
이기는 안을 맞힌 비율
쌍별 비교 방향의 정확도
처치가 대조군을 이기는지의 정확도
그룹 내 순위 상관
시장 결정 복원 성적
대조 11그룹, 샘플 3회, 동일 모델 조건의 실측값입니다.
| 예측기 | winner | dir | ctrl-sign | ρ̄ |
|---|---|---|---|---|
| 무모델 베이스라인 | 0.00 | 0.00 | 0.00 | −1.00 |
| 단일 표본 패널 | 0.636 | 0.784 | 0.857 | 0.461 |
| 페르소나 패널제품 탑재 | 0.727 | 0.830 | 0.929 | 0.625 |
| 구조 prior (인코딩 가능 대조) | 1.000 | 0.898 | 0.929 | 0.961 |
- 멀티도메인 일반화: 마케팅 밖 전자상거래·소득 도메인에서도 winner 0.750을 유지합니다.
- 가격·선택 레인(ModeCanada)은 구조 prior가 LLM 패널을 능가해 그쪽으로 라우팅합니다.
20개 산업에서 실제 시장 결정을 복원합니다
방향성 방법론이 마케팅 밖으로도 일반화되는지 검증합니다. 누출 없는 구조 prior — 패널의 방향성 믿음을 감사 가능하게 대리하는 예측기 — 를 20개 공개 데이터셋(37 대조 그룹, 118 케이스)에 걸쳐 척도 불변 의사결정 복원으로 채점합니다.
| 예측기 | winner | dir | ctrl-sign | ρ̄ |
|---|---|---|---|---|
| 무모델 베이스라인 | 0.00 | 0.01 | 0.00 | −1.00 |
| 구조 방향성 prior | 0.946 | 0.899 | 0.908 | 0.876 |
구조 prior가 floor를 이긴다는 것은 방향이 옳다는 뜻이지, LLM이 특정 정확도를 낸다는 증명은 아닙니다. 2건의 miss는 의도적으로 안 맞춘 반직관 반전(광케이블 이탈·신규 방문자 전환)입니다.
합성 패널의 1번 실패 모드를 측정합니다
예측 분포가 현실만큼 분산됩니다. 합성 응답의 대표적 결함인 분산 축소가 관측되지 않았습니다.
두 예측 경로의 부호 뒤집힘 비율입니다. 대조 유형에 따라 더 강한 경로로 라우팅하는 근거입니다.
임계 보정 후 100% 커버리지 기준 정확도입니다.
모든 평결에 등급이 붙습니다
백테스트로 보정한 규칙이 각 평결을 세 등급으로 분류합니다.
반복 측정에서 승자가 유지되고 검증된 대조 유형일 때만 부여합니다.
방향은 신뢰할 수 있으나 실제 A/B로 확정해야 하는 평결입니다.
근소차와 검정력 부족은 판정을 유보합니다.
paired-pilot 실측 수집은 시작 단계입니다. 완료 전까지 전체 증거 등급은 directional로 유지합니다.
측정의 경계까지 공개합니다
경계를 공개하기 때문에 등급이 붙은 평결을 믿을 수 있습니다.
- 거의 동등한 두 크리에이티브의 승자 판별은 우연 수준입니다. 신뢰 게이트가 자동으로 캡합니다.
- 반직관 미세효과(예: 신규 방문자가 재방문자를 이기는 대조)는 구조 prior와 LLM 모두 놓칩니다.
- 절대 전환율·지출 수치는 인구·시대 불일치로 검증하지 않습니다. 순서 기반 결정만 채점합니다.
- 행동 코호트 인기 세그먼트는 winner 0.222 수준이라 세그먼트 레인 전체를 directional로 캡했습니다.
cross-framing 합의 게이트 가설을 사전 등록 조건으로 검증한 결과 agree 부분집합 winner 0.308 vs disagree 0.667로 정반대였습니다. 같은 모델의 프레이밍 간 합의는 공유 편향의 일관성을 측정할 뿐이라 판단해 게이트를 downgrade 전용으로 제한했습니다.
직접 재현하세요
API 키 없이 아래 명령으로 전체 결과를 재현할 수 있습니다.