# STEP7-M 논문/발표용 결과 표

작성일: 2026-06-28

## 표 사용 원칙

- raw 성능표와 발화 품질표를 분리한다.
- 성능 수치는 원본 run의 game metrics 기준이다.
- 품질 수치는 smoke quality harness와 hygiene manifest 기준이다.
- sanitized 결과는 표시용 품질 보정이며, raw 성능 지표를 재계산하지 않는다.

## Table 1. RT2 N=20: 지표 상승과 품질 비용

| arm | N | 마을승률 | 늑대승률 | 역할추론 | 투표정합성 | 평균 지속일 | raw 품질통과 | replacements |
|---|---:|---:|---:|---:|---:|---:|---:|---:|
| full-step7m-rt2 | 20 | 0.200 | 0.800 | 0.267 | 0.343 | 2.400 | 14/20 | 16 |
| full-village-scaffold-step7m-rt2 | 20 | 0.350 | 0.650 | 0.467 | 0.371 | 2.450 | 10/20 | 26 |
| Δ scaffold-full | - | +0.150 | -0.150 | +0.200 | +0.028 | +0.050 | -4 | +10 |

해석:

- 역할추론과 마을승률이 같이 상승했지만, 이 단계는 품질 비용이 커서 성능 결론으로 쓰지 않는다.
- 그러나 scaffold arm의 raw 품질통과가 10/20이고 replacements가 26으로 커서 강한 성능 claim은 불가하다.
- 이 표는 성능-품질 trade-off의 핵심 근거다.

## Table 2. RT2.2 N=5: 과도한 프롬프트 억제의 실패

| arm | N | 마을승률 | 늑대승률 | 역할추론 | 투표정합성 | 평균 지속일 | raw 품질통과 | replacements |
|---|---:|---:|---:|---:|---:|---:|---:|---:|
| full-step7m-rt22 | 5 | 0.400 | 0.600 | 0.600 | 0.435 | 2.200 | 4/5 | 2 |
| full-village-scaffold-step7m-rt22 | 5 | 0.200 | 0.800 | 0.400 | 0.458 | 2.800 | 2/5 | 7 |
| Δ scaffold-full | - | -0.200 | +0.200 | -0.200 | +0.023 | +0.600 | -2 | +5 |

해석:

- 출력 금지를 강하게 넣는 방식은 성능을 유지하지 못했다.
- 이 실패를 통해 추론 scaffold 자체를 억제하지 않고, 공개 발화 단계에서 위생을 관리하는 RT2.3으로 전환했다.

## Table 3. RT2.3 N=5: 런타임 위생 필터의 스모크 성공

| arm | N | 마을승률 | 늑대승률 | 역할추론 | 투표정합성 | 평균 지속일 | raw 품질통과 | replacements |
|---|---:|---:|---:|---:|---:|---:|---:|---:|
| full-step7m-rt23 | 5 | 0.400 | 0.600 | 0.300 | 0.183 | 1.800 | 5/5 | 0 |
| full-village-scaffold-step7m-rt23 | 5 | 0.400 | 0.600 | 0.400 | 0.238 | 2.400 | 5/5 | 0 |
| Δ scaffold-full | - | +0.000 | +0.000 | +0.100 | +0.055 | +0.600 | +0 | +0 |

해석:

- 품질 문제 없이 역할추론과 투표정합성에서 양의 방향을 보였다.
- N=20 확장 후보로 승인했다.

## Table 4. RT2.3 N=20: 최종 후보 결과

| arm | N | 마을승률 | 늑대승률 | 역할추론 평균±SD | 투표정합성 평균±SD | 평균 지속일±SD | raw 품질통과 | replacements |
|---|---:|---:|---:|---:|---:|---:|---:|---:|
| full-step7m-rt23 | 20 | 0.200 | 0.800 | 0.317±0.404 | 0.334±0.257 | 2.000±0.649 | 20/20 | 0 |
| full-village-scaffold-step7m-rt23 | 20 | 0.300 | 0.700 | 0.383±0.383 | 0.353±0.216 | 2.150±0.671 | 20/20 | 0 |
| Δ scaffold-full | - | +0.100 | -0.100 | +0.066 | +0.019 | +0.150 | +0 | +0 |

해석:

- 품질 gate는 통과했다.
- scaffold arm은 승률, 역할추론, 투표정합성, 지속일에서 모두 양의 방향이지만 효과크기는 작다.
- 단, 사전 정의한 역할추론 +0.10 gate에는 미달했다.
- 따라서 확정 결론이 아니라 "품질 통제 상태의 탐색적 양의 경향"으로 보고한다.

## Table 4b. RT2.3 N=20 효과크기/불확실성 메모

| 항목 | delta | 근사 효과크기/불확실성 | 해석 |
|---|---:|---|---|
| 마을승률 | +0.100 | 대략적 95% CI가 0 포함 | 4/20 대 6/20 차이로 확증 근거가 아니다. |
| 역할추론 | +0.066 | d≈0.17 | 작다. |
| 투표정합성 | +0.019 | d≈0.08 | 매우 작다. |
| 평균 지속일 | +0.150 | d≈0.23 | 작다. |

## Table 5. Claim Gate 요약

| 실험 | N | 품질 gate | 성능 방향 | 최종 판정 |
|---|---:|---|---|---|
| RT2 | 20 | 실패 | 강한 양의 방향 | 성능-품질 trade-off 근거 |
| RT2.2 | 5 | 실패 | 악화 | 폐기 |
| RT2.3 | 5 | 통과 | 양의 방향 | N=20 확장 승인 |
| RT2.3 | 20 | 통과 | 약한 양의 방향 | 최종 후보, 강한 claim은 보류 |

## Table 6. STEP7-O 보조 하네스 검증

| 실험 | N | 목적 | 품질 gate | 다양성 gate | 성능 claim |
|---|---:|---|---|---|---|
| STEP7-O draft_verify | 5 | API-free 하네스 가속 smoke | 통과 | 실패/부족 | 금지 |
| STEP7-O llm_verify | 5 | 실제 LLM 발화 위 품질 통제 smoke | 통과 | 통과 | 금지 |

`llm_verify` N=5는 품질 gate 전 항목 0, utterances 84/84 unique, unique ratio 1.0을 기록했다. 다만 늑대가 5/5 승리했고 역할추론은 0.067±0.149, 투표정합성은 0.180±0.132였으므로 성능 claim에는 사용하지 않는다.

## 발표용 한 줄 결과

> RT2.3 N=20에서 scaffold arm은 raw 품질통과 20/20과 replacements 0을 유지하면서 마을승률 +0.100, 역할추론 +0.066, 투표정합성 +0.019의 양의 방향이 관찰됐다. 효과크기는 작아 강한 결론은 보류한다.

## 논문용 보수적 결과 문장

> 품질 통제 상태에서 scaffold arm은 모든 주요 성능 지표에서 baseline 대비 양의 방향을 보였다. 그러나 역할추론 개선폭은 사전 정의한 +0.10 gate에 미달했고 효과크기도 작으므로, 본 결과는 성능 개선의 확정적 증거가 아니라 탐색적 개선 경향으로 해석한다.
