# 인문학을 학습한 AI는 늑대인간 게임에서 더 잘 추리할까

**인문학 기반 학제적 스캐폴드 · 시드 고정 늑대인간 평가 하네스 · 출력 품질을 통제한 탐색 연구**

작성일: 2026-06-28  
상태: 제출용 최종보고서  
기준 실험: STEP7-M RT2.3 N=20

## 1. 프로젝트 개요

본 프로젝트는 LLM 기반 NPC의 사회추론 행동을 반복 평가하기 위한 실험 하네스를 구축하고, 늑대인간 게임 환경에서 scaffold 적용 여부에 따른 행동 지표를 비교한 탐색적 연구다. 목표는 자연스러운 대화 생성 자체가 아니라, 불완전정보 상황에서 역할을 추론하고 집단 투표로 의사결정하는 과정을 측정 가능한 형태로 분리하는 것이다.

최종 제출물의 기준은 STEP7-M RT2.3 N=20이다. 대표 run seed 58은 설명용 사례이며, 성능 판단은 RT2.3 N=20 표를 기준으로 한다.

현재 단계의 정확한 위치는 평가 하네스 구축과 스캐폴드 탐색이다. 본 보고서는 마음이론 문제를 해결했다거나, 인문학 기반 AI가 일반적으로 더 우수하게 추론한다고 주장하지 않는다.

## 2. 문제의식

LLM NPC가 말을 자연스럽게 생성하는 것과 사회추론을 검증 가능한 방식으로 수행하는 것은 다른 문제다. 대화가 그럴듯해 보여도, 그 발화가 비공개 역할, 기만, 공개 토론, 투표 압력 속에서 나온 추론 결과인지 확인하지 않으면 연구 결과로 해석하기 어렵다.

따라서 본 프로젝트는 늑대인간 게임을 단순한 대화 데모가 아니라 불완전정보 기반 사회추론 평가 환경으로 사용했다. 승패만 보지 않고 역할추론, 투표정합성, 발화 품질을 분리해 관찰함으로써, 말의 자연스러움과 사회추론 지표를 혼동하지 않도록 설계했다.

## 3. 시스템 및 하네스

실험 환경은 7인 늑대인간 게임이다. 역할 구성은 늑대 2명, 시민 2명, 예언자 1명, 가드 1명, 마녀 1명으로 고정했다. 각 게임은 역할 배정, 밤 행동, 낮 토론, 투표, 승패 판정까지 완결된 run으로 저장된다.

하네스는 seed, config, run 단위로 실험을 관리한다. 동일 seed 구간에서 baseline arm과 scaffold arm을 반복 실행하고, 각 run의 원본 게임 결과를 보존한다. 지표는 raw 성능 지표와 sanitized 표시/품질 지표로 분리했다.

sanitized 결과는 표시용 품질 보정이며, raw 성능 지표를 재계산하지 않는다.

### 3.1 비전문가용 용어 설명

| 용어 | 의미 |
|---|---|
| 하네스 | 실험을 같은 조건으로 반복 실행하고 결과를 저장하는 검사대다. 이 프로젝트에서는 seed, 역할 구성, run log, 평가 지표, 품질 gate를 묶어 LLM NPC를 비교 가능하게 만든다. |
| 스캐폴드 | 정답을 알려주는 장치가 아니라, NPC가 놓치기 쉬운 판단 항목을 보도록 돕는 사고 보조 틀이다. 여기서는 발화 분석, 여론 분석, 수혜자 분석, 심문 전략을 뜻한다. |
| raw/display 경계 | 원본 실험 로그와 발표용 화면·문장을 분리한다는 뜻이다. 성능 판단은 raw 로그 기준으로만 한다. |
| claim gate | 결과가 약할 때 강한 주장을 막는 기준이다. 본 프로젝트는 strong claim gate를 넘지 못했으므로 탐색적 경향으로만 보고한다. |

## 4. 평가 지표

성능 지표는 원본 run의 game metrics에서 계산한다.

| 지표 | 의미 |
|---|---|
| 마을승률 | 마을 진영이 승리한 비율 |
| 역할추론 | 투표로 처형된 대상이 실제 늑대였는지의 비율 |
| 투표정합성 | 개별 투표가 실제 늑대를 향한 비율 |
| 평균 지속일 | 게임이 진행된 평균 일수 |

품질 지표는 발화 하네스와 위생 검사 결과에서 분리해 기록한다.

| 지표 | 의미 |
|---|---|
| raw 품질통과 | 원본 run이 발화 품질 하네스를 통과했는지 |
| replacements | 표시용 sanitized copy에서 안전 발화로 치환된 횟수 |
| leak 항목 | 역할, 능력, 내부 목표, 형식 누출 등 공개 발화 위생 항목 |

## 5. Scaffold 설계

STEP7-M scaffold는 NPC에게 정답을 제공하는 방식이 아니라, 공개 발화와 투표 흐름에서 의심 단서를 구조적으로 추적하도록 돕는 절차적 보조 장치다. 최종 보고서에서는 이를 네 축으로 정리한다.

| 축 | 목적 |
|---|---|
| 발화 분석 | 말투 변화, 회피, 과도한 확신, 반복 질문을 관찰한다. |
| 여론 분석 | 누가 누구를 의심하고, 의심이 어떻게 이동하는지 추적한다. |
| 수혜자 분석 | 특정 몰이나 투표 흐름에서 이익을 얻는 플레이어를 점검한다. |
| 심문 전략 | 다음 발화에서 확인해야 할 질문과 압박 지점을 정리한다. |

이 네 축은 모델 내부 추론 능력을 보장하는 장치가 아니라, 관찰 가능한 발화와 투표 로그를 사회추론 평가에 맞게 구조화하는 실험 조건이다.

## 6. RT2, RT2.2, RT2.3의 흐름

RT2에서는 scaffold arm이 주요 성능 지표에서 양의 방향을 보였지만, 발화 품질 비용이 함께 나타났다. 이 결과는 실패 은폐 대상이 아니라, 추론 보조와 공개 발화 품질 사이의 비용을 확인한 단계로 해석한다.

RT2.2에서는 프롬프트 차원의 억제를 강화했으나, 성능 지표와 품질 지표가 모두 불안정했다. 이 단계는 단순한 금지 규칙 강화가 사회추론 흐름을 보존하지 못할 수 있음을 확인한 폐기 후보였다.

RT2.3은 RT2의 추론 구조를 유지하면서 공개 발화 단계의 위생 필터를 분리했다. 최종 RT2.3 N=20에서는 두 arm 모두 raw 품질통과 20/20, replacements 0을 달성했고, scaffold arm은 주요 성능 지표에서 양의 방향을 보였다. 효과크기는 작고 사전 정의한 강한 gate에는 미달했으므로, 강한 개선 결론이 아니라 품질 통제 상태의 탐색적 양의 경향으로 해석한다.

## 7. 최종 결과: RT2.3 N=20

| arm | N | 마을승률 | 늑대승률 | 역할추론 평균±SD | 투표정합성 평균±SD | 평균 지속일±SD | raw 품질통과 | replacements |
|---|---:|---:|---:|---:|---:|---:|---:|---:|
| full-step7m-rt23 | 20 | 0.200 | 0.800 | 0.317±0.404 | 0.334±0.257 | 2.000±0.649 | 20/20 | 0 |
| full-village-scaffold-step7m-rt23 | 20 | 0.300 | 0.700 | 0.383±0.383 | 0.353±0.216 | 2.150±0.671 | 20/20 | 0 |
| Δ scaffold-full | - | +0.100 | -0.100 | +0.066 | +0.019 | +0.150 | +0 | +0 |

RT2.3 N=20에서 scaffold arm은 baseline 대비 마을승률 +0.100, 역할추론 +0.066, 투표정합성 +0.019, 평균 지속일 +0.150을 보였다. 두 arm 모두 raw 품질통과 20/20, replacements 0이다. 다만 이 규모와 결과만으로 강한 결론을 제시하지 않고, 품질 통제 상태에서 관찰된 탐색적 양의 경향으로 제한해 해석한다.

| 항목 | delta | 보수적 해석 |
|---|---:|---|
| 마을승률 | +0.100 | 4/20 대 6/20 차이다. 대략적 95% CI가 0을 포함하므로 확증 근거가 아니다. |
| 역할추론 | +0.066 | 집계값 기준 근사 효과크기 d≈0.17로 작다. |
| 투표정합성 | +0.019 | 집계값 기준 근사 효과크기 d≈0.08로 매우 작다. |
| 평균 지속일 | +0.150 | 집계값 기준 근사 효과크기 d≈0.23으로 작다. |

## 8. 대표 run seed 58

대표 run은 RT2.3 N=20 scaffold arm의 seed 58이다.

| 항목 | 값 |
|---|---|
| condition | full-village-scaffold-step7m-rt23 |
| seed | 58 |
| winner | 마을 |
| days | 2 |
| role_inference_accuracy | 1.000 |
| vote_consistency | 0.750 |
| correct_executions | 2/2 |
| raw quality | PASS |
| replacements | 0 |

같은 seed에서 baseline arm은 첫 번째 투표에서 늑대를 처형했지만, 두 번째 투표에서 예언자를 처형해 늑대 진영이 승리했다. scaffold arm은 첫 번째 투표와 두 번째 투표에서 늑대를 연속 처형해 마을 진영이 승리했다.

이 사례는 scaffold 조건의 작동 방식을 설명하기 위한 예시다. 대표 run seed 58은 설명용 사례이며, 성능 판단은 RT2.3 N=20 표를 기준으로 한다.

## 9. 보조 하네스 검증: STEP7-O

STEP7-O는 메인 성능 결과가 아니라, 실제 LLM 발화 위에 verifier/sanitizer를 얹었을 때 품질 누출을 제어하고 발화 다양성을 유지할 수 있는지 확인한 N=5 보조 smoke다.

| 실험 | N | 목적 | 품질 gate | 다양성 gate | 성능 claim |
|---|---:|---|---|---|---|
| STEP7-O draft_verify | 5 | API-free 하네스 가속 smoke | 통과 | 실패/부족 | 금지 |
| STEP7-O llm_verify | 5 | 실제 LLM 발화 위 품질 통제 smoke | 통과 | 통과 | 금지 |

`llm_verify` N=5에서는 품질 gate 전 항목이 0이었고, 발화 다양성은 84/84 unique utterances로 통과했다. 그러나 늑대가 5/5 승리했고 역할추론과 투표정합성이 낮았으므로, 이 결과는 scaffold 성능 개선 근거가 아니다. 본 보고서에서는 raw 성능과 출력 품질을 분리해야 한다는 방법론 보강 근거로만 사용한다.

## 10. 산출물과 데모 기준

최종 산출물은 STEP7-M RT2.3 N=20과 대표 run seed 58을 기준으로 정렬한다. 데모와 보고서가 서로 다른 대표 run이나 과거 결과를 보여주면 해석이 흔들리므로, 공개 화면과 보고서에는 동일한 기준 실험, 동일한 대표 run, 동일한 claim gate가 적용되어야 한다.

영상 파일은 본 보고서 조립 범위에 포함하지 않는다. 시연영상은 데모 prototype과 링크 검증이 끝난 뒤 별도 단계에서 작성하는 것이 적절하다.

공개 산출물은 GitHub public repository와 GitHub Pages HTML landing으로 분리했다.

| 항목 | 링크 |
|---|---|
| GitHub repository | https://github.com/ljhljh0703-cmd/ai-npc-social-reasoning-harness |
| GitHub Pages | https://ljhljh0703-cmd.github.io/ai-npc-social-reasoning-harness/ |
| 국문 논문 | https://github.com/ljhljh0703-cmd/ai-npc-social-reasoning-harness/blob/main/docs/paper-ko.md |
| 국문 논문 PDF | https://github.com/ljhljh0703-cmd/ai-npc-social-reasoning-harness/blob/main/docs/paper-ko.pdf |
| English paper | https://github.com/ljhljh0703-cmd/ai-npc-social-reasoning-harness/blob/main/docs/paper-en.md |
| English paper PDF | https://github.com/ljhljh0703-cmd/ai-npc-social-reasoning-harness/blob/main/docs/paper-en.pdf |

## 11. 한계

본 연구는 탐색적 규모의 실험이다. N=20은 경향을 검토하기 위한 규모이며, 통계적 확증을 주장하기에는 부족하다.

모델은 llama3.1:8b 단일 모델이다. 다른 모델, 다른 크기, 다른 decoding 설정에서 같은 경향이 유지되는지는 추가 검증이 필요하다.

역할추론과 투표정합성은 규칙 기반 지표다. 늑대인간 게임의 승패와 투표 로그를 기준으로 명확히 계산할 수 있다는 장점이 있지만, 모든 사회추론 능력을 대표하지는 않는다.

대표 run은 설명용 사례이며 전체 성능의 근거가 아니다. 성능 판단은 반복 run 결과 표를 기준으로 해야 한다.

런타임 발화 위생 필터는 공개 발화의 표시 품질을 통제하지만, 모델 내부 추론 능력 자체를 보장하지 않는다. 따라서 raw 성능 지표와 sanitized 표시/품질 지표는 계속 분리해 해석해야 한다.

STEP7-O는 품질 gate와 다양성 gate를 통과했지만, N=5 보조 smoke이며 게임 성능이 낮았다. 따라서 주효과나 scaffold 성능 claim에는 포함하지 않는다.

## 12. 향후 연구

후속 연구는 단순히 N만 늘리는 방식보다, 사회추론과 마음이론 proxy를 더 명확히 분해하는 방향으로 확장해야 한다.

1. **Paired seed 분석**: 같은 seed에서 baseline과 scaffold가 어느 토론, 투표, 밤 행동 이후 갈라졌는지 추적한다.
2. **Human annotation**: 모순 감지, 논점 회피, 몰아가기, follow-up 품질, 수혜자 추론을 독립 평가자가 라벨링한다.
3. **마음이론 proxy 설계**: “누가 무엇을 알고 있다고 추정했는가”, “새 단서 이후 믿음이 갱신됐는가”를 belief-state table로 기록한다.
4. **Xu식 조건과 직접 비교**: retrieval/reflection/experience 조건, humanities scaffold 조건, combined 조건을 분리해 비교한다.
5. **다중 모델 재현**: 최소 2개 이상의 LLM과 더 큰 seed 집합에서 현재의 작은 양의 방향이 유지되는지 확인한다.

## 13. 결론

본 프로젝트는 LLM NPC의 대화 능력과 사회추론 지표를 분리해 관찰하기 위한 반복 평가 하네스를 구축했다. 7인 늑대인간 환경에서 seed/config/run 단위로 실험을 관리하고, raw 성능 지표와 sanitized 표시/품질 지표를 분리했다.

최종 RT2.3 N=20에서는 raw 품질통과 20/20, replacements 0 상태에서 scaffold arm이 주요 성능 지표의 양의 방향을 보였다. 다만 효과크기는 작고 통계적 확증은 아니므로, 결론은 강한 개선 결론이 아니라 품질 통제 상태의 탐색적 양의 경향으로 해석한다.
