LLM NPC · 사회추론 평가 하네스

인문학을 학습한 AI는
늑대인간 게임에서 더 잘 추리할까

유창한 대화가 곧 추론은 아닙니다. 7인 늑대인간을 seed 고정 평가 하네스로 만들고, 인문학 기반 스캐폴드가 실제 행동 지표에 미치는 영향을 통제된 조건에서 측정했습니다.

A humanities-grounded interdisciplinary scaffold, evaluated in a seed-controlled Werewolf harness under output-quality control (exploratory).

탐색적 연구 · N=20 seed 고정 재현 raw / display 분리 보수적 claim gate clean-room
N=20
arm당 반복 실행
baseline · scaffold 비교
20 / 20
raw 출력 품질통과
replacements 0 · 통제됨
gate 미달
역할추론 +0.066
사전 +0.10 강주장 gate
재현 ✓
seed 고정 결정론
같은 seed·조건 반복
데모

영상으로 먼저 보기

하네스와 마을 진영 스캐폴드가 실제로 어떻게 도는지 시연입니다. 브라우저 인터랙티브 데모는 redacted replay 기반이라 실험 성능 근거가 아니라 설명용입니다.

01 — 문제

그럴듯한 대화가 곧 추론은 아니다

LLM NPC는 속으론 판단이 약해도 사회적으로 풍부한 대화를 만들어냅니다. transcript가 멀쩡해 보여도, 정작 자기 증거에 반대로 투표하거나 무고한 대상에 의혹을 몰아준다면 "사회추론을 한다"고 말하기 어렵습니다. 이 간극을 어떻게 반복 가능하게 검증할지가 이 프로젝트의 질문입니다.

02 — 접근

늑대인간을 불완전정보 테스트베드로

7인 늑대인간(늑대 2·시민 2·예언자·가드·마녀)은 비대칭 정보·공개 발화·기만·집단 투표를 한 판에 담습니다. 덕분에 "사회적 대화"가 감사 가능한 행동 결과로 바뀝니다 — 누가 의심받았고, 누구에게 투표했고, 처형된 게 진짜 늑대였고, 마을이 이겼는지. 같은 seed·조건에서 baseline과 scaffold arm을 반복 실행해 비교합니다(모델 llama3.1:8b).

seed 고정 7인 늑대인간 역할·밤·낮 토론 투표·처형·승패 baseline arm 스캐폴드 없음 scaffold arm 인문학 4축 주입 raw 로그 승률 · 역할추론 투표정합성 · 지속일 display와 분리 claim gate 허용 주장만 강주장 차단 (+0.10 gate)
출처: 논문 §3 방법 · repro/configs (full-step7m-rt23 / full-village-scaffold-step7m-rt23) · N=20.
03 — 스캐폴드

인문학을 검증 가능한 4축으로 번역

스캐폴드는 숨은 역할이나 정답을 알려주지 않습니다. 공개 단서에 주의를 구조화하는 네 축입니다. 각 축은 "인간형 인지의 증거"가 아니라 관찰 가능한 proxy로만 연결합니다 — 이 경계가 이 연구의 핵심입니다.

발화 분석

모순·회피·과확신

공개 발화 사이의 모순, 책임 회피, 과도한 확신, 서사 붕괴를 추적.

proxy: contradiction·evasion label. ✗ 모델이 인간처럼 모순을 "이해"했다는 뜻 아님.
여론 분석

몰아가기·동조 압력

의심이 어떻게 이동하는지, 공개 동의가 너무 빨리 한쪽으로 쏠리는지 추적.

proxy: bandwagon·accusation concentration. ✗ 인간 동조·집단극화 재현이 아님.
수혜자 분석

누가 이득을 보나

특정 처형·침묵·의혹 전이에서 어떤 역할이 이익을 얻는지 질문.

proxy: wolf-benefiting vote label. ✗ 게임이론적 균형 구현이 아님.
심문 전략

판단 유예·후속 질문

즉시 확신하기보다 질문하고, 판단을 미루고, 단서 뒤 후속 확인을 유도.

proxy: question count·deferred vote. ✗ 인간 수준 심문 능력 주장 아님.
04 — 방법론 핵심

raw 성능과 display 위생을 분리한다

정제된 공개 문구가 원본 성능 근거로 오해되지 않게, 세 계층을 하나의 인상으로 합치지 않습니다. 그럴듯한 transcript는 성능 지표가 아니고, sanitized transcript는 raw 근거가 아니며, 심리학에서 영감받은 스캐폴드는 인간형 인지의 증거가 아닙니다. raw 지표는 원본 run에서만 계산하고, 표시 계층 치환은 성능을 재계산하지 않습니다.

계층무엇지위
raw 게임 성능승패·처형·투표·지속일연구 근거
output-quality gate출력 위생 통과·치환 수통제 변수
sanitized replay공개 데모 표시용설명용 · 성능 아님
claim gate강주장 사전 차단허용 주장만
RT2.3 N=20에서 두 arm 모두 raw 품질통과 20/20 · replacements 0. 출력 품질이 통제됐다는 뜻이지, 그 자체가 추론 개선의 증거는 아닙니다.
05 — 결과

양의 방향, 그러나 작다 (탐색적)

최종 STEP7-M RT2.3 N=20에서 scaffold arm은 모든 지표에서 양의 방향을 보였지만 효과크기가 작고, 역할추론 delta는 사전 정의한 강주장 gate에 도달하지 못했습니다. 그래서 "개선 확정"이 아니라 탐색적 경향으로만 해석합니다.

지표baselinescaffolddelta
마을 승률0.2000.300+0.100
역할추론0.3170.383+0.066 · gate 미달
투표정합성0.3340.353+0.019
평균 지속일2.0002.150+0.150
raw 품질통과20/2020/20동일
근사 효과크기 역할추론 d≈0.17 · 투표정합성 d≈0.08 · 지속일 d≈0.23 — 양의 방향과는 양립하나 강한 결론과는 양립하지 않음. 마을승률 불확실성 구간은 0을 포함. 출처: 논문 §5.
06 — 대표 사례

seed 58 — 설명용, 집계 근거 아님

scaffold arm에서 마을이 2일 만에 승리(역할추론 1.000·투표정합성 0.750·늑대 2회 정확 처형). 같은 seed에서 baseline은 첫 처형은 늑대였지만 이후 예언자를 처형해 늑대 승리로 끝났습니다. 스캐폴드가 한 게임 흐름을 어떻게 바꾸는지 설명하는 데만 씁니다 — 성능 claim은 오직 N=20 표에 근거합니다.

07 — 차별점

더 정교한 프롬프트가 아니라, 평가 하네스

Xu 등(2023)의 Werewolf LLM 연구에서 문제의식만 이어받았습니다 — 공개 코드나 구현체는 쓰지 않고, 논문 서술에서 얻은 문제 설정으로 하네스와 데모를 독립 구현했습니다. 선행 연구가 "어떤 사고 단서를 줄 것인가"(retrieval·reflection·experience)에 초점을 뒀다면, 이 프로젝트의 보완점은 그 개입이 실제 행동 지표로 이어졌는지를 반복 가능하게 검증하는 장치 — seed 고정 실행·raw 보존·지표 분리·output-quality gate·claim gate입니다.

정직 표기: 원저자 코드 미사용 · 원 논문 개선 주장 아님(문제의식 계승) · 인용 = Xu et al., "Exploring Large Language Models for Communication Games: An Empirical Study on Werewolf," arXiv 2309.04658.
08 — 정직 · 한계

증명한 것과, 아직 아닌 것

산출물

공개 아티팩트

용어

용어 해설

평가 하네스AI를 같은 조건에서 반복 실행하고 행동을 자동 채점하는 실험 장치.
스캐폴드정답을 주지 않고 "어디를 보라"고 추론의 틀만 잡아주는 보조 장치.
seed 고정난수를 고정해 같은 상황을 그대로 재현 — 비교가 공정해짐.
output-quality gate공개 문장의 위생(누출·형식)을 검사·통제하는 관문. 성능과 분리.
claim gate데이터가 지지하지 않는 강한 주장을 미리 막는 규칙.
역할추론 / 투표정합성처형이 진짜 늑대였나 / 투표가 늑대를 향했나 — 관찰 가능한 지표.

유창함과 추론을 혼동하지 않는 평가

이 프로젝트의 중심 산출물은 개별 프롬프트가 아니라, 프롬프트·스캐폴드의 효과를 보수적으로 시험하는 하네스입니다. 결과는 탐색적이지만, 무엇을 주장할 수 있고 없는지를 분명히 합니다.

GitHub에서 전체 보기 ↗