인문학을 학습한 AI는 늑대인간 게임에서 더 잘 추리할까
7인 늑대인간 게임을 규칙 기반 사회추론 평가 환경으로 구성하고, 승률·역할추론·투표정합성·발화 품질을 분리해 측정했다.
강한 개선 결론이 아니라, 품질 통제 상태의 탐색적 양의 경향으로 보고한다.
자연스러운 발화와 실제 사회추론은 다르다
겉으로 보이는 것
- NPC가 그럴듯한 한국어 대화를 한다.
- 의심, 방어, 설득처럼 보이는 문장을 만든다.
- 플레이어는 쉽게 "추론하고 있다"고 느낀다.
검증해야 하는 것
- 그 발화가 실제 역할추론으로 이어졌는가.
- 투표가 공개 단서와 연결됐는가.
- 발화 품질 문제가 성능 해석을 오염시키지 않았는가.
따라서 데모가 아니라 반복 실험 가능한 평가 하네스가 필요했다.
7인 늑대인간을 사회추론 평가 환경으로 재구성
비공개 역할, 기만, 공개 토론, 집단 투표가 함께 존재하기 때문에 단순 대화보다 역할추론과 의사결정을 직접 평가하기 좋다.
실험 가능한 NPC 실행 구조
장기 기억과 사건 회상
이전 게임 경험
역할·룰 정보
발화·여론·수혜자·심문
seed/config 기반 반복 실행
raw run JSON 보존
실험의 핵심은 "NPC를 더 말 잘하게 만들기"가 아니라, 같은 조건에서 반복 비교할 수 있게 통제하는 것이다.
raw 성능과 발화 품질을 분리했다
성능 지표
원본 run의 game metrics 기준.
- 마을승률
- 역할추론
- 투표정합성
- 평균 지속일
과정 지표
왜 그런 결과가 나왔는지 설명.
- 단서 전환
- follow-up
- 핵심직 오인
- 늑대 가담 무고 처형
품질 지표
공개 발화의 안전성과 가독성.
- scaffold leak
- thought leak
- role ability leak
- overlong / non-Korean
sanitized 결과로 성능을 계산하지 않는다.
인문학·사회과학·게임이론 기반 scaffold
발화 분석
말의 앞뒤, 회피, 말과 투표의 불일치를 본다.
여론 분석
몰아가기, 빠른 동조, 희생양 패턴을 본다.
수혜자 분석
이 흐름으로 누가 이득을 보는지 묻는다.
심문 전략
즉시 몰기보다 질문, 유예, follow-up을 선택한다.
scaffold는 정답을 주는 장치가 아니라, 공개 발화와 투표 흐름에서 의심 단서를 추적하도록 유도하는 장치다.
지표 상승과 품질 비용이 함께 나타났다
| arm | N | 마을승률 | 역할추론 | 투표정합성 | raw 품질통과 | replacements |
|---|---|---|---|---|---|---|
| full-step7m-rt2 | 20 | 0.200 | 0.267 | 0.343 | 14/20 | 16 |
| scaffold-rt2 | 20 | 0.350 | 0.467 | 0.371 | 10/20 | 26 |
| delta | - | +0.150 | +0.200 | +0.028 | -4 | +10 |
일부 지표는 상승했지만 발화 품질 비용 때문에 강한 claim은 불가하다.
품질 통제 상태의 양의 경향
| arm | N | 마을승률 | 역할추론 | 투표정합성 | 평균 지속일 | raw 품질통과 | replacements |
|---|---|---|---|---|---|---|---|
| full-step7m-rt23 | 20 | 0.200 | 0.317 | 0.334 | 2.000 | 20/20 | 0 |
| scaffold-rt23 | 20 | 0.300 | 0.383 | 0.353 | 2.150 | 20/20 | 0 |
| delta | - | +0.100 | +0.066 | +0.019 | +0.150 | +0 | +0 |
품질 gate는 통과했고 주요 지표는 양의 방향이다. 단, 효과크기는 작고 역할추론 +0.10 gate에는 미달했다.
seed 58 설명용 사례
순정 AI
늑대 승리
- Day 1: 준서 처형, 실제 늑대.
- Day 2: 수아 처형, 실제 예언자.
- 역할추론 0.500, 투표정합성 0.444.
마을 스캐폴드
마을 승리
- Day 1: 준서 처형, 실제 늑대.
- Day 2: 지호 처형, 실제 늑대.
- 역할추론 1.000, 투표정합성 0.750.
단일 대표 run은 설명용 사례이며, 전체 성능 판단은 RT2.3 N=20 표를 기준으로 한다.
Phaser 기반 발표용 시뮬레이션
데모에서 보여줄 것
- 7인 픽셀 마을 시뮬레이션.
- 순정 AI와 마을 스캐폴드 모드.
- 발표자 모드와 관람 모드.
- 4축 슬라이더와 로그 다운로드.
리포트에서 확인할 것
- raw 성능표.
- 품질 지표표.
- 대표 run 출처.
- claim disclaimer.
GitHub와 논문으로 이어지는 구조
GitHub 공개 패키지
- 데모 prototype.
- 최종 발표 HTML.
- 최종보고서 Markdown/PDF.
- 재현성 안내와 공개용 README.
상태: 공개 완료
국문/영문 논문
- 국문 논문과 영문 논문을 별도 파일로 제공.
- Method, Metrics, Results, Claim Gate 정리.
- Related Work와 참고문헌 공개 BibTeX 포함.
- 한계와 후속 검증 명시.
상태: 국문/영문 분리 제공
GitHub README와 국문/영문 논문은 같은 claim gate를 공유해야 한다.
현재는 하네스와 스캐폴드 탐색, 다음은 마음이론 proxy 검증
지금 말할 수 있는 것
- 동일 seed와 동일 룰에서 반복 비교하는 하네스를 만들었다.
- 스캐폴드는 정답 제공이 아니라 발화·여론·수혜자·심문을 보게 하는 보조 틀이다.
- RT2.3 N=20에서는 품질 통제 상태의 약한 양의 방향이 관찰됐다.
다음에 검증할 것
- paired seed divergence 분석.
- 모순·몰아가기·follow-up human annotation.
- belief-state table 기반 마음이론 proxy.
- Xu식 retrieval/reflection/experience와 직접 비교.
- 다중 모델과 더 큰 N 재현.
이번 결과는 마음이론 해결이나 일반적 성능 우월성의 증거가 아니다.
이번 성과는 "더 잘 이겼다"보다 "검증 가능해졌다"에 있다
LLM NPC의 사회추론을 규칙 기반 게임 환경에서 반복 측정할 수 있게 만들었다.
성능 지표와 발화 품질 지표를 분리해 claim을 통제했다.
RT2.3 N=20에서 scaffold는 품질 통제 상태로 주요 지표의 양의 방향이 관찰됐다.
강한 개선 결론은 보류하며, 후속 human annotation, paired seed 분석, 다중 모델 재현이 필요하다.