유창한 대화가 곧 추론은 아닙니다. 7인 늑대인간을 seed 고정 평가 하네스로 만들고, 인문학 기반 스캐폴드가 실제 행동 지표에 미치는 영향을 통제된 조건에서 측정했습니다.
A humanities-grounded interdisciplinary scaffold, evaluated in a seed-controlled Werewolf harness under output-quality control (exploratory).
하네스와 마을 진영 스캐폴드가 실제로 어떻게 도는지 시연입니다. 브라우저 인터랙티브 데모는 redacted replay 기반이라 실험 성능 근거가 아니라 설명용입니다.
LLM NPC는 속으론 판단이 약해도 사회적으로 풍부한 대화를 만들어냅니다. transcript가 멀쩡해 보여도, 정작 자기 증거에 반대로 투표하거나 무고한 대상에 의혹을 몰아준다면 "사회추론을 한다"고 말하기 어렵습니다. 이 간극을 어떻게 반복 가능하게 검증할지가 이 프로젝트의 질문입니다.
7인 늑대인간(늑대 2·시민 2·예언자·가드·마녀)은 비대칭 정보·공개 발화·기만·집단 투표를 한 판에 담습니다. 덕분에 "사회적 대화"가 감사 가능한 행동 결과로 바뀝니다 — 누가 의심받았고, 누구에게 투표했고, 처형된 게 진짜 늑대였고, 마을이 이겼는지. 같은 seed·조건에서 baseline과 scaffold arm을 반복 실행해 비교합니다(모델 llama3.1:8b).
스캐폴드는 숨은 역할이나 정답을 알려주지 않습니다. 공개 단서에 주의를 구조화하는 네 축입니다. 각 축은 "인간형 인지의 증거"가 아니라 관찰 가능한 proxy로만 연결합니다 — 이 경계가 이 연구의 핵심입니다.
공개 발화 사이의 모순, 책임 회피, 과도한 확신, 서사 붕괴를 추적.
의심이 어떻게 이동하는지, 공개 동의가 너무 빨리 한쪽으로 쏠리는지 추적.
특정 처형·침묵·의혹 전이에서 어떤 역할이 이익을 얻는지 질문.
즉시 확신하기보다 질문하고, 판단을 미루고, 단서 뒤 후속 확인을 유도.
정제된 공개 문구가 원본 성능 근거로 오해되지 않게, 세 계층을 하나의 인상으로 합치지 않습니다. 그럴듯한 transcript는 성능 지표가 아니고, sanitized transcript는 raw 근거가 아니며, 심리학에서 영감받은 스캐폴드는 인간형 인지의 증거가 아닙니다. raw 지표는 원본 run에서만 계산하고, 표시 계층 치환은 성능을 재계산하지 않습니다.
| 계층 | 무엇 | 지위 |
|---|---|---|
| raw 게임 성능 | 승패·처형·투표·지속일 | 연구 근거 |
| output-quality gate | 출력 위생 통과·치환 수 | 통제 변수 |
| sanitized replay | 공개 데모 표시용 | 설명용 · 성능 아님 |
| claim gate | 강주장 사전 차단 | 허용 주장만 |
최종 STEP7-M RT2.3 N=20에서 scaffold arm은 모든 지표에서 양의 방향을 보였지만 효과크기가 작고, 역할추론 delta는 사전 정의한 강주장 gate에 도달하지 못했습니다. 그래서 "개선 확정"이 아니라 탐색적 경향으로만 해석합니다.
| 지표 | baseline | scaffold | delta |
|---|---|---|---|
| 마을 승률 | 0.200 | 0.300 | +0.100 |
| 역할추론 | 0.317 | 0.383 | +0.066 · gate 미달 |
| 투표정합성 | 0.334 | 0.353 | +0.019 |
| 평균 지속일 | 2.000 | 2.150 | +0.150 |
| raw 품질통과 | 20/20 | 20/20 | 동일 |
scaffold arm에서 마을이 2일 만에 승리(역할추론 1.000·투표정합성 0.750·늑대 2회 정확 처형). 같은 seed에서 baseline은 첫 처형은 늑대였지만 이후 예언자를 처형해 늑대 승리로 끝났습니다. 스캐폴드가 한 게임 흐름을 어떻게 바꾸는지 설명하는 데만 씁니다 — 성능 claim은 오직 N=20 표에 근거합니다.
Xu 등(2023)의 Werewolf LLM 연구에서 문제의식만 이어받았습니다 — 공개 코드나 구현체는 쓰지 않고, 논문 서술에서 얻은 문제 설정으로 하네스와 데모를 독립 구현했습니다. 선행 연구가 "어떤 사고 단서를 줄 것인가"(retrieval·reflection·experience)에 초점을 뒀다면, 이 프로젝트의 보완점은 그 개입이 실제 행동 지표로 이어졌는지를 반복 가능하게 검증하는 장치 — seed 고정 실행·raw 보존·지표 분리·output-quality gate·claim gate입니다.
이 프로젝트의 중심 산출물은 개별 프롬프트가 아니라, 프롬프트·스캐폴드의 효과를 보수적으로 시험하는 하네스입니다. 결과는 탐색적이지만, 무엇을 주장할 수 있고 없는지를 분명히 합니다.
GitHub에서 전체 보기 ↗