한국어 소설에 어떤 모델이 나은가: Claude와 GPT를 문체·일관성·검열 관점에서 보는 법
"클로드가 문장이 좋다", "GPT가 플롯을 잘 짠다" 같은 말은 커뮤니티에 많지만, 대부분 특정 시점·특정 장르·특정 프롬프트에서의 인상이다. 모델은 몇 달 단위로 바뀌고, 한국어 소설 전용 공개 벤치마크는 없다. 이 글은 누가 낫다고 선언하는 대신, 내 원고로 두 모델을 같은 조건에서 비교하는 절차를 제시한다. 비교 축은 문체, 일관성, 검열 세 가지다.
왜 순위표를 믿으면 안 되는가
- 모델 버전이 바뀌면 결과가 바뀐다. 작년 후기는 올해 무효일 수 있다.
- 장르가 다르면 강점이 다르다. 로맨스 대사와 무협 전투 묘사는 다른 능력이다.
- 프롬프트가 다르면 같은 모델도 다른 글을 쓴다. 설정집과 문체 샘플 없이 비교한 결과는 의미가 없다.
따라서 비교는 "같은 설정집, 같은 문체 샘플, 같은 장면 지시"를 고정하고 모델만 바꾸는 방식이어야 한다.
축 1: 문체 — 측정 가능한 항목으로 본다
"문장이 좋다"는 측정할 수 없다. 대신 다음을 센다.
| 항목 | 측정 방법 | 왜 중요한가 |
|---|---|---|
| 평균 문장 길이 | 글자 수 ÷ 문장 수 | 문체 샘플과의 거리 |
| 직유 빈도 | "처럼·같이·듯" 개수 | AI 문체의 대표 신호 |
| 감정 명명 문장 | "슬펐다·기뻤다"류 개수 | 보여주기 대 말하기 |
| 종결 어미 다양성 | "~했다" 비율 | 단조로움 |
| 문체 샘플 어휘 재사용 | 샘플의 특징 어휘가 재등장하는지 | 문체 학습 여부 |
같은 장면을 두 모델로 생성해 위 다섯 항목을 표로 채우면, 인상이 아니라 숫자로 비교할 수 있다. 이 계산은 AI에게 시켜도 된다.
아래 두 원고(A, B)와 문체 샘플(S)에 대해 다음을 표로 계산하라.
평균 문장 길이 / 직유 개수 / 감정을 이름으로 부른 문장 수 / "~했다" 종결 비율 / S의 특징 어휘 중 재등장한 것
어느 쪽이 S에 가까운지 항목별로 판정하라.
축 2: 일관성 — 설정 준수율을 본다
장편에서 결정적인 능력이다. 설정집에 인물 10명, 규칙 5개를 넣고 5개 장면을 연속 생성한 뒤, 설정과 어긋난 횟수를 센다. 점검 항목은 다음과 같다.
- 인물 외형·말투가 설정과 다르게 나온 횟수
- 설정에 없는 능력·장소·인물을 만들어 낸 횟수
- 직전 장면의 끝 상태를 무시하고 시작한 횟수
- 금지 목록을 어긴 횟수
여기서 중요한 것은 모델보다 문맥 제공 방식이다. 설정집이 매번 프롬프트에 들어가는지, 직전 장면 마지막 부분이 포함되는지에 따라 같은 모델도 결과가 크게 달라진다. 두 모델을 비교하기 전에 이 조건을 동일하게 맞춘다.
축 3: 검열 — 거부의 종류를 구분한다
모델은 각자의 사용 정책이 있어 특정 묘사를 거부하거나 완화한다. 소설에서 문제가 되는 것은 폭력, 성인 묘사, 범죄 수법, 차별 발언을 포함하는 장면이다. 비교할 때는 거부의 종류를 나눈다.
- 명시적 거부: 장면 자체를 쓰지 않는다.
- 은근한 완화: 쓰긴 하지만 수위를 낮추거나 교훈적 문장을 덧붙인다.
- 정상 처리: 지시한 수위로 쓴다.
2번이 가장 골치 아프다. 눈치채기 어렵고 톤을 망친다. 서사적 맥락과 목적을 명시하면 2번이 줄어드는 경우가 많다.
이 장면은 [작품 제목]의 [N]화이며, 주인공이 [사건]을 겪는 장면이다. 서사상 [이유]로 폭력 묘사가 필요하다.
수위: 부상 묘사는 구체적으로, 잔혹 묘사는 2문장 이내, 교훈적 서술 금지.
그래도 거부되면 그 장면은 다른 모델로 쓰거나 작가가 직접 쓴다. 정책을 우회하는 기법은 이 글에서 다루지 않는다. 검열이 거의 없는 도구를 원하는 사용자가 NovelAI를 찾는 이유이기도 한데, 그 한계는 NovelAI 가이드에 정리했다.
비교 절차 요약
- 설정집 요약 300자, 문체 샘플 400자, 장면 지시 1개를 준비한다.
- 두 모델에 동일하게 넣고 각 3회 생성한다(한 번의 결과는 우연일 수 있다).
- 문체 5개 항목, 일관성 4개 항목, 검열 반응을 표로 채운다.
- 내 장르에서 가장 중요한 축에 가중치를 둔다. 로맨스는 문체, 장편 판타지는 일관성, 스릴러는 검열 반응.
- 한 작품에서는 한 모델을 유지한다. 바꾸면 퇴고에서 문체 통일 점검을 거친다.
모델보다 먼저 볼 것
두 모델의 차이보다 다음 세 가지가 결과에 더 큰 영향을 준다.
- 설정집이 프롬프트에 들어갔는가
- 문체 샘플이 작가가 직접 쓴 글인가
- 장면 단위로 생성했는가, 회차 전체를 한 번에 뽑았는가
이 세 가지가 갖춰지지 않은 상태에서 모델을 바꾸는 것은 원인을 잘못 짚은 것이다.
SparkLore에서 바로 해보기
SparkLore는 작업 종류에 따라 모델을 선택해 쓰며, 설정집과 문체 샘플이 프로젝트에 저장되어 생성마다 자동으로 포함된다. 즉 위 비교 절차의 1번 조건이 기본으로 갖춰진다. AI 스토리 생성기에서 같은 지시로 몇 번 생성해 보며 문체 항목을 직접 세어 보길 권한다.
자주 묻는 질문
- 한국어 소설에는 Claude와 GPT 중 어느 쪽이 확실히 낫나요?
- 공개된 벤치마크로 단정할 수 없고 장르와 작업에 따라 갈린다. 같은 설정집과 같은 장면 지시로 두 모델의 출력을 받아 문체 준수, 설정 유지, 거부 반응을 직접 비교하는 것이 유일하게 믿을 수 있는 방법이다.
- 모델이 폭력이나 성인 묘사를 거부하면 어떻게 하나요?
- 장면의 목적과 서사적 맥락을 명시하고 묘사 수위를 구체적으로 지정하면 거부가 줄어드는 경우가 많다. 그래도 거부되면 해당 장면만 다른 모델로 쓰거나 작가가 직접 쓴다. 모델의 정책을 우회하는 방법은 다루지 않는다.
- 모델을 바꾸면 문체가 달라지지 않나요?
- 달라진다. 그래서 문체 샘플을 프롬프트에 항상 포함해야 하고, 한 작품 안에서는 가급적 한 모델을 유지하는 것이 좋다. 부득이 바꾼다면 퇴고 단계에서 문체 통일 점검을 거친다.
- 클로드 소설
- Claude 소설 쓰기
- GPT 소설
- 한국어 소설 AI 모델
- AI 모델 비교 소설