LLM이 스스로 생성한 단계별 추론 과정을 읽어 — 완곡 표현(hedging), 불확실성 표현, 자기 평가, 내부 일관성 등의 인식적 신호(epistemic signal)를 추출하여 — 모델이 자신의 답변에 대해 실제로 얼마나 확신하는지를 추정하는 신뢰도 추정 방법. 최종 답변의 로짓이나 하나의 언어화된 신뢰도 수치에만 의존하지 않습니다.
거대 언어 모델이 언제 정답을 낼 가능성이 높은지를 아는 것은, 고위험 환경에 LLM을 배포하고, 답변을 보류(abstain)할 시점을 결정하며, 어려운 사례를 사람이나 더 강력한 모델로 넘길지를 판단하는 데 필수적입니다. 현재 널리 쓰이는 신뢰도 신호는 크게 두 가지입니다: 토큰 수준 확률(최종 답변에 대한 소프트맥스 로짓)과 언어화된 신뢰도(모델에게 백분율이나 "꽤 확신합니다" 같은 표현을 직접 말하게 하는 방식)입니다. 두 방식 모두 편리하지만 보정(calibration)이 잘 되지 않는 것으로 알려져 있습니다 — 로짓은 표면 형태나 길이에 왜곡되고, 언어화된 수치는 체계적으로 과신하는 경향이 있으며 세밀함이 떨어집니다.
추론 중심 LLM이 부상하면서, 답변은 점점 더 명시적인 중간 단계들의 연쇄를 거쳐 생성됩니다. 이 추론 과정은 최종 토큰 분포보다 훨씬 풍부합니다: 모델이 문제를 풀어나가는 동안 의심과 확신의 흔적을 자연스럽게 남기기 때문입니다 — 완곡 표현("아마 ~일 것이다", "확실하지 않다"), 자기 수정과 되돌리기, 제기되었다가 버려지는 경쟁 가설들, 그리고 여러 단계가 같은 결론으로 수렴하는 순간들. 이러한 인식적 신호는 문제에 대한 모델의 변화하는 내부 상태를 반영하지만, 최종 답변만 바라보는 표준 신뢰도 방법은 이를 완전히 버립니다.
핵심 통찰: 모델의 추론 과정에는 풍부한 인식적 신호 — 완곡 표현, 자기 수정, 가설 전환, 중간 결론의 수렴 — 가 담겨 있으며, 이는 답변의 정오(correctness)를 강하게 예측합니다. 최종 답변 로짓이나 단일 언어화 수치만 읽는 표준 신뢰도 방법은 이 증거를 버립니다. 추론 과정 자체를 신뢰도 증거의 원천으로 다루면, 모델이 실제로 얼마나 확신하는지에 대해 더 충실하고 해석 가능한 추정이 가능합니다.
본 연구는 신뢰할 수 있는 신뢰도 추정에 관한 본 연구실의 연구 흐름 — 최종 답변에 신뢰도를 근거지어 보정을 개선하는 ADVICE(Answer-Dependent Verbalized Confidence Estimation, ACL 2026)를 포함 — 위에 서 있습니다. ADVICE가 신뢰도를 최종 답변에 조건화한다면, 본 연구는 한 단계 더 깊이 — 그 답변을 생성한 추론 과정으로 — 들어가, 추론 과정의 인식적 질감 자체가 사용 가능하고 더 잘 보정된 신뢰도 신호인지를 묻습니다.
핵심 아이디어는 신뢰도 추정을 추론 과정에 대한 2단계 파이프라인으로 다루는 것입니다: 먼저 모델이 추론하며 방출하는 인식적 신호를 드러내고, 그다음 이를 최종 답변에 대한 하나의 신뢰도 추정치로 집계합니다.
설계 원칙:
LLM이 점점 더 소리 내어 추론하며 질문에 답하게 되면서, 추론 과정은 모델이 생성하는 가장 정보가 풍부한 산출물 중 하나가 되었습니다 — 그러나 신뢰도 추정은 이를 대체로 무시해 왔습니다. 본 연구는 그 과정을 증거로 재구성합니다: 모델이 생각하며 완곡하게 말하고, 재고하고, 수렴하는 방식 자체가 모델이 얼마나 확신하는지를 들여다보는 창입니다. 이러한 인식적 신호로부터 신뢰도를 읽으면, 모델의 실제 추론에 더 충실하고 결정적으로 해석 가능한 추정치가 나옵니다 — 낮은 신뢰도 표시가 단지 보고되는 것이 아니라 설명될 수 있습니다.
실용적으로, 잘 근거지어진 신뢰도는 안전한 LLM 배포의 토대입니다: 언제 답변을 신뢰할지, 언제 보류할지, 언제 사례를 사람이나 더 강력한 모델로 넘길지를 결정합니다. 최종 답변 확률만이 아니라 추론 과정에서 신뢰도를 추출함으로써, 본 접근은 기존 방법을 괴롭히는 바로 그 실패 양상 — 추론에서는 의심이 보였으나 출력에서 버려진, 자신감 있게 들리지만 틀린 답변 — 을 겨냥합니다.
본 연구는 또한 신뢰할 수 있는 신뢰도 추정에 관한 연구실의 더 넓은 의제를 확장합니다. ADVICE의 답변 의존적 언어화 신뢰도와 나란히, 추정 대상을 안쪽으로 — 최종 답변에서 그것을 생성한 추론의 인식적 내용으로 — 밀어넣으며, 가장 풍부한 신뢰도 신호가 과정의 끝이 아니라 그 안에 있을 수 있음을 시사합니다.