답변이 생성되는지 확인하는 것만으로는 법률 챗봇을 평가하기 어려웠습니다. 법무 챗봇 C사의 응답을 질문 유형과 근거에 따라 검토하고 어떤 영역을 더 개선해야 하는지 기록으로 남긴 사례입니다.

질문을 입력하면 문장이 나옵니다. 표현도 자연스럽고 질문의 의도를 이해한 것처럼 보입니다. 그러나 그 문장이 믿을 만한 답인지는 다른 문제입니다.

법무 챗봇 C사의 검증 과제는 이 차이에서 시작됐습니다. 대규모 언어 모델을 이용해 법률 질의에 답하는 서비스였지만 같은 질문에도 결과가 달라질 수 있었습니다. 답이 나오는지와 답이 맞는지를 구분할 기준이 필요했습니다.

2025년에 진행한 이 프로젝트에서는 버튼이나 화면의 동작을 넘어 응답의 내용을 검증 대상으로 삼았습니다. 자연스러운 문장이 아니라 합의한 기준과 근거에 맞는 답인지를 확인하는 것이 중심이었습니다.

LLM 응답의 정확성과 근거, 환각, 답변 유보 평가 개념도
문장의 자연스러움과 응답의 적절성을 다른 기준으로 살폈습니다.

답을 읽기 전에 무엇을 답으로 인정할지 정했습니다

평가 기준 없이 응답부터 읽으면 검토자의 인상에 따라 결과가 달라질 수 있습니다. 길고 자세하다는 이유로 좋은 답이라고 여기거나 확신에 찬 표현을 정확성으로 받아들이기 쉽습니다.

프로젝트에서는 정확성, 사실처럼 만들어 낸 내용의 유무, 제시된 근거와 답변의 일치를 판정 기준으로 합의했습니다. 응답을 볼 때 무엇을 확인하고 기록해야 하는지부터 정리했습니다.

근거가 있다는 사실과 그 근거가 답을 뒷받침한다는 사실도 구분해야 합니다. 어떤 출처를 언급했다는 이유만으로 충분하지 않습니다. 해당 출처의 내용과 응답이 같은 이야기를 하는지까지 살펴야 합니다.

평가 기준은 모델에 대한 막연한 기대를 검토 가능한 질문으로 바꿉니다. “똑똑하게 답한다”가 아니라 “이 질문에서 이런 내용을 말할 근거가 있는가”를 물을 수 있어야 했습니다.

답해야 하는 질문과 답을 멈춰야 하는 질문을 함께 넣었습니다

질문을 많이 준비하는 것만큼 질문의 종류도 중요합니다. 답할 수 있는 경우만 모으면 근거가 부족한 상황에서도 답을 만들어 내는 문제를 놓칠 수 있습니다.

법률 질의 시나리오는 유형별로 구성했습니다. 답을 제시해야 하는 질문과 답해서는 안 되는 질문을 함께 검증 범위에 넣었습니다.

후자의 목적은 챗봇이 말을 적게 하도록 만드는 데 있지 않습니다. 알고 있는 범위와 확인할 수 없는 범위를 구분하는 능력도 응답 품질의 일부로 보기 때문입니다. 모든 질문에 자신 있게 답하는 서비스와 답할 조건을 구분하는 서비스는 다르게 평가해야 합니다.

이 구분은 출시 판단에도 영향을 줍니다. 잘 답하는 질문이 많다는 사실만으로 특정 유형에서 반복되는 위험한 답변을 상쇄할 수는 없습니다. 전체 평균뿐 아니라 질문 유형별 결과가 필요한 이유입니다.

표현을 바꿨을 때도 같은 판단을 유지하는지 확인했습니다

같은 내용을 묻더라도 사용자는 매번 같은 문장을 입력하지 않습니다. 질문의 순서를 바꾸거나 같은 뜻을 다른 단어로 표현할 수 있습니다.

프로젝트에서는 질문의 의미를 유지하면서 표현을 바꿔 다시 실행했습니다. 한 번 잘 나온 응답만 보는 대신 표현의 차이에 따라 답의 내용과 근거가 흔들리는지를 살폈습니다.

표현이 달라졌다고 문장까지 똑같이 나올 필요는 없습니다. 확인하려는 것은 정해진 문구의 재현이 아니라 판단의 일관성입니다. 같은 전제에 대해 상충하는 답을 내놓거나 다시 물었을 때 근거가 달라지는지를 구분해야 합니다.

이렇게 접근하면 성공한 대화 한 건을 시연하는 것과 실제 질문에 대응할 준비를 평가하는 것 사이의 차이가 드러납니다.

질문 유형과 표현 변형을 나눈 검증 표
같은 뜻의 질문에서도 판단이 유지되는지 확인했습니다.

응답마다 판정과 이유를 함께 남겼습니다

검증 결과는 통과와 실패만으로 남기지 않았습니다. 질문 유형에 따라 응답의 판정과 근거를 기록하고 확인하지 못한 영역도 분리했습니다.

기록의 목적은 누군가의 평가를 고정하는 것이 아닙니다. 다른 검토자가 무엇을 보고 그런 판단을 내렸는지 이해하고 모델이나 프롬프트를 바꾼 뒤에도 다시 살펴볼 수 있도록 하는 것입니다.

예를 들어 부정확한 답변과 근거가 부족한 답변은 겉으로 비슷해 보여도 검토해야 할 이유가 다를 수 있습니다. 문제가 나타난 질문과 판정 이유가 함께 있어야 개선 방향을 논의할 수 있습니다. 단순한 실패 건수만으로는 무엇부터 고칠지 정하기 어렵습니다.

최종 결과에는 검증한 질문 유형과 함께 아직 판단하지 못한 범위도 남겼습니다. 시험하지 않은 영역을 문제가 없는 영역처럼 취급하지 않기 위해서입니다.

결과물은 하나의 정확도 숫자보다 개선할 지점의 지도였습니다

이 프로젝트에서는 질의 유형별 응답 평가와 환각이 발생한 지점을 정리했습니다. 어떤 질문에서 답이 흔들리는지가 드러나면서 출시 검토와 모델·프롬프트 개선의 우선순위를 논의할 근거가 마련됐습니다.

이 결과는 검증에 사용한 시나리오와 조건 안에서 해석해야 합니다. 이후 모델이나 프롬프트가 바뀌면 해당 질문을 다시 확인하고 실제 사용에서 새로 등장한 질문 유형도 평가 범위에 추가해야 합니다.

법률 챗봇의 품질은 답변창을 채우는 능력만으로 설명할 수 없습니다. 어떤 질문에 무엇을 근거로 답하고 어떤 상황에서는 답을 유보해야 하는지 확인하는 과정이 필요합니다. C사의 프로젝트는 그 판단을 반복해서 검토할 수 있는 기록으로 남겼습니다.

LLM 응답 유형별 판정과 근거 기록
개선할 지점을 다시 찾아볼 수 있도록 판정의 이유를 남겼습니다.