GOV Legal Assistant근거 기반 법령 도우미

Methodology

튜닝 데이터와 최종 평가 데이터를 분리합니다

같은 질문으로 반복 튜닝하고 다시 성능을 측정하면 일반화 성능을 과대평가할 수 있습니다. 그래서 development, regression, shadow, blind holdout의 역할을 구분합니다.

Development

구조적 개선과 오류 분석에 사용합니다.

Regression

이미 발견한 실패가 다시 생기는지 확인합니다.

Shadow

운영과 유사한 관찰용 보조 평가로 사용합니다.

Blind holdout

candidate를 freeze한 뒤 최초 평가에 사용합니다.

Blind-120 평가 절차

  1. retrieval runtime source를 먼저 freeze합니다.
  2. blind dataset hash를 평가 전에 고정하고 다시 확인합니다.
  3. runtime source와 질문 간 leakage scan을 수행합니다.
  4. 120개 질문을 모두 실행한 뒤에만 결과를 평가합니다.
  5. 관찰된 실패 질문을 특정 법률·조문·phrase 규칙으로 보정하지 않습니다.
  6. 다음 formal acceptance에는 새로운 untouched holdout이 필요합니다.
다음 문서안전성과 개인정보