Methodology
튜닝 데이터와 최종 평가 데이터를 분리합니다
같은 질문으로 반복 튜닝하고 다시 성능을 측정하면 일반화 성능을 과대평가할 수 있습니다. 그래서 development, regression, shadow, blind holdout의 역할을 구분합니다.
구조적 개선과 오류 분석에 사용합니다.
이미 발견한 실패가 다시 생기는지 확인합니다.
운영과 유사한 관찰용 보조 평가로 사용합니다.
candidate를 freeze한 뒤 최초 평가에 사용합니다.
Blind-120 평가 절차
- retrieval runtime source를 먼저 freeze합니다.
- blind dataset hash를 평가 전에 고정하고 다시 확인합니다.
- runtime source와 질문 간 leakage scan을 수행합니다.
- 120개 질문을 모두 실행한 뒤에만 결과를 평가합니다.
- 관찰된 실패 질문을 특정 법률·조문·phrase 규칙으로 보정하지 않습니다.
- 다음 formal acceptance에는 새로운 untouched holdout이 필요합니다.