Executive Summary

  • 고전적인 머신러닝 평가(정확도, 정밀도, 재현율)는 엄격하고 잘 정립되어 있지만, 현대의 언어 모델과 에이전트 AI 시스템에는 적용되지 않는 가정, 즉 완벽한 정답(ground truth)이 존재한다는 가정에 기반하고 있습니다. 
  • 과학적 응용 분야에서는 이러한 문제가 더욱 증폭됩니다. 질문은 개방형이고, 오류는 실질적인 결과를 초래하며, 결정적인 진실이 존재하지 않을 수도 있기 때문입니다. 
  • 이러한 평가 격차를 해소하기 위해 새로운 평가 접근 방식(LLM-as-a-judge, 인간 참여형 검토, 소급 벤치마킹, 의미론적 안정성 테스트, 추론 평가)이 등장했습니다. 
  • 가장 강력한 평가 전략은 인간의 방법과 자동화된 방법을 대체재가 아닌 상호 보완적인 관계로 다루는 것입니다. 체계적인 접근 방식은 규모와 일관성을 제공하고, 도메인 전문가는 시스템의 신뢰 여부를 결정하는 과학적 판단을 제공합니다. 

AI 시스템을 누군가에게 건네며 "이 시스템이 좋은가?"라는 단순해 보이는 질문을 던져보십시오. 과학 및 산업 전반에 걸쳐 활용되는 LLM 기반 시스템은 개방형 질문에 답하고, 증거를 검토하며, 결론에 도달하기 위한 단계를 수행하도록 설계되었습니다. 유창하고 자신감 있는 답변을 생성하는 것은 쉽지만, 그것이 정확한지, 그리고 다음에 다시 질문했을 때도 동일한 결과가 나올지 확인하는 것은 별개의 문제입니다. 

머신러닝 모델은 수년간 사용되고 테스트되어 왔습니다. 무엇이 달라졌을까요? 전통적인 ML 모델은 이메일 스팸 분류, 대출 신청자의 채무 불이행 예측, 방사선 영상에서 종양 식별과 같은 작업을 수행하는 데 사용됩니다. 각 문제는 구체적이며 결과는 결정론적입니다. 즉, 주어진 입력에 대해 단일 출력이 존재합니다. 이러한 모델의 작업을 확인하는 방법은 수십 년간 확립된 관행이 있습니다. 간단히 말해, 학습 중에 모델이 보지 못한 예제를 따로 설정하고, 학습된 모델에 적용하여 정답을 맞히는 빈도를 측정하는 것입니다. 

이러한 프레임워크는 엄격하고 해석 가능하며 신뢰할 수 있습니다. 그러나 조직이 현재 배포하고 있는 AI 시스템에는 충분하지 않습니다. 이러한 변화는 AI에게 요구되는 역할의 근본적인 변화를 반영합니다. 오늘날의 언어 모델과 그 추론을 바탕으로 행동하는 에이전트 시스템은 입력을 고정된 레이블 세트에 매핑하지 않습니다. 대신, 개방형 언어를 생성하고 행동을 취하며, 이 과정에서 고전적인 접근 방식이 사용하는 많은 가정을 깨뜨립니다. 같은 질문을 두 번 해도 다른 답변이 나올 수 있습니다. 답변은 유창하고 자신감 넘치지만 틀릴 수도 있습니다. 우리가 AI 시스템을 통해 답을 얻고자 하는 가장 어렵고 가치 있는 질문들에 대해서는 대조할 수 있는 정해진 답이 아예 없을 수도 있습니다. 

이러한 격차가 가장 중요한 곳은 바로 과학 분야입니다. 가치 있는 질문은 아직 아무도 답하지 못한 질문이기 때문입니다. 또한, 잘못된 답변은 단순한 예측 오류가 아니라 연구 프로그램을 수개월간의 막다른 길로 몰아넣을 수 있습니다.  

이어지는 내용은 이러한 변화를 추적합니다. 고전적 프레임워크가 왜 그렇게 잘 작동했는지, 왜 현대 AI에는 부족한지, 그리고 그 거리를 좁히기 위해 새롭게 등장하는 접근 방식은 무엇인지 설명합니다. 

고전적 머신러닝 평가의 안락한 세계 

이러한 새로운 시스템이 깨뜨리는 가정들은 거의 명시되지 않습니다. 고전적 머신러닝에서는 그럴 필요가 거의 없었기 때문입니다. 전통적인 평가는 세 가지 가정에 기반하며, 보통 충족되기 때문에 간과하기 쉽습니다.  

  • 첫째, 모델 출력을 비교할 수 있는 결정적인 정답(ground truth)이 존재한다는 가정입니다.  
  • 둘째, 작업이 제한되어 있어 가능한 출력 공간이 유한하고 잘 정의되어 있다는 가정입니다.  
  • 셋째, 예측이 옳거나 그르다는 점에서 정확성이 명확하며, 인간(또는 레이블이 지정된 데이터셋)이 그 차이를 구분할 수 있다는 가정입니다. 

이러한 가정들은 머신러닝을 처음으로 유명하게 만든 문제들에 잘 적용됩니다.  

  • 스팸 탐지는 이진 분류 문제입니다.  
  • 이미지 인식은 입력을 고정된 레이블 세트에 매핑합니다.  
  • 사기 탐지는 학습된 임계값을 기준으로 거래 점수를 매깁니다.  

각 경우에 평가 방식은 동일합니다. 모델의 출력값을 정답이 이미 알려진 예제와 비교하여 얼마나 자주 맞히는지 측정하는 것입니다. 

이 프레임워크에서 도출되는 표준 지표는 다음과 같습니다.  

  • 정확도(Accuracy). 모델이 맞힌 전체 예측의 비율입니다. 직관적이지만 특정 결과가 다른 결과보다 훨씬 흔할 경우 오해의 소지가 있습니다. 
  • 정밀도(Precision). 모델이 긍정으로 표시한 것 중 실제 긍정인 비율입니다. 알림의 신뢰도를 측정하는 지표입니다. 
  • 재현율(Recall). 실제 존재하는 모든 긍정 사례 중 모델이 포착한 비율입니다. 놓치는 정도를 측정하는 지표입니다. 
  • F1 점수(F1 score). 정밀도와 재현율의 조화 평균입니다. 하나를 희생하여 다른 하나를 높이는 모델에 불이익을 주어 단일 수치로 평가해야 할 때 유용합니다. 
  • ROC 곡선 아래 면적(Area under the ROC curve). 모델의 신뢰도 점수는 더 많은 실제 긍정 사례를 포착하는 것과 더 많은 오경보를 유발하는 것 사이에서 균형을 맞추도록 조정할 수 있습니다. ROC 곡선은 가능한 모든 임계값에 걸쳐 이러한 상충 관계를 나타내며, 그 아래 면적은 전반적인 판별력을 단일 수치로 요약합니다. 1.0은 모델이 두 클래스를 완벽하게 분리함을 의미하고, 0.5는 동전 던지기보다 나을 것이 없음을 의미합니다. 

각 지표는 모델 동작의 실제 측면을 포착하며, 이러한 측정값은 매우 기초적인 것이 되어 대부분의 실무자가 당면한 문제와 관계없이 가장 먼저 확인하는 요소가 되었습니다. 문제는 이러한 기본 가정이 더 이상 충족되지 않을 때 시작됩니다. 

언어 모델이 기존 프레임워크를 무너뜨리는 이유 

언어 모델의 경우 이러한 가정은 모두 무너집니다. 언어 모델은 미리 정의된 답변 세트에서 선택하지 않습니다. 대신 개방형 텍스트를 생성하므로 가능한 출력 공간은 무한합니다. 질문할 가치가 있는 대부분의 질문에는 비교할 단일 정답이 없으며, 한 문단이 어떤 면에서는 정확하고 다른 면에서는 틀릴 수 있고, 관련은 있지만 모호할 수 있으며, 논리적이지만 피상적일 수도 있습니다. 때로는 이 모든 것이 동시에 나타나기도 합니다. 출력값이 올바른지 여부는 고정된 답변과의 단순한 비교가 아닌 판단의 영역이 됩니다. 

에이전트 시스템이 단순히 반응하는 것을 넘어 직접 행동을 취한다는 점을 고려하면 이러한 도전 과제는 더욱 명확해집니다. 연구 에이전트는 정보를 검색하고, 여러 출처의 정보를 종합하며, 중간 단계를 추론하고, 인간의 검토를 거치지 않은 결론을 도출할 수 있습니다. 이러한 시스템을 평가한다는 것은 최종 결과물뿐만 아니라 그 결과를 도출하기까지의 의사결정 과정을 평가하는 것을 의미합니다. 특히 추론 자체가 후속 행동에 영향을 미치는 환경에서는, 잘못된 추론을 통해 도달한 올바른 결론은 올바른 추론을 통해 도달한 결론과 동일하지 않습니다. 

이러한 변화의 이면에는 언어 모델 결과물의 평가를 어렵게 만드는 몇 가지 특성이 있습니다. 

  • 재현성이 더 이상 보장되지 않습니다. 동일한 프롬프트로 실행할 때마다 다른 답변이 나올 수 있기 때문에, 고정된 입력이 더 이상 고정되고 확인 가능한 결과를 보장하지 않습니다. 이는 과학적 관행과 고전적인 머신러닝 평가가 공유하는 초석을 흔드는 일입니다. 
  • 실패의 징후가 나타나지 않습니다. 언어 모델은 유창하고 일관된 텍스트를 생성하도록 훈련되지만, 유창함이 곧 정확함을 의미하지는 않습니다. 모델은 사실과 다른 내용을 자신감 있고 논리적으로 일관된 어조로 생성할 수 있으며, 종종 문제가 발생했다는 어떠한 징후도 없이 이러한 결과를 내놓습니다.  
  • 정확성은 맥락에 따라 달라집니다. 모델의 답변이 적절한지는 질문자가 누구인지, 왜 질문하는지, 그리고 그 답변으로 무엇을 하려는지에 따라 결정됩니다. 일반 독자를 만족시키는 요약이 전문가에게는 잘못된 정보를 줄 수 있습니다. 기술적으로 정확한 답변이라도 적절한 주의 사항이 누락되었다면 쓸모없을 수 있습니다. 

과학 분야에서는 이러한 어려움이 더욱 가중됩니다. 

이러한 일반적인 도전 과제들은 과학적 응용 분야에서 더욱 증폭되는데, 이곳에서 정밀함은 선택 사항이 아니라 전문적이고 실질적인 필수 요건이기 때문입니다. 

과학적 질문은 완전히 제한적인 경우가 드뭅니다. AI 시스템에 유망한 약물 후보를 식별하거나, 합성 경로를 제안하거나, 문헌에서 분야 간 연관성을 찾아내도록 요청하는 것은 이미지를 분류하도록 요청하는 것과는 다릅니다. 답변의 범위는 방대하고, 만족스러운 답변에 대한 기준은 다차원적이며, 오류가 발생하면 잘못된 실험으로 이어지거나, 수개월의 시간을 낭비하게 하거나, 결과를 재현할 수 없게 만들 수 있습니다. 

이는 더 심각한 문제로 이어집니다. AI가 가장 큰 가치를 창출할 수 있는 분야에서는 아직 결정적인 정답(ground truth)이 존재하지 않는 경우가 많습니다. 이전에 관련이 없던 두 문헌을 연결하는 새로운 가설을 제시하는 시스템은 알려진 정답과 비교하여 벤치마킹할 수 없습니다. 만약 정답이 이미 알려져 있다면, 그 가설은 새로운 것이 아닐 것입니다. 내부 벤치마크에서는 높은 점수를 받지만 실제 실험 조건에서 무너지는 모델은 자원을 잘못 배분하고, 프로젝트를 지연시키며, AI가 과학적 관행의 일부로 자리 잡을지 여부를 결정하는 연구자들의 신뢰를 떨어뜨릴 수 있습니다.  

기존 텍스트 지표 

기계가 생성한 텍스트는 대규모 언어 모델과 함께 등장한 것이 아니며, 이를 평가하는 문제 또한 마찬가지입니다. 기계 번역 및 요약 시스템은 오늘날의 모델이 등장하기 훨씬 전부터 대규모 평가가 필요한 텍스트를 생성해 왔으며, 이 분야에서는 이를 위해 특별히 설계된 자동화된 지표 제품군을 구축했습니다. 현재 널리 사용되는 세 가지 지표는 다음과 같습니다. 

  • BLEU. 기계 번역을 위해 설계된 이 지표는 모델의 출력물이 하나 이상의 참조 텍스트와 짧은 단어 시퀀스 수준에서 얼마나 겹치는지를 측정하며, 답변이 너무 짧을 경우 페널티를 부여합니다(Papineni et al., 2002). 
  • ROUGE. 요약을 위해 개발된 이 지표는 상호 보완적인 관점을 취하며, 모델의 출력 결과에 참조 텍스트가 얼마나 포함되어 있는지를 측정합니다(Lin, 2004). 
  • METEOR. 표면적인 형태보다는 의미를 평가하려는 개선된 지표로, 동일한 단어뿐만 아니라 어근과 동의어까지 일치시키며 정밀도와 재현율의 균형을 맞춥니다(Banerjee and Lavie, 2005). 

이러한 지표들은 허용 가능한 답변의 범위가 좁은 작업에서 정확도를 측정하는 수단입니다. 그러나 이 지표들은 해당 시스템에서 문제가 되는 가정을 전제로 합니다. 즉, 비교할 참조 텍스트가 필요하며, 답변이 올바르거나 논리적이거나 유용한지가 아니라 참조 텍스트와 얼마나 유사한지를 측정합니다. 참조 텍스트와 다르게 표현된 올바른 답변은 낮은 점수를 받을 수 있는 반면, 참조 텍스트의 문구를 그대로 반복하는 유창한 답변은 내용이 틀려도 높은 점수를 받을 수 있습니다. 다양한 표현이 가능하고 참조 텍스트가 아예 존재하지 않을 수도 있는 개방형 합성 작업에서, 고정된 목표와의 유사성은 품질을 판단하는 데 불완전한 지표일 뿐입니다. 

새로운 평가 접근 방식 

이러한 문제에 대응하기 위해 몇 가지 평가 접근 방식이 등장했습니다. 이는 기존의 고전적 지표를 대체하는 것이 아니라 보완하는 필수적인 방법입니다. 이들을 함께 사용하면 단일 방법으로는 놓칠 수 있는 다양한 오류 유형을 해결할 수 있습니다. 

LLM-as-a-judge(판사로서의 LLM) 는 별도의 언어 모델을 사용하여 평가 대상 모델의 출력을 평가합니다. 이 접근 방식은 인간의 검토로는 불가능한 수준의 확장성을 제공합니다. 잘 설계된 판사 모델은 도메인 전문가가 수십 개의 출력을 검토할 시간에 수천 개의 출력을 평가할 수 있습니다. 언어 모델이 인간만큼 정확하게 수행할 수 있을까요? 그렇습니다. 이를 성공시키는 핵심은 구체성입니다.  

예를 들어, 도메인 전문가 패널이 동일한 텍스트를 독립적으로 검토한다고 가정해 보겠습니다. 각 검토자가 품질에 대해 서로 다른 결론을 내릴 수 있는데, 이는 누군가 틀려서가 아니라 각자가 암묵적으로 서로 다른 기준을 중요하게 여기기 때문입니다. 어떤 이는 사실적 정확성을 우선시하는 반면, 다른 이는 완전성이나 불확실성에 대한 적절한 표현을 중요하게 생각할 수 있습니다. 명시적이고 공유된 지표가 없다면, "좋음"이라는 평가는 검토자 개인이 내리는 주관적인 의미에 불과하게 됩니다.  

이러한 인간 판단의 편차는 이미 잘 기록되어 있습니다. Zheng et al. (2023) 은 개방형 LLM 응답을 평가하는 인간 전문가 주석자들이 단순 쌍대 비교에서 서로 동의하는 비율이 80%에 불과하다는 사실을 발견했습니다. 이 수치조차 주석자들이 동일한 작업에 대해 동일한 명시적 루브릭을 사용한 유리한 조건에서의 결과입니다. 평가를 기술 유형별로 세분화하면 상황은 더욱 복잡해집니다. Ye et al. (2024) 는 크리펜도르프 알파(Krippendorff's alpha)를 사용하여 12개의 서로 다른 평가 차원에 걸쳐 인간 주석자 간의 일치도를 측정했으며, 전체적인 인간 간 알파 값이 0.488에 불과하여 중간 정도의 일치도만을 보인다는 점을 확인했습니다. 

잘 설계된 평가 프롬프트는 암묵적인 추론을 명시적으로 드러내어, 판단 모델이 단일한 전체적 판결을 내리는 대신 구체적이고 분리 가능한 차원(사실적 일관성, 연관성, 완전성, 불확실성의 적절한 표현)을 평가하도록 요구합니다(Liu et al., 2023; Ye et al., 2024). 이는 판단 주체가 언어 모델이든 인간 전문가든 상관없이 더욱 일관되고, 감사 가능하며, 조치 가능한 평가 결과를 도출합니다. 

인간 참여형 평가(Human-in-the-loop evaluation) 는 자동화된 방식이 가장 취약한 경우에 여전히 필수적이며, 이를 배치하는 논리는 대규모 제조 분야에서 잘 확립된 원칙을 반영합니다. 생산 환경에서 모든 단위가 동일한 수준의 정밀 조사를 받는 것은 아닙니다. 의료 기기나 안전이 중요한 시스템에 사용되는 부품은 인간이 직접 개별적으로 검사합니다. 표준 출력물은 자동화된 테스트로 처리하되, 오류를 조사하거나, 예외 사례를 검증하거나, 주기적인 배치 감사를 수행할 때 인간 검토자가 투입됩니다. 이러한 원칙은 미국 식품의약국(FDA)의 품질 관리 시스템 규정(21 CFR Part 820)과 AS9100D 및 ISO 13485:2016과 같은 수많은 품질 표준에 반영되어 있습니다. 

과학적 AI 평가도 동일한 논리를 따릅니다. 새로운 결과물, 중대한 결론, 자동화된 평가 시스템의 보정 작업에는 전문가의 직접적인 검토가 필요합니다. 대규모의 일상적인 출력물은 체계적으로 처리되며, 인간의 판단은 병목 현상이 아닌 에스컬레이션 경로로서 활용됩니다. 도메인 전문가는 자동화된 시스템이 할 수 없는 능력을 발휘합니다. 즉, 내부적으로는 일관성이 있어 보이지만 실제로는 미묘하게 잘못된 답변을 식별하거나, 모델이 해당 분야의 구식 지식을 바탕으로 추론하고 있는지 파악하거나, 기술적으로는 정확하더라도 맥락 없이 해석하는 실무자에게 오해를 불러일으킬 수 있는 결과를 표시하는 능력입니다. 목표는 인간의 개입을 극대화하는 것이 아니라, 가장 큰 영향력을 발휘할 수 있는 곳에 인간의 역량을 집중하는 것입니다. 

회고적 벤치마킹(Retrospective benchmarking) 은 과학적 AI 평가의 가장 근본적인 긴장 관계 중 하나인 '이미 답을 알지 못하는 질문에 대해 시스템을 어떻게 측정할 것인가?'라는 문제를 다룹니다.  

두 가지 서로 다른 사용 사례를 고려해 보겠습니다. 첫 번째는 연구자가 AI 시스템에 녹는점, 규제 분류, 문서화된 반응 수율과 같은 특정 정보를 찾아달라고 요청하는 경우입니다. 이는 평가하기가 간단합니다. 시스템이 정답을 검색했거나 그렇지 않았거나 둘 중 하나이기 때문입니다. 두 번째 사용 사례는 더 어렵습니다. 연구자가 시스템에 여러 소스의 정보를 종합하여 단일 문서에는 포함되지 않은 통찰력을 도출해 달라고 요청하는 경우입니다. 이는 연구자들이 가장 중요하게 생각하는 부분이지만, AI 시스템이 결과를 검증하는 데 사용할 수 있는 기존의 정답이 없기 때문에 평가하기가 훨씬 어렵습니다. 이러한 오픈 월드 작업은 드리프트(drift) 현상이 발생하기 가장 쉬운 작업이기도 합니다. 과학적 이해가 발전함에 따라 예상되는 추론 방식과 수용 가능한 답변이 모두 변할 수 있으므로, 평가는 일회성 작업이 아닌 지속적인 재검토 과정이 되어야 합니다. 

검증 가능한 것만 테스트하려는 본능이 생길 수 있습니다. 하지만 이는 시스템이 가장 설계되지 않은 작업에 대해서만 평가하는 결과를 초래할 것입니다. 더 나은 접근 방식은 시스템에 단순 검색이 아닌 종합을 통해 이미 답이 나와 있는 질문에 답하도록 요청하는 것입니다. 한때는 참신했고, 서로 다른 문헌들을 연결해야 했으며, 이제는 확립된 과학적 기록의 일부가 된 연구 결과들이 이상적인 테스트 사례가 됩니다. 발견 당시 정보가 이용 가능했다면, 유능한 시스템은 그 추론 과정을 재구성할 수 있어야 합니다.  

이것이 바로 회고적 벤치마킹입니다. 과학적 발견의 역사를 직접 테스트할 수 없는 개방형 종합 평가를 위한 대리 평가 세트로 사용하는 것입니다. 이 접근 방식은 문헌 기반 발견이라는 성장하는 분야에서 선례를 찾을 수 있습니다. Swanson, (1986) 논리적으로는 연결되어 있으나 상호작용하지 않는 두 문헌을 식별하고, 그 연결 고리가 명시적으로 발표된 적 없는 가설(식이 어유가 레이노 증후군 환자에게 도움이 될 수 있다는 가설)을 암시함을 보여주었습니다. 이후, Spangler et al. (2014) 은 이 논리를 계산적으로 확장하여 과학 문헌을 마이닝함으로써 어떤 키나아제가 종양 억제 인자인 p53을 인산화하는지에 대한 가설을 생성했습니다. 그런 다음 새로운 실험을 수행하기 전에 회고적 분석을 사용하여 해당 접근 방식의 정확성을 검증했습니다. 두 경우 모두 회고적 프레임워크의 가치는 동일합니다. 입력값이 특정 시점에 고정되어 있으므로 오픈 월드 벤치마크처럼 평가 결과가 진부해지지 않습니다.  

이 접근 방식은 이미 이루어진 연결을 테스트할 뿐 미래의 모든 가능성을 테스트하는 것은 아니며, 평가 시점에 시스템이 사용할 수 있는 정보를 제한하기 위해 세심한 엔지니어링이 필요하다는 한계가 있습니다. 그러나 시스템이 단순히 정보를 검색하는 것을 넘어 소스 전반을 진정으로 종합할 수 있는지 확인하는 유효성 검사 도구로서, 이는 현재 사용 가능한 몇 안 되는 엄격한 도구 중 하나입니다. 

의미론적 안정성 테스트는 정적 테스트에서 흔히 놓치는 실패 모드를 해결합니다. 언어 모델은 질문이 구성되는 방식에 민감할 수 있습니다. 의미를 바꾸지 않고 동일한 쿼리를 다시 작성해도 다른 답변이 생성될 수 있습니다. 과학 보조 도구에 있어 이는 신뢰성 측면에서 중요한 문제입니다. 연구자는 시스템의 응답이 자신이 사용한 특정 단어가 아니라 질문의 본질을 반영한다고 신뢰할 수 있어야 합니다. 여러 시나리오가 이 문제를 잘 보여줍니다. 

첫 번째는 동의어 대체입니다. 불변성 테스트(의미는 유지하면서 표면적인 형태를 변경하는 섭동)를 사용하여, Ribeiro et al. (2020) 은 광범위하게 테스트된 상업용 감성 분석 모델에서 감지되지 않았던 치명적인 오류를 식별했습니다. 'film'을 'movie'로 바꾸거나 'determine'을 'find out'으로 바꾸는 것과 같은 근사 동의어 교체는 과학 보조 도구가 제공하는 답변을 변경해서는 안 되지만, 실제로는 빈번하게 변경됩니다. 

두 번째는 부정입니다. 많은 부정 벤치마크 전반에 걸쳐 모델을 체계적으로 평가한 결과 일관된 한계가 발견되었습니다. 부정의 존재에 대한 둔감함, 부정의 어휘적 의미론을 포착하지 못하는 무능력, 그리고 부정 하에서 올바르게 추론하지 못하는 실패가 그것입니다(Truong et al., 2023). 이는 'A가 B를 유발한다', 'A가 B를 유발할 수 있다', 'A가 B를 유발함을 시사한다', 'A가 B를 유발한다는 주장을 뒷받침하지 않는다'와 같이 몇 단어만으로도 진술의 사실 여부가 바뀔 수 있는 과학적 맥락에서 매우 중요합니다.   

세 번째는 형식성입니다. 문법, 어조 또는 형식의 변화가 모델 출력의 품질과 방향을 크게 바꿀 수 있다는 연구 결과가 있습니다. 일부 모델은 쿼리를 덜 형식적으로 작성하는 사용자에게 더 낮은 품질의 답변을 생성하기도 합니다(예: "메커니즘이 뭐야?" vs "기계론적 근거를 설명해 줄 수 있나요..."). 기술적인 산문이 아닌 평이한 언어로 글을 쓰는 연구자도 그렇지 않은 연구자와 동일한 실질적인 응답을 받아야 합니다. 최근 연구는 이러한 우려를 공식화했습니다. Lior et al. (2025) 은 의미를 보존하는 프롬프트 섭동 공간 전반에 걸쳐 확률적 평가를 주장하며, GPT-4o 및 Claude 3.7 Sonnet과 같은 최고 성능의 모델조차도 상당한 프롬프트 민감도를 보인다는 점을 발견했습니다. 

다양한 연구의 증거를 고려할 때, 질문당 하나의 문구만 평가하는 방식으로는 이 문제가 드러나지 않을 것입니다. 따라서 동일한 의미를 가진 쿼리 전반에 걸쳐 언어를 다양화하고 응답이 일관되게 유지되는지 확인하는 것은 모든 진지한 평가 규율의 일부가 되어야 합니다. 

추론 평가 는 에이전트 시스템 및 과학적 응용 분야에서 중요합니다. 연구 보조 도구가 문제를 추론하고, 소스를 검색하고, 결론을 도출할 때 과학자들은 결론이 옳은지 여부뿐만 아니라 결론에 도달한 과정도 이해해야 합니다. 이는 결과가 재현 가능해야 하고 방법이 투명해야 한다는 과학의 근본적인 기대를 반영합니다.  

모델이 최종 답변을 내놓기 전에 중간 추론 단계를 생성하도록 유도하는 사고의 연쇄(Chain-of-thought) 프롬프팅은 복잡한 추론 작업에서 성능을 크게 향상시키는 것으로 나타났습니다. 이 방식의 도입은 추론 과정을 읽기 쉽게 만드는 해석 가능성이라는 이점 때문에 부분적으로 추진되었습니다(Wei et al., 2022). 그러나 추론 단계가 가시적이라고 해서 신뢰성이 보장되는 것은 아닙니다. Turpin 등(2023) 은 이러한 가독성이 환상일 수 있음을 보여주었습니다. 사고의 연쇄(chain-of-thought) 설명은 모델 예측의 진정한 근거를 체계적으로 왜곡할 수 있습니다. 그들의 핵심 실험에서, 객관식 옵션의 순서를 재배치하여 정답이 항상 "A"가 되도록 모델 입력에 미묘한 편향을 추가했습니다. 이는 모델 출력을 확실하게 변화시켰지만, 모델은 명시된 추론에서 이러한 영향을 언급하지 못했습니다. 결함이 있거나 불투명한 추론 과정을 통해 정답을 도출하는 시스템은 잠재적 위험 요소입니다. 다음에 답변할 질문이 정답이 아닐 수 있으며, 이를 판별할 방법이 없기 때문입니다. 

단순히 정답을 생성하는 것이 아니라 모델이 올바르게 추론하도록 훈련하는 방법에 대한 질문이 직접적인 관심을 받기 시작했습니다. Lightman 등(2023) 은 최종 답변의 정답 여부에 따라 모델에 보상을 주는 결과 감독(outcome supervision)과 각 개별 추론 단계에 점수를 부여하는 과정 감독(process supervision)을 비교하여 그 중요성을 설명합니다. 그들은 결과 감독으로 훈련된 모델이 정답을 도출하기 위해 잘못된 추론을 사용하는 경우가 많았으며, 과정 감독이 훨씬 더 신뢰할 수 있는 시스템을 생성한다는 사실을 발견했습니다. 이러한 훈련에 대한 통찰은 평가 원칙으로 이어집니다. 즉, 훈련에 사용할 만큼 정답 단계를 정확하게 정의할 수 있다면, 감사를 수행할 만큼 정확하게 정의할 수도 있다는 것입니다. 

따라서 단순히 결과물이 아닌 추론 과정을 평가하려면 "이 답변이 맞는가?"가 아니라 "시스템이 답변에 도달하기 위해 적절한 단계를 거쳤는가?"라는 다른 종류의 테스트가 필요합니다. 이는 그 자체로 루브릭 기반의 연습이지만, 결과물이 아닌 과정에 적용되는 것입니다. 올바른 단계가 무엇인지 정의하기 위해 전문가의 의견이 필요하고 설계하기가 더 까다롭지만, 이는 과학자들이 AI 시스템의 결론에 따라 행동하기 전에 필요한 정당한 신뢰를 구축하는 데 정확히 필요한 평가 유형입니다. 

에이전트 평가의 새로운 방향은 관찰 가능한 행동(시스템이 호출하는 도구, 실행하는 검색, 정보를 검색하는 순서)이 명시된 근거만보다 추론 품질에 대한 더 신뢰할 수 있는 신호를 제공할 수 있음을 시사합니다. 다른 모델 출력과 동일한 과정으로 생성되어 환각 위험이 있는 사고의 연쇄 텍스트와 달리, 도구 호출 및 검색 단계는 감사 추적을 남기며 후속 행동을 제약하는 결과를 초래합니다. 다단계 도구 사용을 평가하기 위해 설계된 벤치마크에서 에이전트 궤적 평가에 대한 초기 연구는 작업 결과만이 아닌 이러한 중간 행동에 점수를 매기기 시작했습니다. 이 접근 방식이 성숙해지면 과학적 사용자들에게 진정한 방법론 감사에 더 가까운 것을 제공할 수 있을 것입니다. 

체계적 접근 방식과 인간 매개 접근 방식의 결합 

단일 평가 방법만으로는 충분하지 않습니다. 과학적 AI 평가에서 가장 큰 진전을 이루고 있는 조직은 이를 포트폴리오 문제로 취급하는 곳입니다. 즉, 커버리지와 일관성을 위해 자동화된 기술을 대규모로 배포하고, 보정, 엣지 케이스 검증, 진정한 과학적 이해가 필요한 판단을 위해 인간 전문가의 검토를 유지하는 것입니다. 최고의 평가 프레임워크는 어느 한쪽을 다른 쪽에 종속시키지 않고 각자의 상호 보완적인 강점을 활용합니다. 

과학 연구를 위한 AI 솔루션을 구축함에 있어 CAS는 이러한 계층적 접근 방식을 적용합니다. 자동화된 평가는 대규모 출력 세트 전반에 걸쳐 규모와 일관성을 처리하며, 구조화된 루브릭은 평가가 단일 숫자로 축소되지 않고 다차원적으로 이루어지도록 보장합니다. 또한 CAS Content Collection™의 기반이 되는 큐레이션 작업을 수행하는 도메인 과학자들은 시스템이 기술적으로 성능이 뛰어나고 과학적으로 타당한지 결정하는 인간의 판단을 제공합니다. 여기에는 CAS Newton℠의 결론뿐만 아니라 그 추론 방식, 즉 답변에 도달하기 위해 취하는 단계가 과학자가 보기에 적절하고 추적 가능하며 재현 가능한지 평가하는 것이 포함됩니다. 목표는 효율성을 위해 인간의 개입을 최소화하는 것이 아닙니다. 인간의 판단이 가장 큰 영향력을 발휘할 수 있는 곳으로 유도하는 것입니다. 

올바른 평가란 무엇인가 

평가는 AI 시스템이 구축된 후에 수행되는 단계가 아닙니다. 이는 시스템 설계 초기부터 고려해야 할 설계 제약 조건입니다. 초기에 질문해야 할 가치가 있는 사항은 다음과 같습니다. 

  •  "성공이란 무엇인가?" 
  • "시스템이 잘못되었는지 어떻게 알 수 있는가?" 
  • "누가 그러한 판단을 내릴 전문 지식을 가지고 있는가?" 

이것들은 단순한 평가 질문이 아닙니다. AI 시스템의 출력에 따라 행동하도록 요청받는 과학자와 연구자들의 신뢰를 얻을 수 있을지 결정하는 질문입니다. 

고전적인 ML 툴킷은 사라지지 않을 것입니다. 정밀도, 재현율, 벤치마크 성능은 여전히 중요하며, 복잡한 AI 시스템의 많은 구성 요소에 대해서도 여전히 올바른 측정 지표입니다. 그러나 과학 문헌 전반에 걸쳐 추론하고, 잠재된 연관성을 표면화하며, 근거가 불확실한 영역에서 가설을 제안하는 등 AI가 할 수 있는 영역의 최전선에서 작동하는 시스템의 경우, 엄격한 평가는 기존 접근 방식이 제공하는 것 이상의 것을 요구합니다. 그러한 엄격함을 개발하는 것 자체가 지속적인 과학적 도전이며, 평가 대상인 AI 시스템만큼이나 세심한 주의가 필요한 작업입니다. 

Questions and answers

과학적 인공지능을 평가하는 것이 기존의 머신러닝 모델을 평가하는 것과 다른 점은 무엇입니까?

회고적 벤치마킹이란 무엇이며, 왜 중요한가요? 

조직은 인공지능 시스템의 자동화된 평가와 인간의 평가 사이에서 어떻게 균형을 잡아야 할까요?

Related CAS Insights

__wf_예약_상속

제약 제형 데이터에 대한 검색 기능 실현

__wf_예약_상속

데이터 정리 및 조화: 혁신을 위한 촉매제

__wf_예약_상속

새로운 화학 반응 예측: 고품질 트레이닝 데이터가 반응 결과 예측에 미치는 영향

Gain new perspectives for faster progress directly to your inbox.