이전 글에서 설명했듯이, 완전하고 고품질의 학습 데이터 없이 작동하는 AI는 엔진 없는 자동차와 같습니다. 겉보기에는 그럴듯해 보일 수 있지만, 실제로는 앞으로 나아갈 수 없습니다. AI의 투명성 또한 사용자에게 매우 중요한 요소이므로, CAS는 AI가 언제, 어디에서 사용되는지를 명확히 알림으로써 사용자가 충분한 정보를 바탕으로 의사 결정을 내릴 수 있도록 하는 것을 목표로 합니다.
생성형 AI의 잘 알려진 위험 중 하나는 ‘환각(hallucination)’입니다. 이는 모델이 실제처럼 보이는 데이터를 생성하지만, 때로는 조작된 인용까지 포함하면서도 내용은 전혀 사실이 아닌 경우를 말합니다. 이러한 환각 현상은 R&D 환경에서는 용인될 수 없으며, 이를 방지하기 위한 조치가 반드시 필요합니다.
이 글에서는 CAS가 AI와 과학적 발견 사이의 간극을 메우는 데 있어 독보적인 위치를 어떻게 차지하고 있는지 살펴봅니다. 환각 현상을 최소화하고 고품질 학습 데이터를 우선시하는 AI 활용 전략을 통해 CAS가 연구에 필요한 핵심 정보를 사용자에게 제공하는 방법을 설명합니다.
학습 데이터
정확한 데이터는 과학적 R&D에서 필수 요건입니다. 실험이나 테스트의 결과는 하나의 의약품이 시장에 출시될 수 있는지를 좌우하거나, 제품 라인 전체를 다시 설계해야 하는지를 결정할 수도 있습니다.
학습 데이터는 AI 모델을 학습시키는 데 사용되는 엄선된 데이터 집합입니다. 이러한 데이터는 모델이 패턴을 인식하고, 작업을 학습하거나, 예측을 수행하는 데 도움을 줍니다. 모델의 성능은 데이터의 품질에 달려 있으며, 흔히 말하듯 “잘못된 데이터를 입력하면 잘못된 결과를 얻게 됩니다."
100년이 넘는 기간 동안 CAS는 화학 정보 분야에서 권위 있는 정보 출처로 자리매김해 왔으며, 사내 과학자들이 전 세계에서 가장 포괄적인 화학 데이터 컬렉션을 엄선해 왔습니다. 현재 CAS는 이러한 큐레이션 전문성을 AI 모델 개발로 확장해 과학적 발전을 지원하고 있습니다. 고객은 CAS가 신뢰할 수 있고 일관된 데이터를 제공할 것을 기대하며, 전문가가 선별한 학습 데이터 역시 동일한 수준의 신뢰성을 갖추도록 하는 것이 중요합니다. 이는 AI 성능이 고객의 기대에 부합하고 일관되게 유지되는 데 기여합니다.
정확한 답변, 환각 없음
많은 사람들에게 AI를 생각할 때 가장 먼저 떠오르는 것은 챗봇으로, 데이터 출처의 품질에 따라 부정확한 답변을 생성할 수 있습니다. 그러나 답변이 이미 해당 분야 전문가들에 의해 엄선되고 검증되며 체계적으로 정리되어 있다면 어떨까요? 이러한 경우 AI는 보다 효율적인 방식으로 통찰을 탐색하고 도출하는 데 활용될 수 있으며, 결과에 대한 신뢰도 또한 높아집니다.
투명성
과학적 검색과 발견을 새롭게 재구성해 나가는 과정에서 CAS는 고객의 피드백을 지속적으로 반영해 왔으며, 그중 핵심적인 주제 중 하나는 ‘신뢰’였습니다. AI를 활용한 새로운 혁신은 분명 흥미롭지만, 많은 AI 도구는 결과가 재현되지 않거나, 입력값의 미세한 변화에도 결과가 급격히 달라지며, 어떤 방식으로 결과가 도출되었는지 설명할 수 없는 ‘블랙박스’처럼 작동합니다. 이러한 특성은 사용자가 AI 도구가 생성한 과학적 결과를 신뢰하기 어렵게 만듭니다.
컨텐츠와 솔루션에 대한 사용자 신뢰를 유지하는 것은 CAS에 있어 무엇보다 중요합니다. LLM이 사용자와 데이터 사이에서 작동하는 방식의 불안정성을 줄이기 위한 조치를 취할 수는 있지만, 이러한 모델은 본질적으로 변동성을 내포하고 있습니다. 따라서 제품 내에서 AI가 사용되는 지점을 명확히 알리고 사용자가 원하는 정보를 찾을 수 있는 대체 경로를 분명하게 제공함으로써, AI 기반 기능에 대한 사용자의 주저함을 줄일 수 있습니다.
SearchSense in CAS SciFinder
그렇다면 CAS SciFinder는 어디에 해당할까요? 일반 사용자와 마찬가지로, 과학 연구자들 역시 방대한 정보 속을 일일이 파고드는 데 드는 시간을 줄일 수 있다면 큰 이점을 얻을 수 있습니다. 이는 과학 커뮤니티 전반에서 중요한 비효율 요소로 지적되어 왔습니다. CAS는 이러한 부담을 완화하기 위해 CAS SciFinder에 다양한 AI 기반 검색 개선 기능을 도입했으며, 이를 SearchSense라고 명명했습니다. SearchSense는 과학적 무결성을 유지하면서도 정보 탐색 과정을 간소화하도록 설계되었습니다.
지난 12개월 동안 CAS는 과학자를 위해 과학자가 개발한 가장 방대하고, 권위 있으며, 신뢰할 수 있는 과학 정보 검색 엔진을 구축해 왔습니다. SearchSense는 CAS의 최고 수준 화학 데이터 컬렉션과 AI를 결합해, 정확성을 훼손하지 않으면서도 연구자들이 더 빠르게 답을 찾을 수 있도록 지원합니다.
핵심 원칙
CAS SciFinder에 AI를 도입하기 시작했을 때, CAS는 결코 타협하지 않겠다고 정한 기본 기준들이 있었습니다. 따라서 CAS의 모든 솔루션은 다음 원칙을 반드시 준수해야 했습니다.
- 컨텐츠 제공에서 정확성을 최우선으로 할 것
- 검색 응답 속도를 유지할 것
- 고객 데이터의 기밀성을 보호할 것
SearchSense의 작동 방식
SearchSense의 가장 큰 특징은 답변을 생성하는 대신 검색 의도를 해석하는 데 AI를 활용한다는 점입니다. 사용자의 질의 의도를 정확히 이해함으로써, CAS SciFinder는 이미 신뢰성과 정확성에 대한 CAS 기준에 따라 엄선된 관련 답변과 이를 뒷받침하는 데이터를 사용자에게 안내할 수 있습니다. 의도 해석의 정확성은 견고하고 품질이 높은 학습 데이터 집합에 크게 좌우됩니다. CAS의 검색 질의 학습 데이터 세트는 CAS 전문가들이 생성한 1만 개 이상의 데이터 포인트로 구성되어 있으며, 이는 CAS 컨텐츠가 다루는 모든 과학 분야를 포괄합니다. 모든 영역에서 일관된 성능을 유지하는 것은 결코 쉬운 일이 아니었지만, 데이터 포인트를 수백 개만 추가하더라도 전체 정확도에 상호 보완적인 상승 효과가 나타난다는 사실을 확인할 수 있었습니다.
모델 아키텍처 및 성능
학습 데이터는 검색 질의의 의도를 판단하는 AI 모델을 학습시키는 데 사용되었습니다. 속도와 정확성은 사용된 모델의 크기에 따라 달라지며, 일반적으로 더 많은 매개변수를 사용하는 모델이 더 높은 정확도를 보이지만, 연구에 따르면 특정 사용 사례에 최적화되고 품질이 높은 학습 데이터를 활용한 소규모 모델도 충분히 수용 가능한 정확도를 낼 수 있는 것으로 나타났습니다¹. CAS는 70억 개의 매개변수를 사용하는 모델을 적용했으며, 이는 일부 초대형 모델(1조 개 이상의 매개변수)에 비해 상당히 작은 규모입니다. 그러나 고품질 학습 데이터 덕분에 이 소형 모델 역시 충분한 정확도를 확보할 수 있었고, 안정적인 검색 성능을 유지할 수 있었습니다.
CAS SciFinder는 가장 관련성 높은 결과를 찾기 위해 강력한 검색 알고리즘을 사용하지만, 이는 표준 쿼리 언어를 사용하지 않는 맞춤형 구조로 설계되어 있습니다. 이러한 당사 검색 아키텍처의 독점적 특성으로 인해, CAS는 AI 모델이 해당 검색이 실행되도록 시스템이 이해할 수 있는 언어를 생성할 수 있게끔 학습시켜야 했습니다. 이를 통해 AI 기반 검색 의도 해석과 독자적인 검색 엔진이 생성하는 복잡한 결과를 결합한다는 목표를 달성할 수 있었습니다. 또한 사용자가 더 적은 시간과 노력으로 관련 데이터를 확인하도록 지원할 수 있었습니다.
데이터 보안 및 개인정보 보호
CAS는 고객의 연구가 지닌 민감성을 충분히 인지하고 있으며, 데이터 기밀성을 매우 중요하게 생각합니다. CAS가 개발한 모든 모델은 독점 모델이며 온프레미스 환경에서 운영되므로, 어떠한 데이터도 CAS의 관리 범위를 벗어나지 않습니다. CAS의 인공지능 윤리적 활용에 대한 자세한 내용을 확인하려면 여기를 클릭하세요.
결론
CAS SciFinder는 고객이 소중히 여기는 신뢰를 유지하면서 과학 연구와 발견의 성공을 지원하기 위해 최선을 다하고 있습니다. CAS SciFinder에 SearchSense를 도입함으로써 CAS는 강력한 신기술을 보다 지능적인 방식으로 활용하기 위한 기반을 마련했습니다. CAS의 전문가, 최고 수준의 데이터 컬렉션, 그리고 기술은 서로 유기적으로 작동하여 사용자에게 더 많은 이점을 제공하고, 과학 연구 및 개발의 지속적인 발전을 위한 길을 열어가고 있습니다.
