검색 엔진은 정보를 찾는 표준 도구가 되었으며, 가장 대중적인 검색 엔진의 이름은 이제 검색 행위 자체를 의미하는 대명사가 되었습니다. 하지만 검색 엔진을 통해 얻을 수 있는 방대한 정보는 과학적 개념이나 연구와 같은 구체적인 내용을 검색할 때 오히려 방해가 될 수 있습니다. 유용하고 관련성 높은 결과를 제공하면서도 새로운 정보를 놓치지 않는 것은 어려운 균형 잡기이지만, 새로운 도구와 설계 역량이 이 과정을 개선하고 있습니다.
과학 연구자들은 이러한 어려움을 잘 알고 있으며, 적절한 도구가 없으면 관련 논문이나 자료를 찾기가 더 어려울 수 있습니다. 결과가 너무 광범위하면 정말 중요한 내용을 찾을 수 없고, 너무 좁게 집중된 답변만 돌아오면 중요한 새로운 아이디어를 놓칠 수 있습니다.
과학 연구를 위한 최적의 지점을 찾는 것은 어려울 수 있지만, 다행히 불가능한 일은 아닙니다.
검색 엔진에서의 재현율(Recall)과 정확도(Precision)
과학적 검색을 이해하려면 먼저 검색 엔진의 작동 방식을 이해해야 합니다. 예를 들어 Google은 재현율을 우선시합니다. 다시 말해, 쿼리에 대해 반환될 수 있는 답변의 수를 최대화합니다. 사용자가 가능한 모든 답변을 검토해야 한다는 점은 고려하지 않으며, 기술적으로는 관련성에 따라 결과를 순위 지정하여 사용자에게 가장 가치 있는 정보가 결과 페이지 상단에 나타나도록 합니다.
반면, 다른 검색 엔진은 정확도를 우선시하여 특정 쿼리에 대해 가장 관련성 높은 답변을 최대화할 수 있습니다. 이러한 유형의 검색은 도서관의 카탈로그 검색과 유사합니다. 제목, 저자, 날짜 등 검색 사양을 위한 여러 필드가 있는 확립된 결과 세트가 존재합니다. 정확도를 최대화하면 관리 가능한 결과 세트를 얻을 확률은 높아지지만, 정확도 설정 범위에서 약간 벗어난 정보를 놓칠 가능성도 커집니다.
이 차이를 보여주는 예를 살펴보겠습니다. 사용자가 “Plasticizer 40T”라는 쿼리를 검색하면 일반적인 검색 엔진은 전체 쿼리가 고유한 상업용 물질을 나타낸다는 것을 인식하지 못합니다. 재현율을 우선시하는 검색 엔진은 “40T”가 포함되지 않은 가소제에 대한 일반적인 결과를 반환합니다. 사용자는 “40T”를 포함하도록 결과를 구체화하여 두 번째 쿼리를 수행해야 합니다.
예를 들어 CAS SciFinderⓇ와 같이 정확도에 중점을 둔 과학 전문 검색은 큐레이팅된 온톨로지 데이터를 기반으로 쿼리를 평가하여 이를 새로운 물질 개체로 인식합니다. 따라서 논문 텍스트에 해당 물질에 대한 다른 이름이 사용되더라도 특정 물질인 Plasticizer 40T에 대한 결과를 즉시 반환합니다(그림 1 참조).
올바른 검색 기능을 설계하는 것은 CAS가 수행하는 핵심 업무이며, 이것이 바로 CAS SciFinder가 과학 연구와 관련된 용어에서 새로운 물질을 쉽게 인식할 수 있는 이유입니다. 과학자들이 직접 개발한 검색 도구는 동료 연구자들이 사용하는 용어에 본질적으로 더 민감합니다. 하지만 하나의 상업용 물질을 검색하는 것은 여전히 상당히 정의된 작업입니다. 연구자가 질병, 연구 분야 또는 개념과 관련하여 관련성과 폭넓은 정보를 모두 찾고 싶을 때는 어떻게 해야 할까요?
검색 엔진의 최적 지점을 찾는 방법
정보의 폭과 깊이 사이의 균형을 맞추는 일반적인 방법은 “and”, “or” 및 기타 접속사를 사용하여 용어를 연결하는 불리언(Boolean) 검색을 활용하는 것입니다. 따옴표를 사용하여 검색어를 고정하면 쿼리를 구체화하여 더 정확한 결과를 얻는 데 도움이 될 수 있습니다.
연구자는 쿼리를 어떻게 작성하든 구조화된 데이터를 사용하고 다중 용어 텍스트 문자열을 인식하는 검색 엔진을 통해 최적의 지점을 찾을 수 있습니다. 구조화된 데이터는 일관된 형식을 가지며 특성에 따라 데이터 컬렉션으로 구성됩니다. 그러면 검색 알고리즘이 어떤 결과를 반환할지 더 효율적으로 식별하고 평가할 수 있습니다. 고유한 다중 용어 텍스트 문자열을 단일 개체로 인식하여 검색하면 용어 조각을 개별적으로 검색할 때 발생하는 관련 없는 결과를 줄일 수 있습니다.
이러한 콘텐츠 코퍼스는 어떻게 구축할까요? 세심한 큐레이션과 온톨로지를 활용하여 사용자 질의에 대한 정교한 이해를 구축함으로써 가능합니다. 예를 들어, CAS Content CollectionTM은 인간이 직접 큐레이션한 최대 규모의 과학 정보 저장소이며, 당사의 큐레이션 정책은 가장 관련성 높은 용어와 물질을 식별하여 고유한 색인 항목을 생성합니다. 큐레이션 덕분에 검색 결과는 특정 간행물의 제목이나 초록 내용에만 국한되지 않습니다.
당사의 색인에는 해당 간행물의 과학적 참신함과 관련된 과학 문헌의 실험 섹션에서 추출한 개념과 용어가 포함되어 있습니다. 예를 들어, 저널 논문의 서론에서는 저자가 관심을 두는 메타 맥락(예: 특정 질병에 대한 차세대 획기적인 치료법)을 정의할 수 있지만, 논문의 실제 참신함은 화학 공정을 평가하는 새로운 분석 방법일 수 있습니다. 큐레이션된 데이터를 사용하는 CAS SciFinder와 같은 솔루션은 메타 맥락이 아닌 분석 방법에 집중하여 사용자의 질의에 더 효과적으로 대응합니다.
온톨로지는 올바른 아이디어를 연결하여 관련성 높은 결과를 도출합니다
이러한 연결을 구축하는 방법은 동의어 관계를 포착하는 큐레이션된 용어 모음인 온톨로지를 통하는 것입니다. 이러한 관계는 활용할 수 있는 정교하면서도 광범위한 용어 목록을 제공합니다. 사용자가 상업적 명칭으로 물질을 검색하면, 당사의 온톨로지에는 화학 명칭의 변형, 기타 상업적 명칭, 심지어 특허 출원에 사용된 내부 식별자까지 포함됩니다. 이러한 연결이 없다면 일반적인 검색 엔진은 관련 결과를 식별할 수 없습니다.
이것이 바로 과학자가 과학자를 위해 만든 검색 도구가 더 효율적인 혁신을 이끌 수 있는 이유입니다. 이러한 도구는 재현율을 우선시하는 검색 엔진보다 더 관련성 높은 결과를 더 빠르게 제공할 수 있으며, 데이터는 주요 용어 간의 계층적 관계를 포착합니다.
예를 들어, CAS SciFinder와 일반 검색 엔진에서 'Sonic Hedgehog'이라는 용어를 검색하면 결과가 확연히 다릅니다. CAS SciFinder는 이를 즉시 단백질로 인식하여 관련 과학 문헌을 반환합니다(그림 3 참조). 반면 일반 검색 엔진은 과학자가 찾는 단백질 정보가 아닌, 잘 알려진 비디오 게임 캐릭터를 결과로 보여줍니다.
온톨로지를 넘어, 인간이 큐레이션한 색인은 알고리즘이 흔히 실패하는 영역에서 발견을 가능하게 합니다. 사람은 코드와 화학 구조 간의 연결을 인식하고 비인간 큐레이션 방식으로는 놓칠 수 있는 화학적 실체를 정의하는 관계를 구축할 수 있습니다. 이를 통해 분자나 화합물과 같은 다이어그램의 데이터를 캡처하고, 해당 정보를 간행물의 다른 곳에 있는 표, 그래프 또는 텍스트의 설명과 연결할 수 있습니다(그림 4 참조).
큐레이션이 없으면 일반적인 검색 엔진은 그래프와 다이어그램을 광학 문자 인식(OCR)에 의존해야 하며, 이미지 해상도가 낮기만 해도 중요한 발견을 놓칠 수 있습니다. CAS 팀이 제공하는 것과 같은 인간 큐레이션 솔루션은 인간의 전문성과 최첨단 기술의 속도 및 알고리즘적 발전을 결합하여 최고의 성과를 냅니다.
데이터 품질은 검색의 미래에 중요합니다
과학적 검색은 지역 식당 리뷰를 찾는 것과는 다르며, 학계와 상업 기관 모두 재현율과 정확도의 균형을 맞추는 솔루션으로부터 혜택을 받습니다. 모든 과학 분야에서 지식의 양이 증가함에 따라 검색 기능도 진화해야 합니다. AI 기반 도구가 표준 검색 솔루션이 됨에 따라 이는 더욱 중요해질 것입니다. 거대 언어 모델(LLM)은 적절한 데이터로 학습되지 않고 비텍스트 데이터를 처리할 신경망 계층이 없다면 과학적 검색에 어려움을 겪을 수 있습니다.
전문적인 큐레이션, 강력한 온톨로지, 비텍스트 데이터를 활용하는 능력을 갖춘 전문 솔루션은 과학적 검색과 혁신적인 발견을 지속적으로 개선하고 발전시키는 과제를 해결할 수 있습니다.




