뜻: 두 벡터가 같은 방향을 얼마나 비슷하게 향하는지 보는 유사도 기준입니다. 벡터의 절대 길이보다, 두 벡터가 만드는 각도가 얼마나 작은지를 통해 가까움을 읽는 방식이라고 볼 수 있습니다. 즉 절대 크기 차이는 잠시 접어 두고, 의미 방향이 얼마나 비슷한가에 더 초점을 맞추는 비교 방식입니다.
왜 중요한가: 텍스트 임베딩 검색에서는 길이가 큰 벡터보다 방향이 비슷한 벡터가 더 중요한 경우가 많습니다. 이 개념이 있어야 왜 어떤 검색 시스템은 유클리드 거리보다 코사인 유사도를 쓰는지, 그리고 비슷한 의미를 비슷한 방향으로 해석하는 직관이 어떻게 작동하는지 이해할 수 있습니다. 또한 코사인 유사도를 이해해야 문서 길이나 벡터 크기가 조금 달라도 핵심 주제가 비슷하면 가깝게 잡히는 이유를 더 자연스럽게 해석하게 됩니다. 반대로 길이 차이 자체가 중요한 문제라면 코사인 유사도만으로는 충분하지 않을 수 있다는 경계도 함께 읽어야 합니다.
함께 볼 개념: 유사도(similarity), 거리(distance), 벡터(vector), 유사도 검색(similarity search)
뜻: 사용자가 입력한 단어나 구문이 문서 안에 직접 들어 있는지를 기준으로 후보를 찾는 검색 방식입니다. 벡터 표현의 가까움보다 문자열 일치와 용어 포함 여부를 더 직접적으로 봅니다.
왜 중요한가: 유사도 검색과 검색 기준이 다르기 때문입니다. 키워드 검색은 정확한 용어가 들어 있는 문서를 빠르게 찾는 데 유용하지만, 같은 뜻을 다른 말로 표현한 문서는 놓칠 수 있습니다. 반대로 유사도 검색은 표현이 달라도 가까운 후보를 찾을 수 있지만, 비슷해 보이는 다른 맥락을 가져올 수 있습니다. 두 방식을 구분해야 검색 결과를 정답처럼 과신하지 않고, 어떤 기준으로 후보가 뽑혔는지 읽을 수 있습니다.
함께 볼 개념: 유사도 검색(similarity search), 정보 검색(information retrieval), 검색(search), 임베딩(embedding)