콘텐츠로 이동

10 kieuk

SVM 커널(kernel)

  • 뜻: 두 입력을 받아 더 풍부한 표현 공간에서 얼마나 비슷하거나 가깝게 읽히는지 계산하는 핵심 함수입니다. 경계 기반 분류 문맥에서는 새 특징을 모두 직접 만들지 않고도, 새 표현 공간에서 비교하는 효과를 원래 공간의 계산으로 우회해 쓰는 발상으로 읽습니다.
  • 왜 중요한가: 선형 경계가 원래 좌표 공간에서 답답할 때, 문제는 경계가 아니라 표현 공간일 수 있습니다. 커널을 이해하면 더 복잡한 선을 그린다보다 데이터를 읽는 공간을 바꾼다는 관점으로 비선형 구조를 설명할 수 있습니다.
  • 함께 볼 개념: 표현(representation), 거리(distance), 결정 경계(decision boundary), 차원 축소(dimensionality reduction)
  • 중심 Section: P4-13.2
  • 등장 Section: P4-13.2

k-means

  • 뜻: k-means는 데이터 포인트를 미리 정한 개수의 군집으로 나누고, 각 군집의 중심점과 점 사이의 거리를 반복해서 줄이는 대표적인 중심 기반 군집화 방법입니다.
  • 왜 중요한가: k-means는 비지도학습에서 라벨 없이 비슷한 것끼리 묶는다는 직관을 가장 단순하게 보여 줍니다. 동시에 군집 수를 먼저 정해야 하고, 거리와 중심점 가정에 민감하므로 군집 결과를 그대로 정답처럼 읽으면 안 됩니다.
  • 함께 볼 개념: 군집화(clustering), 군집(cluster), 중심점(centroid), 거리(distance)
  • 중심 Section: P4-17.1
  • 등장 Section: P4-17.3

코사인 유사도(cosine similarity)

  • 뜻: 두 벡터가 같은 방향을 얼마나 비슷하게 향하는지 보는 유사도 기준입니다. 벡터의 절대 길이보다, 두 벡터가 만드는 각도가 얼마나 작은지를 통해 가까움을 읽는 방식이라고 볼 수 있습니다. 즉 절대 크기 차이는 잠시 접어 두고, 의미 방향이 얼마나 비슷한가에 더 초점을 맞추는 비교 방식입니다.
  • 왜 중요한가: 텍스트 임베딩 검색에서는 길이가 큰 벡터보다 방향이 비슷한 벡터가 더 중요한 경우가 많습니다. 이 개념이 있어야 왜 어떤 검색 시스템은 유클리드 거리보다 코사인 유사도를 쓰는지, 그리고 비슷한 의미비슷한 방향으로 해석하는 직관이 어떻게 작동하는지 이해할 수 있습니다. 또한 코사인 유사도를 이해해야 문서 길이나 벡터 크기가 조금 달라도 핵심 주제가 비슷하면 가깝게 잡히는 이유를 더 자연스럽게 해석하게 됩니다. 반대로 길이 차이 자체가 중요한 문제라면 코사인 유사도만으로는 충분하지 않을 수 있다는 경계도 함께 읽어야 합니다.
  • 함께 볼 개념: 유사도(similarity), 거리(distance), 벡터(vector), 유사도 검색(similarity search)
  • 중심 Section: P2-3.4
  • 등장 Section: P1-13.1, P1-13.2, P2-3.2

  • 뜻: 사용자가 입력한 단어나 구문이 문서 안에 직접 들어 있는지를 기준으로 후보를 찾는 검색 방식입니다. 벡터 표현의 가까움보다 문자열 일치와 용어 포함 여부를 더 직접적으로 봅니다.
  • 왜 중요한가: 유사도 검색과 검색 기준이 다르기 때문입니다. 키워드 검색은 정확한 용어가 들어 있는 문서를 빠르게 찾는 데 유용하지만, 같은 뜻을 다른 말로 표현한 문서는 놓칠 수 있습니다. 반대로 유사도 검색은 표현이 달라도 가까운 후보를 찾을 수 있지만, 비슷해 보이는 다른 맥락을 가져올 수 있습니다. 두 방식을 구분해야 검색 결과를 정답처럼 과신하지 않고, 어떤 기준으로 후보가 뽑혔는지 읽을 수 있습니다.
  • 함께 볼 개념: 유사도 검색(similarity search), 정보 검색(information retrieval), 검색(search), 임베딩(embedding)
  • 중심 Section: P1-13.2
  • 등장 Section: