向量嵌入入门:相似度、维度与归一化

嵌入把文本变成点;检索是在问:哪些点离查询最近?度量与预处理决定「近」的含义。

现代文本嵌入模型输出高维实数向量。语义相近的句子,在向量空间中倾向于聚集——这是语义检索的几何直觉。

常用相似度

  • 余弦相似:关注方向,对向量长度不敏感;归一化后等价于内积。
  • 欧氏距离:同时受方向与模长影响;未归一化时可能被长度主导。
  • 点积:在已 L2 归一化的库中常与余弦一致,计算更省。

为何常做归一化

许多检索库默认或推荐对向量做 L2 归一化,这样可用内积索引加速,且分数可比。注意:查询向量与库内向量应使用同一套归一化约定。

维度直觉

维度升高,表达能力增强,但也更吃存储与带宽;极端情况下距离集中,最近邻区分变难(「维度诅咒」的通俗版)。实务上选模型官方推荐维度,用召回指标说话,而不是盲目追高维。

工程备忘

  • 同一语料不要混用不同嵌入模型版本。
  • 中英混合语料要确认模型的多语能力。
  • 短查询与长文档块的相似度分布可能偏移,可结合重排模型。

小结

先统一度量与归一化,再谈索引类型(HNSW、IVF 等)。几何约定一致,后续优化才有意义。