向量搜索的余弦距离和内积怎么按模型选择
向量搜索选余弦距离还是内积,关键不在数据库品牌,而在 embedding 模型怎样定义“相似”。如果模型输出已经是单位向量,余弦相似度与内积会给出相同的排序,此时可优先使用实现更简单、查询更快的内积;如果向量长度本身携带置信度、热度或强度信息,就不要随意归一化,应按照模型训练目标保留内积的幅值影响。
- 归一化向量满足 cosine similarity = inner product,最近邻排序一致。
- 余弦只看方向,内积同时看方向和长度;长度有业务含义时才保留它。
- Redis 等向量库常把相似度转成 distance,数值越小越近,不能把阈值方向写反。
先确认模型输出有没有归一化
先看模型说明或实际输出的 L2 范数,而不是凭“这是文本向量”猜测。对向量 u、v,余弦相似度是 u·v / (||u|| × ||v||);内积只是 u·v。当两边的范数都等于 1 时,两者数值相等。
工程上可以在写入和查询两条路径都统一处理。下面的示例只用于理解度量边界,不要把查询向量归一化、文档向量却保持原样。
import math
def l2_normalize(values):
# 让向量长度变成 1,保留方向信息
norm = math.sqrt(sum(value * value for value in values))
if norm == 0:
raise ValueError("零向量不能用于相似度比较")
return [value / norm for value in values]
def inner_product(left, right):
# 维度相同才能逐项相乘;长度差异代表幅值影响
if len(left) != len(right):
raise ValueError("向量维度不一致")
return sum(a * b for a, b in zip(left, right))
query = l2_normalize([3.0, 4.0])
item = l2_normalize([6.0, 8.0])
print(inner_product(query, item)) # 归一化后等于 cosine similarity

余弦看方向,内积还会看长度
余弦相似度会把向量长度消掉,适合“语义方向更重要、文本长短不应改变相关性”的场景。内积则会奖励更长的向量:方向相近时,长度越大,分数可能越高。这个差异不是实现细节,而是模型输出空间的一部分。
因此,优先级应是“模型训练目标 > 数据库默认值”。模型文档明确采用 dot product 或让向量幅值代表置信度时,使用 IP;模型输出未归一化、但任务只关心语义方向时,使用 COSINE 并在同一处完成归一化。不要为了让分数看起来都在 0 到 1 之间而改度量。
| 判断条件 | 更合适的选择 | 需要留意 |
|---|---|---|
| 模型已输出单位向量 | Cosine 或 IP | 排序相同,但距离/相似度命名可能不同 |
| 只关心语义方向 | Cosine | 写入和查询的归一化策略必须一致 |
| 长度承载置信度、强度或权重 | IP | 不要事后归一化抹掉幅值 |
| 模型训练目标未说明 | 先做离线对照 | 用标注查询比较 Recall@k、MRR 或人工相关性 |

在向量库里别把 similarity 和 distance 混为一谈
不同引擎的字段名相似,返回值方向却可能相反。以 Redis 向量索引为例,COSINE 的距离可理解为 1 - cosine similarity,IP 也会按距离形式参与排序;距离越小越接近。业务层若把“相似度至少 0.8”改成数据库过滤条件,必须先确认返回的是相似度还是距离,否则会出现相关结果被过滤、无关结果反而留下的情况。
上线前至少核对四件事:模型文档的度量名称;文档与查询向量是否同维;两条路径的数据类型和归一化是否一致;离线阈值是否针对数据库实际返回值重新标定。HNSW 等近似索引还会引入召回率与延迟取舍,这属于索引参数问题,不能靠更换 cosine/IP 掩盖。
常见问题
归一化后为什么还要选 cosine?
数学上排序等价,但 cosine 的语义更直观;如果向量库对 IP 有更高效的实现,也可以选 IP。重点是固定一种分数解释并统一阈值。
内积分数越大越相似吗?
原始内积通常是越大越相似,但向量库可能把它包装成 distance。以返回字段和官方定义为准,不要只看字段名。
能不能把所有向量都先归一化?
不能盲目这样做。归一化会删除长度信息;只有确认长度不是任务信号,或模型本来就要求单位向量时才这样处理。
简单记忆就是:方向决定语义时看 cosine,幅值也代表信息时看 IP;模型已经归一化时两者排序相同,但数据库的“距离”与“相似度”仍需分开解释。
VS Code 调试配置怎么让环境变量只对当前启动生效
- 上一篇
- VS Code 调试配置怎么让环境变量只对当前启动生效
- 下一篇
- Go vendor 目录什么时候会被 go 命令自动启用
-
- 科技周边 · 人工智能 | 3小时前 |
- Hugging Face Responses API 怎么同时发送文本和图片输入
- 392浏览 收藏
-
- 科技周边 · 人工智能 | 4小时前 |
- OpenAI Responses API 如何区分 output_text 和完整输出项
- 277浏览 收藏
-
- 科技周边 · 人工智能 | 5小时前 | openai · function calling · 结构化输出 · Responses API · OpenAI JSON Schema 工具调用 Responses API Structured Outputs
- OpenAI Responses API 如何让工具调用返回结构化结果
- 274浏览 收藏
-
- 科技周边 · 人工智能 | 8小时前 | 人工智能 · 模型路由 · 容错设计 · API降级 · 模型降级 Responses API GPT-6 Astra OpenAI API 限量开放
- GPT-6 Astra API 限量开放时如何设计模型降级路径
- 192浏览 收藏
-
- 科技周边 · 人工智能 | 11小时前 | 人工智能 · Hugging Face · LoRA · 大模型微调 · LoRa 微调数据集 对话格式 chat template messages
- LoRA 微调数据集里为什么要保留一致的对话格式
- 426浏览 收藏
-
- 科技周边 · 人工智能 | 12小时前 |
- AI 评测集怎么同时记录准确率和拒答质量
- 385浏览 收藏
-
- 科技周边 · 人工智能 | 14小时前 |
- Prompt 缓存命中率下降时怎么查前缀是否稳定
- 487浏览 收藏
-
- 科技周边 · 人工智能 | 15小时前 |
- AI 输出 JSON 偶尔多出 Markdown 围栏怎么做容错解析
- 398浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 41次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 194次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 130次使用
-
- AI Prompt Library
- 探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
- 63次使用
-
- Generrated
- Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
- 44次使用
-
- AI 向量入库怎么防止维度漂移:模型切换、批量校验与回滚边界
- 2026-08-24 202浏览
-
- Embedding 模型换版本后向量维度不一致:索引重建与灰度切换怎么验收
- 2026-08-25 313浏览
-
- 向量检索为什么召回为空:embedding 维度与归一化的排查链
- 2026-08-27 410浏览
-
- Embedding 模型更换后向量维度不一致怎么办:双索引迁移、查询路由与回滚
- 2026-08-28 229浏览
-
- RAG 检索结果如何按置信度分层:上下文截断与引用保留
- 2026-08-29 325浏览
