面试题 03:深入理解 Embedding:词向量的本质是什么?在 AI 应用中有哪些典型使用场景?
2026/6/12大约 4 分钟面试题面试题
一、 Embedding(词向量)的本质是什么?

1. 核心定义
Embedding(嵌入/词向量)是一种将离散的自然语言(词语、句子、文档)映射为连续的、固定维度的浮点数向量(数组)的技术。
例如,将词语映射为一个 1536 维的数组:[0.012, -0.045, 0.881, ...]。
2. 为什么需要 Embedding?(解决计算机的认知问题)
- 计算机的局限:计算机无法直接理解“苹果”和“香蕉”的含义,它只认识数字。传统的独热编码(One-Hot Encoding)虽然能把词变成数字,但无法表达词与词之间的关系(比如“苹果”和“手机”在 One-Hot 中是完全独立的)。
- 降维与语义压缩:Embedding 模型(如 Word2Vec、BERT、OpenAI text-embedding-3)通过阅读海量语料,学习到了词语的上下文关系。它将高维稀疏的文本,压缩成了低维稠密的向量。
3. 核心数学特性:距离即语义相似度
Embedding 最伟大的特性在于:在多维向量空间中,语义相近的词汇或句子,它们的几何距离越近。
- 字面不同,语义相近:“苹果手机”和“iPhone”在字面上毫无关联,但它们的向量坐标会非常接近。
- 字面相同,语义不同:“苹果手机”和“吃苹果”,虽然都有“苹果”,但因为上下文语境不同,它们在空间中的距离会很远。
- 经典的线性关系:$$。
二、 在 AI 应用中的典型使用场景
在基于 LLM 的现代 AI 应用开发中,Embedding 是不可或缺的基础设施,主要应用于以下场景:
1. 语义搜索与 RAG(检索增强生成)—— 最核心场景
- 痛点:传统基于 BM25 的倒排索引只能做“关键词匹配”(搜“寒冷”找不到“降温”)。
- 应用:企业知识库问答中,先将所有文档切块(Chunk)并 Embedding 存入向量数据库。用户提问时,将 Query 也 Embedding,计算 Query 向量与文档向量的余弦相似度(Cosine Similarity),召回距离最近的 Top-K 个文档片段喂给大模型。
2. 个性化推荐系统 (Recommendation Systems)
- 应用:将用户的历史浏览记录、搜索词转化为“用户向量(User Embedding)”,将商品描述转化为“物品向量(Item Embedding)”。在向量空间中寻找与用户向量距离最近的物品向量,实现精准的语义级推荐,解决冷启动问题。
3. 文本聚类与分类 (Clustering & Classification)
- 应用:面对海量无标签的文本(如电商评价、客服聊天记录),先将其全部转化为向量,然后使用 K-Means 等聚类算法,将空间中扎堆的向量聚为一类。这可以帮助企业快速发现“客诉热点”或实现自动打标签。
4. 异常检测 (Anomaly Detection)
- 应用:在日志分析或风控系统中,大部分正常行为的向量会聚集在一个区域,而偏离该区域极远的“孤立点向量”,往往就是异常行为或恶意攻击。
三、 面试高分避坑指南(💡 划重点)
- 必提“余弦相似度”:面试官问到向量距离怎么算,一定要回答余弦相似度(Cosine Similarity)。它通过计算两个向量夹角的余弦值来评估相似度(值越接近 1 越相似),相比于欧氏距离,它不受文本长度(向量绝对大小)的影响,是目前向量数据库的标配。
- 区分生成模型与 Embedding 模型:
- 向面试官展示你清楚两者的区别:GPT-4 / Llama 是生成模型(Decoder-only),用来输出文本;而 Text-Embedding-3 / BGE 是表征模型(通常是 Encoder-only),专职用来输出向量。在 RAG 系统中,两者是配合使用的。
- 维度与性能的权衡:
- 可以补充说明:向量维度越高(如 1536维 vs 384维),语义表达越精准,但向量数据库的存储成本和检索延迟也会成倍增加。在实际工程中,需要根据业务规模选择合适的 Embedding 模型(如目前很火的 BGE-m3 或降维技术)。