要在通用 PostgreSQL 数据库中启用向量搜索,LangChain.js 支持使用 pgvector Postgres 扩展。
本指南提供了快速入门 PGVector 向量存储的快速概述。关于所有 PGVectorStore 功能和配置的详细文档,请前往 API 参考.
PGVectorStore 与 PGVector:应该使用哪个?
LangChain 有两个 Postgres 向量存储集成。以下是选择正确方案的方法:
| 功能 | PGVector(旧版) | PGVectorStore(现代版) |
|---|---|---|
| 包 | langchain-community | langchain-postgres (Python) / @langchain/pgvector (JS) |
| 维护 | 社区维护 | 官方合作伙伴包 |
| 连接 | 简单连接字符串 | PGEngine (更好的连接池) |
| 搜索类型 | 标准向量搜索 | 混合搜索(向量 + BM25) |
| 异步支持 | 有限 | 完全原生异步 |
| 架构 | 固定表结构 | 可自定义列和架构 |
**使用 PGVectorStore (现代版—推荐)在以下情况下:** - 启动任何新项目 - 需要混合搜索(向量 + 关键词结合) - 希望通过连接池获得更好的性能 - 正在构建异步应用程序(例如 FastAPI、异步 Node.js)
**使用 PGVector (旧版)仅在以下情况下:** - 维护已使用它的现有代码库 - 遵循尚未更新的旧教程
概述
集成详情
| 类 | 包 | PY 支持 | 下载量 | 版本 |
|---|---|---|---|---|
PGVectorStore | @langchain/pgvector | ✅ | !NPM - 下载量 | !NPM - 版本 |
设置
要使用 PGVector 向量存储,请设置一个启用了 pgvector 扩展的 Postgres 实例,然后安装 @langchain/pgvector、 pg 驱动程序和 @langchain/core.
本指南使用 OpenAI 嵌入 作为示例。您可以使用 其他支持的嵌入模型 instead.
npm install @langchain/pgvector @langchain/openai @langchain/core pg
yarn add @langchain/pgvector @langchain/openai @langchain/core pg
pnpm add @langchain/pgvector @langchain/openai @langchain/core pg
设置实例
根据您的实例设置方式,有多种方式连接 Postgres。以下是使用官方提供的预构建 Docker 镜像进行本地设置的一个示例。 pgvector team.
创建一个名为 docker-compose.yml 的文件,内容如下:
# Run this command to start the database:
# docker compose up
services:
db:
hostname: 127.0.0.1
image: pgvector/pgvector:pg16
ports:
- 5432:5432
restart: always
environment:
- POSTGRES_DB=api
- POSTGRES_USER=myuser
- POSTGRES_PASSWORD=ChangeMe
然后在同一目录下运行 docker compose up 启动容器。
您可以在以下位置找到有关如何设置 pgvector 的更多信息 官方仓库.
凭据
要连接到您的 Postgres 实例,您需要相应的凭据。有关支持选项的完整列表,请参阅 node-postgres 文档.
如果您在本指南中使用 OpenAI 嵌入,您还需要设置您的 OpenAI 密钥:
process.env.OPENAI_API_KEY = "YOUR_API_KEY";
如果您想获取模型调用的自动跟踪,您还可以设置您的 LangSmith API 密钥,方法是取消注释以下内容:
// process.env.LANGSMITH_TRACING="true"
// process.env.LANGSMITH_API_KEY="your-api-key"
实例化
要实例化向量存储,请调用 .initialize() 静态方法。这将自动检查给定表中是否存在 tableName 在传递的 config中。如果不存在,它将使用所需的列创建它。
const embeddings = new OpenAIEmbeddings({
model: "text-embedding-3-small",
});
// Sample config
const config = {
postgresConnectionOptions: {
type: "postgres",
host: "127.0.0.1",
port: 5433,
user: "myuser",
password: "ChangeMe",
database: "api",
} as PoolConfig,
tableName: "testlangchainjs",
columns: {
idColumnName: "id",
vectorColumnName: "vector",
contentColumnName: "content",
metadataColumnName: "metadata",
},
// supported distance strategies: cosine (default), innerProduct, or euclidean
distanceStrategy: "cosine" as DistanceStrategy,
};
const vectorStore = await PGVectorStore.initialize(
embeddings,
config
);
管理向量存储
向向量存储添加项目
const document1: Document = {
pageContent: "The powerhouse of the cell is the mitochondria",
metadata: { source: "https://example.com" }
};
const document2: Document = {
pageContent: "Buildings are made out of brick",
metadata: { source: "https://example.com" }
};
const document3: Document = {
pageContent: "Mitochondria are made out of lipids",
metadata: { source: "https://example.com" }
};
const document4: Document = {
pageContent: "The 2024 Olympics are in Paris",
metadata: { source: "https://example.com" }
}
const documents = [document1, document2, document3, document4];
const ids = [crypto.randomUUID(), crypto.randomUUID(), crypto.randomUUID(), crypto.randomUUID()]
await vectorStore.addDocuments(documents, { ids: ids });
从向量存储删除项目
const id4 = ids[ids.length - 1];
await vectorStore.delete({ ids: [id4] });
查询向量存储
一旦您的向量存储已创建并添加了相关文档,您很可能希望在链或代理运行时对其进行查询。
直接查询
执行简单的相似性搜索可以按如下方式进行:
const filter = { source: "https://example.com" };
const similaritySearchResults = await vectorStore.similaritySearch("biology", 2, filter);
for (const doc of similaritySearchResults) {
console.log(`* ${doc.pageContent} [${JSON.stringify(doc.metadata, null)}]`);
}
* The powerhouse of the cell is the mitochondria [{"source":"https://example.com"}]
* Mitochondria are made out of lipids [{"source":"https://example.com"}]
上述过滤器语法支持精确匹配,但也支持以下内容:
使用 in 运算符
{
"field": {
"in": ["value1", "value2"],
}
}
使用 notIn 运算符
{
"field": {
"notIn": ["value1", "value2"],
}
}
使用 arrayContains 运算符
{
"field": {
"arrayContains": ["value1", "value2"],
}
}
如果您想执行相似性搜索并接收相应的分数,您可以运行:
const similaritySearchWithScoreResults = await vectorStore.similaritySearchWithScore("biology", 2, filter)
for (const [doc, score] of similaritySearchWithScoreResults) {
console.log(`* [SIM=${score.toFixed(3)}] ${doc.pageContent} [${JSON.stringify(doc.metadata)}]`);
}
* [SIM=0.835] The powerhouse of the cell is the mitochondria [{"source":"https://example.com"}]
* [SIM=0.852] Mitochondria are made out of lipids [{"source":"https://example.com"}]
通过转换为检索器进行查询
您还可以将向量存储转换为 检索器 以便于在链中更轻松地使用。
const retriever = vectorStore.asRetriever({
// Optional filter
filter: filter,
k: 2,
});
await retriever.invoke("biology");
[
Document {
pageContent: 'The powerhouse of the cell is the mitochondria',
metadata: { source: 'https://example.com' },
id: undefined
},
Document {
pageContent: 'Mitochondria are made out of lipids',
metadata: { source: 'https://example.com' },
id: undefined
}
]
用于检索增强生成
有关如何使用此向量存储进行检索增强生成 (RAG) 的指南,请参阅以下部分:
- - 使用 LangChain 构建 RAG 应用.
- - 代理式 RAG
- - 检索文档
高级:重用连接
您可以通过创建连接池来重用连接,然后直接通过构造函数创建新的 PGVectorStore 实例。
请注意,您应该调用 .initialize() 来至少设置一次数据库,以正确设置表,然后才能使用构造函数。
const reusablePool = new pg.Pool({
host: "127.0.0.1",
port: 5433,
user: "myuser",
password: "ChangeMe",
database: "api",
});
const originalConfig = {
pool: reusablePool,
tableName: "testlangchainjs",
collectionName: "sample",
collectionTableName: "collections",
columns: {
idColumnName: "id",
vectorColumnName: "vector",
contentColumnName: "content",
metadataColumnName: "metadata",
},
};
// Set up the DB.
// Can skip this step if you've already initialized the DB.
// await PGVectorStore.initialize(new OpenAIEmbeddings(), originalConfig);
const pgvectorStore = new PGVectorStore(new OpenAIEmbeddings(), originalConfig);
await pgvectorStore.addDocuments([
{ pageContent: "what's this", metadata: { a: 2 } },
{ pageContent: "Cat drinks milk", metadata: { a: 1 } },
]);
const results = await pgvectorStore.similaritySearch("water", 1);
console.log(results);
/*
[ Document { pageContent: 'Cat drinks milk', metadata: { a: 1 } } ]
*/
const pgvectorStore2 = new PGVectorStore(new OpenAIEmbeddings(), {
pool: reusablePool,
tableName: "testlangchainjs",
collectionTableName: "collections",
collectionName: "some_other_collection",
columns: {
idColumnName: "id",
vectorColumnName: "vector",
contentColumnName: "content",
metadataColumnName: "metadata",
},
});
const results2 = await pgvectorStore2.similaritySearch("water", 1);
console.log(results2);
/*
[]
*/
await reusablePool.end();
创建 HNSW 索引
默认情况下,扩展执行顺序扫描搜索,召回率为 100%。您可以考虑创建 HNSW 索引以进行近似最近邻(ANN)搜索,从而加快 similaritySearchVectorWithScore 执行时间。若要在向量列上创建 HNSW 索引,请使用 createHnswIndex() method.
方法参数包括:
- -
dimensions:定义向量数据类型中的维度数量,最多 2000 维。例如,OpenAI 的 text-embedding-ada-002 和 Amazon 的 amazon.titan-embed-text-v1 模型使用 1536。 - -
m?:每层最大连接数(默认值为 16)。值越小,索引构建时间越短;值越大,搜索查询速度可能越快。 - -
efConstruction?:用于构建图的动态候选列表大小(默认值为 64)。较高的值可能以索引构建时间为代价提高索引质量。 - -
distanceFunction?:您想要使用的距离函数名称,会根据 distanceStrategy 自动选择。
更多信息,请参阅 Pgvector GitHub 仓库 以及 Malkov Yu A. 和 Yashunin D. A. 于 2020 年发表的 HNSW 论文《使用层次可导航小世界图进行高效稳健的近似最近邻搜索》
const hnswConfig = {
postgresConnectionOptions: {
type: "postgres",
host: "127.0.0.1",
port: 5433,
user: "myuser",
password: "ChangeMe",
database: "api",
} as PoolConfig,
tableName: "testlangchainjs",
columns: {
idColumnName: "id",
vectorColumnName: "vector",
contentColumnName: "content",
metadataColumnName: "metadata",
},
// supported distance strategies: cosine (default), innerProduct, or euclidean
distanceStrategy: "cosine" as DistanceStrategy,
};
const hnswPgVectorStore = await PGVectorStore.initialize(
new OpenAIEmbeddings(),
hnswConfig
);
// create the index
await hnswPgVectorStore.createHnswIndex({
dimensions: 1536,
efConstruction: 64,
m: 16,
});
await hnswPgVectorStore.addDocuments([
{ pageContent: "what's this", metadata: { a: 2, b: ["tag1", "tag2"] } },
{ pageContent: "Cat drinks milk", metadata: { a: 1, b: ["tag2"] } },
]);
const model = new OpenAIEmbeddings();
const query = await model.embedQuery("water");
const hnswResults = await hnswPgVectorStore.similaritySearchVectorWithScore(query, 1);
console.log(hnswResults);
await hnswPgVectorStore.end();
关闭连接
确保在完成操作后关闭连接,以避免资源过度消耗:
await vectorStore.end();
API 参考
有关所有 PGVectorStore 功能和配置的详细文档,请访问 API 参考.