Merge pull request #130 from svc-design/codex/replace-vector1536-with-vector1024

docs: update embedding dimension to 1024
This commit is contained in:
shenlan 2025-08-10 10:29:15 +08:00 committed by GitHub
commit 6f1e81687e
4 changed files with 6 additions and 6 deletions

View File

@ -53,7 +53,7 @@ CREATE TABLE chunks (
id SERIAL PRIMARY KEY,
doc_id TEXT,
content TEXT,
vector vector(1536),
vector vector(1024),
metadata JSONB
);
```

View File

@ -57,6 +57,6 @@ psql -h 127.0.0.1 -U shenlan -d mydb -f docs/init.sql
```bash
psql postgres://shenlan:<密码>@127.0.0.1:5432/mydb -c "\d+ documents"
```
若能看到 `embedding | vector(1536)` 字段,说明 pgvector 已成功启用。
若能看到 `embedding | vector(1024)` 字段,说明 pgvector 已成功启用。
完成以上步骤后,应用即可通过连接串 `postgres://shenlan:<密码>@127.0.0.1:5432/mydb` 使用数据库。

View File

@ -20,8 +20,8 @@
## 3. 向量化
- 默认嵌入模型:
- [bge-m3](https://github.com/BAAI-bge/): 本地部署HTTP 服务返回 1536 维向量。
- [OpenAI `text-embedding-3-large`](https://platform.openai.com/docs/guides/embeddings): 通过 OpenAI API 获取 1536 维向量。
- [bge-m3](https://github.com/BAAI-bge/): 本地部署HTTP 服务返回 1024 维向量。
- [OpenAI `text-embedding-3-large`](https://platform.openai.com/docs/guides/embeddings): 通过 OpenAI API 获取 1024 维向量。
- 统一的 `Embed(text string) ([]float32, error)` 接口屏蔽具体实现,可在配置中切换模型。
## 4. 数据库设计
@ -41,7 +41,7 @@
path TEXT NOT NULL, -- 文件路径
chunk_id INT NOT NULL,
content TEXT NOT NULL,
embedding VECTOR(1536), -- 向量
embedding VECTOR(1024), -- 向量
metadata JSONB -- 额外信息:标签/更新时间等
);

View File

@ -7,7 +7,7 @@ CREATE TABLE IF NOT EXISTS documents (
path TEXT NOT NULL,
chunk_id INT NOT NULL,
content TEXT NOT NULL,
embedding VECTOR(1536),
embedding VECTOR(1024),
metadata JSONB
);