PixelRAG 是由 UC Berkeley(Sky Computing Lab、BAIR、Berkeley NLP Group)联合开源的视觉检索增强生成系统。不解析 HTML 文本,而是将文档渲染为截图,让 AI 像人一样「看」页面来检索和回答问题。
PixelRAG核心特点
| 特点 | 说明 |
|---|---|
| 像素级索引 | 不经过 HTML→文本解析,直接索引页面截图,保留原始视觉结构 |
| 视觉信息零丢失 | 表格、图表、信息图、排版布局等不会被压平或丢弃 |
| 跨模态检索 | 支持文本查询,也支持以图片作为查询输入 |
| 预建大规模索引 | 已完成 828 万 Wikipedia 页面(约 3000 万截图瓦片)的预索引 |
| 准确率显著提升 | 在多项基准测试中,准确率比最强文本 RAG 基线高出约 18.1% |
| 成本大幅降低 | Token 消耗降低 3–10 倍,比 Google Search 便宜 2–4 倍 |
| 零门槛托管 API | api.pixelrag.ai 无需注册、无需 API Key 即可调用 |
| 全开源 | Apache-2.0 协议,代码、模型、训练数据全部公开 |
PixelRAG技术原理
PixelRAG 的完整管线分为四个阶段:
1. 渲染(Render)
使用 Playwright + Chrome DevTools Protocol (CDP) 将网页、PDF、图片等文档渲染为高分辨率截图。长页面按固定高度(如 1024px 或 8192px)切分为多个 截图瓦片(screenshot tiles),确保每个瓦片都包含完整的视觉上下文。
2. 嵌入(Embed)
使用 Qwen3-VL-Embedding-2B 作为基础视觉语言模型,通过 LoRA 微调 在截图数据上进行适配训练。微调后的模型将截图瓦片映射为 2048 维向量,使「页面截图」在向量空间中具备可检索性。查询端同样使用该模型的文本编码器,确保查询向量与文档向量处于同一语义空间。
3. 索引(Index)
使用 FAISS(IVF 倒排文件索引,16384 个中心点)构建近似最近邻索引。Wikipedia 全站索引约 217GB,CPU 上 Top-10 检索延迟约 100ms。也支持 Qdrant 作为替代后端。
4. 检索与服务(Search & Serve)
通过 FastAPI 暴露
/search 接口。查询可以是纯文本,也可以是一张图片。系统返回最相关的截图瓦片,随后由视觉语言模型(如 Claude、GPT-5V、Gemini)直接从图像像素中读取答案,无需再解析文本。PixelRAG项目地址
- 项目官网:https://pixelrag.ai/
- GitHub仓库:https://github.com/StarTrail-org/PixelRAG
PixelRAG核心功能
pixelshot:命令行工具,将任意 URL 或 PDF 渲染为截图瓦片pixelrag index build:在本地构建自定义文档集合的视觉索引pixelrag serve:启动 FastAPI 搜索服务,支持 CPU/GPU/Apple Silicon- 托管搜索 API:
api.pixelrag.ai提供 828 万 Wikipedia 页面的即搜即用 - 图片查询:上传一张截图,检索视觉上相似的页面瓦片
- Claude Code 插件(pixelbrowse):安装后 Claude 可直接截图任意网页并阅读图像内容,无需 MCP 服务器
- 训练管线:提供完整的 LoRA 微调代码和公开训练数据集,可适配其他视觉骨干模型
PixelRAG应用场景
PixelRAG 在以下场景中表现尤为突出:
- 财务报告与数据分析:保留表格、图表的原始布局,避免数据关系丢失
- 学术论文与技术白皮书:公式、图示、实验结果图均可被直接检索和阅读
- 产品手册与说明书:图文混排文档中,视觉结构本身承载关键信息
- 网页检索与 AI Agent:让 Agent 像人一样「看」网页,而非解析 HTML
- 信息图与数据可视化:直接检索图表内容,无需 OCR 或手动标注
- 幻灯片与演示文稿:保留排版和视觉层次,提升检索精度
对于纯文本、无视觉结构的文档,传统文本 RAG 可能更轻量;但一旦文档涉及表格、图表或复杂布局,PixelRAG 的视觉检索范式能显著减少信息丢失,提升回答准确率。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



