PixelRAG – 开源的视觉检索增强生成系统

PixelRAG 是由 UC Berkeley(Sky Computing Lab、BAIR、Berkeley NLP Group)联合开源的视觉检索增强生成系统。不解析 HTML 文本,而是将文档渲染为截图,让 AI 像人一样「看」页面来检索和回答问题。

PixelRAG - 开源的视觉检索增强生成系统

PixelRAG核心特点

特点说明
像素级索引不经过 HTML→文本解析,直接索引页面截图,保留原始视觉结构
视觉信息零丢失表格、图表、信息图、排版布局等不会被压平或丢弃
跨模态检索支持文本查询,也支持以图片作为查询输入
预建大规模索引已完成 828 万 Wikipedia 页面(约 3000 万截图瓦片)的预索引
准确率显著提升在多项基准测试中,准确率比最强文本 RAG 基线高出约 18.1%
成本大幅降低Token 消耗降低 3–10 倍,比 Google Search 便宜 2–4 倍
零门槛托管 APIapi.pixelrag.ai 无需注册、无需 API Key 即可调用
全开源Apache-2.0 协议,代码、模型、训练数据全部公开

PixelRAG技术原理

PixelRAG 的完整管线分为四个阶段:

1. 渲染(Render)

使用 Playwright + Chrome DevTools Protocol (CDP) 将网页、PDF、图片等文档渲染为高分辨率截图。长页面按固定高度(如 1024px 或 8192px)切分为多个 截图瓦片(screenshot tiles),确保每个瓦片都包含完整的视觉上下文。

2. 嵌入(Embed)

使用 Qwen3-VL-Embedding-2B 作为基础视觉语言模型,通过 LoRA 微调 在截图数据上进行适配训练。微调后的模型将截图瓦片映射为 2048 维向量,使「页面截图」在向量空间中具备可检索性。查询端同样使用该模型的文本编码器,确保查询向量与文档向量处于同一语义空间。

3. 索引(Index)

使用 FAISS(IVF 倒排文件索引,16384 个中心点)构建近似最近邻索引。Wikipedia 全站索引约 217GB,CPU 上 Top-10 检索延迟约 100ms。也支持 Qdrant 作为替代后端。

4. 检索与服务(Search & Serve)

通过 FastAPI 暴露 /search 接口。查询可以是纯文本,也可以是一张图片。系统返回最相关的截图瓦片,随后由视觉语言模型(如 Claude、GPT-5V、Gemini)直接从图像像素中读取答案,无需再解析文本。

PixelRAG项目地址

  • 项目官网:https://pixelrag.ai/
  • GitHub仓库:https://github.com/StarTrail-org/PixelRAG

PixelRAG核心功能

  • pixelshot:命令行工具,将任意 URL 或 PDF 渲染为截图瓦片
  • pixelrag index build:在本地构建自定义文档集合的视觉索引
  • pixelrag serve:启动 FastAPI 搜索服务,支持 CPU/GPU/Apple Silicon
  • 托管搜索 APIapi.pixelrag.ai 提供 828 万 Wikipedia 页面的即搜即用
  • 图片查询:上传一张截图,检索视觉上相似的页面瓦片
  • Claude Code 插件(pixelbrowse):安装后 Claude 可直接截图任意网页并阅读图像内容,无需 MCP 服务器
  • 训练管线:提供完整的 LoRA 微调代码和公开训练数据集,可适配其他视觉骨干模型

PixelRAG应用场景

PixelRAG 在以下场景中表现尤为突出:
  • 财务报告与数据分析:保留表格、图表的原始布局,避免数据关系丢失
  • 学术论文与技术白皮书:公式、图示、实验结果图均可被直接检索和阅读
  • 产品手册与说明书:图文混排文档中,视觉结构本身承载关键信息
  • 网页检索与 AI Agent:让 Agent 像人一样「看」网页,而非解析 HTML
  • 信息图与数据可视化:直接检索图表内容,无需 OCR 或手动标注
  • 幻灯片与演示文稿:保留排版和视觉层次,提升检索精度

对于纯文本、无视觉结构的文档,传统文本 RAG 可能更轻量;但一旦文档涉及表格、图表或复杂布局,PixelRAG 的视觉检索范式能显著减少信息丢失,提升回答准确率。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...