工具 / PixelRAG

PixelRAG

  • rag
  • vision
  • agent

把网页渲染成截图再检索,跳过 HTML 解析直接让视觉模型读页面

UC Berkeley SkyLab 联合 Princeton、EPFL、Databricks 出品的视觉 RAG 系统。不走「HTML 解析→文本分块→向量检索」的传统管线,而是用 Playwright 把网页和 PDF 渲染成截图分块,经 LoRA 微调的 Qwen3-VL-Embedding-2B 编码为向量存入 FAISS 索引,检索时直接返回截图块给视觉语言模型阅读。附带 Claude Code 插件 pixelbrowse,让 Claude 截图页面后以视觉方式理解图表、表格和排版。托管版索引了 8.28M 篇 Wikipedia 文章,提供免费搜索 API,支持文本、图片及混合查询。论文自测在 SimpleQA 上达 78.8% 准确率(文本 RAG 基线 71.6%),agent 场景下 token 消耗约为文本检索的十分之一。

社区实测

社区关注其跳过文本解析的视觉检索思路,认为对表格和图表密集场景有优势,但固定像素分块可能切断语义单元。

  • 跳过 HTML 解析,保留表格、图表、排版等文本解析会丢失的视觉信息
  • 提供 Claude Code 插件 pixelbrowse,让编码 agent 以截图方式阅读网页
  • 固定像素高度分块(1024px)可能将表格或段落拦腰截断,缺乏语义感知的 chunking 策略
  • 论文基准为作者自测,尚未有独立第三方大规模复现

截至 2026-06-27

pip install pixelrag

← 返回工具列表