PixelRAG
把网页渲染成截图再检索,跳过 HTML 解析直接让视觉模型读页面
UC Berkeley SkyLab 联合 Princeton、EPFL、Databricks 出品的视觉 RAG 系统。不走「HTML 解析→文本分块→向量检索」的传统管线,而是用 Playwright 把网页和 PDF 渲染成截图分块,经 LoRA 微调的 Qwen3-VL-Embedding-2B 编码为向量存入 FAISS 索引,检索时直接返回截图块给视觉语言模型阅读。附带 Claude Code 插件 pixelbrowse,让 Claude 截图页面后以视觉方式理解图表、表格和排版。托管版索引了 8.28M 篇 Wikipedia 文章,提供免费搜索 API,支持文本、图片及混合查询。论文自测在 SimpleQA 上达 78.8% 准确率(文本 RAG 基线 71.6%),agent 场景下 token 消耗约为文本检索的十分之一。
社区实测
社区关注其跳过文本解析的视觉检索思路,认为对表格和图表密集场景有优势,但固定像素分块可能切断语义单元。
- 跳过 HTML 解析,保留表格、图表、排版等文本解析会丢失的视觉信息
- 提供 Claude Code 插件 pixelbrowse,让编码 agent 以截图方式阅读网页
- 固定像素高度分块(1024px)可能将表格或段落拦腰截断,缺乏语义感知的 chunking 策略
- 论文基准为作者自测,尚未有独立第三方大规模复现
PixelRAG beats text parsers on accuracy and cuts AI agent token costs 10x | VentureBeatPixelRAG makes the case that web RAG should read pixels, not text | r/RuntimeWireStarTrail and UC Berkeley launch PixelRAG | Digg
截至 2026-06-27
pip install pixelrag pip install 'pixelrag[all]' uv tool install pixelrag && claude plugin marketplace add StarTrail-org/PixelRAG && claude plugin install pixelbrowse@pixelrag-plugins