规划

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

2026-07-29arxiv.org

提出VLD-RAG,一种Agentic视觉语言检索增强生成方法,用于处理长篇幅、视觉元素丰富的多页文档。

值得记下

让Agent自主决定何时检索、检索哪个页面、如何利用视觉信息,从而解决多页长文档中上下文断裂的问题。

阅读原文

内容来源:arxiv.org,版权归原作者所有