规划
VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
2026-07-29arxiv.org
★★★★★
提出VLD-RAG,一种Agentic视觉语言检索增强生成方法,用于处理长篇幅、视觉元素丰富的多页文档。
值得记下
阅读原文↗让Agent自主决定何时检索、检索哪个页面、如何利用视觉信息,从而解决多页长文档中上下文断裂的问题。
内容来源:arxiv.org,版权归原作者所有