新闻详情

新闻详情

首页 / 资讯中心 / 详情

Qwen-Agent:3行代码跑通千份文档的批量问答

发布时间:2026/9/15 0:13:44来源:尧图网络
Qwen-Agent:3行代码跑通千份文档的批量问答
Qwen-Agent3行代码跑通千份文档的批量问答【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-AgentQwen-Agent 的 ParallelDocQA 支持对成百上千份 PDF、Word、PPT 做并行文档问答并行解析、过滤无效结果再用 RAG 召回原文汇总作答。适合需要从大量文档中一次性提取信息的研究者和数据分析人员。核心能力速览批量文档输入支持 PDF、Word、PPT、TXT、HTML、CSV、Excel 共 9 类文件并行分块问答每个文件被拆成块每块作为一个任务并行调用模型文档再多也不用整体塞进上下文无效响应过滤答不出的块会被识别为none并剔除不污染最终答案RAG 二次召回根据中间答案回到原文检索相关内容再交给摘要 Agent 生成最终回答双入口代码 API 和 Web 图形界面都能用它是怎么工作的并行文档问答流程整套流程分五步串起来就是一条分块 → 并行 → 过滤 → 召回 → 摘要的流水线。先说怎么做的。文件先经DocParser解析并切块三个关键常量定义在qwen_agent/agents/doc_qa/parallel_doc_qa.py顶部PARALLEL_CHUNK_SIZE 1000 # 并行分块大小 MAX_RAG_TOKEN_SIZE 4500 # RAG召回最大token数 RAG_CHUNK_SIZE 300 # 检索块大小每个块生成一个成员任务由qwen_agent/utils/parallel_executor.py里的parallel_exec提交到线程池执行调用间隔带 0.5 秒以内的随机延迟避免请求同时打到模型服务。每个成员只回答自己那块内容答不出来就返回{res: none}被过滤掉。再看效果如何。拿到所有有效中间答案后系统把用户问题加中间答案交给关键词生成器再用关键词检索回原文上限 4500 token最后由摘要 Agent 基于召回的原文产出最终答案。README 中提到这套方案在涉及 100 万 token 上下文的单针查询压力测试中表现完美据项目文档描述它在两个基准上超越了原生长上下文模型。跑通最小示例先装包需要 rag 和 gui 扩展pip install -U qwen-agent[rag,gui]最小可运行代码如下file字段换成你本地的文档路径即可from qwen_agent.agents.doc_qa import ParallelDocQA bot ParallelDocQA(llm{model: qwen2.5-72b-instruct}) messages [{ role: user, content: [ {text: 介绍实验方法}, {file: papers/attention.pdf}, ] }] for rsp in bot.run(messages): print(回答:, rsp)这段代码做的事情很直白创建一个并行文档问答 Agent把介绍实验方法这个问题和一份 PDF 一起交给它然后逐条打印流式返回的答案。运行前记得设置环境变量DASHSCOPE_API_KEY否则无法调用模型。不想写代码的话示例examples/parallel_doc_qa.py自带app_gui()直接运行该文件就能打开 Web 界面上传文件、输入问题即可。跑通之后你可以把file换成多个文件或目录下的文件问题从单点提取改成对比所有文档的 XXAgent 会自动完成分块和汇总。调这3个参数效果不同对结果影响最大的是分块和召回相关的三个常量都在qwen_agent/agents/doc_qa/parallel_doc_qa.py顶部改起来是几行的事参数默认值调整建议适用场景PARALLEL_CHUNK_SIZE1000块太小导致单块信息不完整时调大论文、报告等长文档MAX_RAG_TOKEN_SIZE4500召回内容不够全面时调大需要跨章节总结的问题RAG_CHUNK_SIZE300需要更大检索上下文时调大技术文档的细粒度定位稳定性方面不用操心MAX_NO_RESPONSE_RETRY默认为 4当所有并行块都回答无法回答时会自动整体重试最多 4 轮。网络不稳或模型偶发无响应时这个机制会自动兜底。谁在用、用来干嘛刚做完文献调研的研究生手里有 100 多篇论文的 PDF需要统一提取实验设置和超参数。把文件批量交给 ParallelDocQA 提问一次拿到汇总后的答案不用再逐篇翻。据 README 描述这类超长文档问答方案在基准测试中优于原生长上下文模型且更省资源。运营分析师面对成堆的用户反馈 PDF、Excel 时也可以按类别提问让 Agent 统一归类汇总。没有现成数据的场景实际体验以是否省去人工翻查为准定性上就是省时间。收束ParallelDocQA 把海量文档拆成批量分块任务再靠 RAG 把答案拉回原文回答可聚合、可追溯。文档qwen-agent-docs/website/content/en/guide/core_moduls/agent.md示例examples/parallel_doc_qa.py核心实现qwen_agent/agents/doc_qa/parallel_doc_qa.py【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Matlab迁移学习实战:预训练模型替换与小样本分类全流程 2026/9/15 18:44:24

Matlab迁移学习实战:预训练模型替换与小样本分类全流程

简介:本资源是一份面向本科及硕士阶段科研学习者的迁移学习分类识别实践案例,基于MATLAB平台实现,适用于智能算法、图像识别与模式分类等方向的教学与项目复现。压缩包共11个文件,含9个核心MATLAB函数(.m)用…

阅读更多 →
K8s中Java OOM定位与治理:从容器内存限制到JVM参数调优 2026/9/15 18:44:24

K8s中Java OOM定位与治理:从容器内存限制到JVM参数调优

1. 为什么K8s里的Java OOM比单机环境更难抓?——从现象到本质的差异你有没有遇到过这样的场景:本地IDE里跑得好好的Java服务,一上K8s集群就隔三差五OOM Killed,Pod直接被Terminated,日志里只留下一行冰冷的Exit Code: …

阅读更多 →
SAP核心模块表清单与跨模块数据流关系详解 2026/9/15 18:44:24

SAP核心模块表清单与跨模块数据流关系详解

干SAP这一行,不管是做FICO顾问、MM顾问还是ABAP开发,迟早会遇到一个灵魂拷问:这笔业务数据到底存在哪张表里?或者说,这张报表的数据是怎么来的,为什么和另一张报表对不上?答案几乎都指向同一个东…

阅读更多 →
Spring框架核心原理:IoC、AOP与事务管理详解 2026/9/15 18:44:24

Spring框架核心原理:IoC、AOP与事务管理详解

1. Spring框架概述与核心设计思想Spring框架作为Java企业级应用开发的事实标准,已经走过了近20年的发展历程。最初由Rod Johnson在2002年出版的《Expert One-on-One J2EE Design and Development》中提出概念原型,随后在2003年2月首次发布0.9版本。经过多…

阅读更多 →
Spring Boot构建宠物医院管理系统实战指南 2026/9/15 18:44:24

Spring Boot构建宠物医院管理系统实战指南

简介:本资源是一套基于SpringBoot开发的宠物医院管理系统完整项目,面向计算机专业本科生毕业设计、Java初学者及中小型宠物医疗机构的技术人员,旨在解决宠物诊疗服务数字化管理难题,覆盖用户注册登录、医生排班、宠物档案、预约挂…

阅读更多 →
Cesium地形开挖组件化:基于GPU裁剪的Vue实现与性能优化 2026/9/15 18:41:24

Cesium地形开挖组件化:基于GPU裁剪的Vue实现与性能优化

简介:基于Cesium与VUE封装的地形开挖功能组件,专为三维GIS项目中需要实现地形裁剪、开挖可视化的WebGIS开发者准备。资源包含完整可运行的demo与未加密源码,可直接集成或二次修改,适合具备VUE和Cesium基础的前端工程师。包内共6个…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞