arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2608.00009 2026-08-04 cs.CL cs.AI 新提交 62%

AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents

AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准

Ahmed Cherif

机构 * Sofrecom(索弗雷科姆)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。

Comments 22 pages, 3 figures submitted on Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24802 2026-07-31 cs.IR cs.CL 版本更新 62%

SourceMinds at CheckThat! 2026: NLI-Grounded Citation Auditing in a Multi-Agent Pipeline for Full Fact-Checking Article Generation

SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成

Farhan Sharukh Hasan, Anirban Saha Anik, Eric Liu, Xiaoying Song, Mohotarema Rashid, Lingzi Hong

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07314 2026-07-30 cs.CL cs.AI 版本更新 62%

MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications

MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估

Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan

机构 * M42

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24651 2026-07-28 cs.CV cs.CL cs.IR 新提交 62%

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

无坐标或区域标签的视觉文档理解中的证据归因

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21274 2026-07-24 cs.CL cs.AI 新提交 62%

A Comparative Evaluation of Embeddings and LLMs in a Greek Book Publisher Setting - The CUP Dataset

希腊图书出版商环境中嵌入模型和大语言模型的比较评估 - CUP数据集

Katerina Papantoniou, Panagiotis Papadakos, Theodore Patkos, Dimitris Garefalakis, Nikos Vardakis, Dimitris Plexousakis

机构 * ICS-FORTH(希腊计算机科学与技术研究所) Crete University Press(克里特大学出版社)

专题命中 RAG评测 :hybrid retrieval(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出希腊图书检索基准CUP数据集,评估稀疏、密集、混合及大语言模型辅助的检索方法,发现多语言嵌入优于希腊特定模型,混合检索最佳,还分析了不同方法在各类查询中的表现及大语言模型相关技术的效果。

Comments Preprint of a manuscript submitted to the 14th EETN Conference on Artificial Intelligence (SETN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20431 2026-07-24 cs.CL cs.IR 新提交 62%

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

用于证据感知材料文献分析的技能收缩代理

Bixuan Li, Yu Liu, Shuo Shi, Xiaoya Huang, Peng Kang, Lei Zheng

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17288 2026-07-21 cs.DB cs.AI 新提交 62%

SAGA: Synthetic Agentic Graph Architecture for Temporal Benchmark Generation

SAGA:用于时间基准生成的合成智能体图架构

Jiacheng Ding, Xiaofei Zhang

机构 * University of Memphis(密苏里大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI、cs.DB

AI总结 针对时间图基准稀缺问题,SAGA系统通过四阶段管道生成大规模语义丰富的时间图,其架构解耦结构与语义,能实现结构真实性、语义丰富性和自动异常标注,在单个H100 GPU上高效生成大量带受控异常的时间边。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 62%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 RAG评测 :RAG(abstract_cn);分类 cs.AI、cs.DB

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00761 2026-07-17 cs.AI cs.CL 版本更新 62%

L-MARS: Legal Multi-Agent System with Agentic Search and Citation-Faithfulness Audit

L-MARS:具有协调推理和代理搜索的法律多智能体工作流

Boqin Yuan, Ziqi Wang

机构 * University of Southern California(南加州大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。

Comments Accepted at the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05456 2026-07-08 cs.AI cs.CL q-bio.QM 新提交 62%

Prompt-to-Paper: Agentic AI System for Bioinformatics

从提示到论文:用于生物信息学的智能AI系统

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28510 2026-06-09 cs.SE cs.AI cs.IR 版本更新 62%

Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets

高效可扩展的LLM生成代码片段溯源追踪

Andrea Gurioli, Davide D'Ascenzo, Federico Pennino, Maurizio Gabbrielli, Stefano Zacchiroli

机构 * University of Bologna(博洛尼亚大学)

专题命中 RAG评测 :vector search(abstract);分类 cs.IR、cs.AI

AI总结 提出混合两阶段溯源追踪流水线HYBRIDSOURCETRACKER,结合向量搜索与指纹匹配,实现LLM生成代码的高效、可扩展溯源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04704 2026-05-29 cond-mat.mtrl-sci cs.AI cs.CL 62%

AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials

AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准

Taoyuze Lv, Alexander Chen, Fengyu Xie, Chu Wu, Jeffrey Meng, Dongzhan Zhou, Yingheng Wang, Bram Hoex, Zhicheng Zhong, Tong Xie

机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Cornell University(康奈尔大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19341 2026-05-20 cs.CL cs.AI cs.LG stat.ML 62%

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

HalluWorld: 一个用于通过参考世界模型控制幻觉的基准

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) Patronus AI Independent Researcher(独立研究者) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) DegenAI Labs(DegenAI实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。

Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13295 2026-05-14 cs.CL cs.AI cs.MA 62%

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE:通过对比信用分配优化代理系统

Tom Zehle

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute(埃里克·林斯研究所) Tübingen(图宾根)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 62%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20869 2026-04-24 cs.CY cs.AI cs.HC cs.IR cs.LG 62%

Clinical Reasoning AI for Oncology Treatment Planning: A Multi-Specialty Case-Based Evaluation

肿瘤治疗规划的临床推理AI:多专科基于病例的评估

Philippe E. Spiess, Md Muntasir Zitu, Alison Walker, Daniel A. Anaya, Robert M. Wenham, Michael Vogelbaum, Daniel Grass, Ali-Musa Jaffer, Amod Sarnaik, Caitlin McMullen, Christine Sam, John V. Kiluk, Tianshi Liu, Tiago Biachi, Julio Powsang, Jing-Yi Chern, Roger Li, Seth Felder, Samuel Reynolds, Michael Shafique, Alison Sheehan, Ashley Layman, Cydney A. Warfield, Derrick Legoas, Jaclyn Parrinello, Jena Schmitz, Kevin Eaton, Mark Honor, Luis Felipe, Issam ElNaqa, Elier Delgado, Talia Berler, Rachael V. Phillips, Frantz Francisque, Carlos Garcia Fernandez, Gilmer Valdes

机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) Innova Montréal Inc.(蒙特利尔创新公司) Oncobrain, Inc.(Oncobrain公司) Advanced Cancer Treatment Centers(先进癌症治疗中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20182 2026-04-22 cs.CL cs.AI 62%

FaithLens: Detecting and Explaining Faithfulness Hallucination

FaithLens:检测并解释忠实性幻觉

Shuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FaithLens模型,通过合成训练数据和规则强化学习,有效检测并解释大语言模型中的忠实性幻觉,优于GPT-5.2和o3模型,提升可信度与效率。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 62%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11563 2026-04-14 cs.CL cs.AI cs.LG 62%

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

Synthius-Mem: 基于大脑启发的hallucination抵抗性人格记忆实现94.4%的记忆准确率和99.6%的对抗鲁棒性于LoCoMo

Artem Gadzhiev, Andrew Kislov

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 Synthius-Mem通过结构化人格记忆系统在LoCoMo基准上实现94.4%的记忆准确率和99.6%的对抗鲁棒性,优于现有系统并超越人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18019 2026-04-10 cs.CL cs.AI cs.SE 62%

BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity

BenchBrowser:用于评估基准有效性证据的检索

Harshita Diddee, Gregory Yauney, Swabha Swayamdipta, Daphne Ippolito

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系)

专题命中 RAG评测 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 BenchBrowser通过检索20个基准测试集中的相关评估项目,帮助评估者诊断基准测试在内容有效性与收敛有效性上的不足,从而弥补实践者意图与实际测试内容之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05424 2026-04-08 cs.AI cs.CL 62%

PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection

PRISM-MCTS: 通过元认知反思学习推理轨迹

Siyuan Cheng, Bozhong Tian, YanChao Hao, Zheng Wei

机构 * Tencent PCG(腾讯PCG)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 PRISM-MCTS通过整合过程奖励模型和动态共享内存,有效捕捉启发式与谬误,提升推理效率,减少轨迹需求,在多个推理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21329 2026-03-24 cs.IR cs.AI 62%

COINBench: Moving Beyond Individual Perspectives to Collective Intent Understanding

COINBench: 超越个体视角到集体意图理解

Xiaozhe Li, Tianyi Lyu, Siyi Yang, Yizhao Yang, Yuxi Gong, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI研究院)

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.AI

AI总结 COINBench通过动态实时更新的基准测试,评估大语言模型在消费者领域集体意图理解能力,揭示当前模型在复杂意图合成分析深度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI 62%

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17386 2026-03-19 cs.IR cs.CL 62%

PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval

PJB:用于人-职位检索的推理感知基准

Guangzhi Wang, Xiaohui Yang, Kai Li, Jiawen He, Kai Yang, Ruixuan Zhang, Zhi Liu

机构 * CareerInternational Research Team(CareerInternational研究团队)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 PJB基准通过引入领域家族和推理类型标签,揭示人-职位检索系统在不同行业中的性能差异,指出模块升级和重排序对性能的影响不同,强调其在招聘检索系统中的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11578 2026-03-17 cs.CL cs.AI 62%

Multi-Agent LLMs for Generating Research Limitations

多智能体大语言模型用于生成研究局限性

Ibrahim Al Azher, Zhishuai Guo, Hamed Alhoori

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多智能体框架生成研究局限性,结合OpenReview评论和作者声明,利用引用论文捕捉上下文缺陷,通过不同角色智能体系统识别显性、隐性、同行评审和文献相关局限性,提升局限性描述的准确性。

Comments 18 Pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04454 2026-03-06 cs.CL cs.AI 62%

Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam

通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍

Michael Majurski, Cynthia Matuszek

机构 * National Institute of Standards and Technology(国家标准与技术研究院) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12843 2026-03-04 cs.CL cs.AI 62%

NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

NutriBench:一个用于评估大语言模型从餐食描述中估算营养的基准数据集

Andong Hua, Mehak Preet Dhaliwal, Laya Pullela, Ryan Burke, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 NutriBench通过评估大语言模型在餐食描述中估算营养的能力,为营养估算提供了新的研究方向和应用可能性。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03693 2026-02-04 cs.CL cs.AI 62%

OCRTurk: A Comprehensive OCR Benchmark for Turkish

OCRTurk:土耳其的综合OCR基准

Deniz Yılmaz, Evren Ayberk Munis, Çağrı Toraman, Süha Kağan Köse, Burak Aktaş, Mehmet Can Baytekin, Bilge Kaan Görür

机构 * Middle East Technical University, Computer Engineering Department(中东部技术大学,计算机工程系) Politecnico di Torino(托里诺理工大学) Roketsan Inc.(罗克特兰公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 OCRTurk是一个针对土耳其语文档解析的综合基准测试,通过多难度级别和多种文档类型评估七种OCR模型,发现PaddleOCR在多数指标上表现最佳,但幻灯片文档对模型构成挑战。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01885 2026-02-03 cs.CL cs.AI 62%

ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support

ES-MemEval:在个性化长期情感支持中评估对话代理的基准测试

Tiantian Chen, Jiaqi Lu, Ying Shen, Lin Zhang

机构 * Tongji University(同济大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 ES-MemEval通过评估长期情感支持中的记忆能力,揭示了显式长期记忆对减少幻觉和提升个性化的重要性,同时指出了检索增强模型在时间动态方面的局限性。

Comments 12 pages, 7 figures. Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 62%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏