arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2606.07171 2026-06-08 cs.CV 新提交 67%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07024 2026-06-08 cs.CV 新提交 67%

GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding

GuideCAD: 基于前缀嵌入的轻量级多模态3D CAD模型生成框架

Minseong Kim, Jinyeong Park, Sungho Park, Jibum Kim

机构 * Convergence Research Center for Insect Vectors(昆虫传播载体汇聚研究中心) Incheon National University(仁川国立大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出GuideCAD框架,利用少量可训练参数通过映射网络将图像嵌入转为前缀嵌入,结合预训练大语言模型和Transformer解码器生成3D CAD模型,参数减少约4倍且训练效率提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06662 2026-06-08 cs.SE 新提交 67%

AutoPipelineAI: Context-Aware CI/CD Pipeline Generation from Natural Language

AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成

Youssef Mohamed Aboelfotoh, Mohamed Ahmed Hemdan, Mohammad El-Ramly, Khlood Hassan, Mahmoud Saleh Saad, Ahmed Mohamed Tolba, Seif Gamal Abdelmonem

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。

Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23065 2026-08-25 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交 62%

Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia

文化时刻基准:评估东南亚视频文化推理与定位

Burak Satar, Zhixin Ma, Cheng Yu-Tong, Huy Hoang Tran, Phuong Anh Nguyen, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) VNU-HCM(胡志明市国家大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出东南亚文化时刻基准CMB,通过三阶段评估视觉-语言模型的文化理解能力,发现模型跨阶段能力未完全级联,音频在非拉丁文字国家多为干扰,专家对邻国概念的识别也不及随机水平。

Comments Accepted to EMNLP 2026 Main Conference, https://culturalmoment-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22830 2026-08-25 cs.AI cs.LG 新提交 62%

Beyond the Harness: End-to-End Optimization of Context Artifacts for Enterprise Text-to-SQL

超越框架:面向企业文本转SQL的上下文构件端到端优化

Kate Gwimm, Carson Eisenach

机构 * Amazon(亚马逊公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 针对企业文本转SQL任务的上下文瓶颈,本文提出从历史查询生成可复用SQL参考卡片的端到端优化方法,在生产查询基准上取得显著优于优化检索框架的提升,在BEAVER基准上也实现了有效改进。

Journal ref COLM 2026 Workshop - Context Beyond the Window

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21430 2026-08-25 cs.AI cs.CL cs.CV cs.CY 新提交 62%

Evaluating Multimodal Narrative Understanding of Popular Hollywood Films

评估热门好莱坞电影的多模态叙事理解能力

David Bamman, Kent K. Chang, Allison Cooper, Juishan Hsu, Reina Kushihashi, Madison Mar, Arnav Podichetty, Rachael Samberg, Ipek Nil Sancak, Yuhan Shao

机构 * Bowdoin College(鲍登学院) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了符合票房受欢迎度与公有领域标准的好莱坞电影多模态数据集,建立了相关MCQ基准,发现多数视觉-语言模型表现接近随机,视听模型最高准确率61.1%,均低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21369 2026-08-25 cs.CL cs.AI 新提交 62%

Wazobia Eval: A Benchmark for Nigerian Pidgin Emotion Understanding, Sarcasm Detection, and Cultural Reasoning

Wazobia Eval:面向尼日利亚皮钦语情感理解、反讽检测与文化推理的基准测试

Stephanie Okoye

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Wazobia Eval基准测试,含550+样本与16类情感分类,用于评估尼日利亚皮钦语的情感理解、反讽检测与文化推理,填补相关基准缺失,为尼日利亚语言AI提供基础评估设施。

Comments GitHub: https://github.com/steffokoye/wazobia-eval Dataset: https://huggingface.co/WAZOBIALABS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19140 2026-08-20 cs.AI cs.CY cs.LG cs.SE 新提交 62%

Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

分组随机机:将精度而非能力作为AI系统的前沿度量标准

George Andrikopoulos

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将精度而非能力作为AI系统的前沿度量,指出当前基准测试未测量精度,定义了分组度量方法,其测量结果可指导决策,且该方法需通过实际工作测量验证规范价值。

Comments 6 pages, 3 figures. Companion to "Tuning the Stochastic Machine", submitted concurrently

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18096 2026-08-20 cs.CL cs.LG 新提交 62%

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

Zijuan Zhao, Zheren Fu, Hou Xia, Licheng Zhang, Yi Liu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15459 2026-08-18 cs.LG cs.AI 新提交 62%

Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off

并非所有注意力都平等:EEI权衡的定量综述

Aditya Singh

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。

Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: https://github.com/Nixon-H/not-all-attention-is-equal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15032 2026-08-18 cs.CL cs.AI cs.CV 新提交 62%

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

机构 * Handoff AI Research(汉德夫人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。

Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09393 2026-08-11 cs.CL cs.AI cs.IR 新提交 62%

Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

法律检索增强生成(RAG)中的时间错位:面向法国税法的版本化语料库基准

Rose Cymbler, Daniel Guez, Laurent Fabre

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律RAG的时间错位问题,构建法国税法版本化语料库基准FiscalQA Pro,发现现有模型时间推理能力差,端到端多版本检索器性能优异,还发布了相关数据集与代码。

Comments 13 pages, 1 figure, 4 tables. Accepted at the ICML 2026 Workshop on AI for Law (AI4Law), Seoul. Code and data: https://github.com/rosecymbler/fiscal-fr-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09209 2026-08-11 cs.CL cs.LG 新提交 62%

UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers

UNMASK:发现并因果验证文本分类器中的虚假捷径

Chidaksh Ravuru, Shashank Srivastava

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UNMASK自动化流程,可发现并因果验证文本分类器的虚假相关性,在MNLI、CivilComments-WILDS等数据集上提升模型性能,还可推广至奖励模型偏好数据。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 62%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07341 2026-08-10 cs.CL cs.AI 新提交 62%

Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination

零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解

Ruijie Hou, Yueyang Jiao, Zhao Wang, Yingming Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基准测试数据泄露导致的模型评估偏差问题,提出SA-PPG指标与RailCap方法,揭示现有缓解策略的恢复效果被高估,RailCap可实现更低的污染程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06975 2026-08-10 cs.CL cs.AI 新提交 62%

PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

PHASE-Tree:建模长回合角色扮演对话中的角色状态演化

Bo Tang, Jianan Yang, Junyi Zhu, Yiquan Wu, Rui Zhao, Zhengyu Yang, Yang Zhang, Feiyu Xiong, Zhiyu Li, Jiajun Shen

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)科技) KU Leuven(鲁汶大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Sinar Mas Paper (China) Investment Co., Ltd(金光纸业(中国)投资有限公司) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 针对长回合角色扮演对话的角色状态演化问题,提出多时间尺度角色状态树模型PHASE-Tree,构建基准LongEvoRoleBench并验证其在角色生成任务上的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05954 2026-08-07 cs.AI cs.CV cs.LG 新提交 62%

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

基于VLM标注数据集训练条件化电子游戏智能体

Katrin Schmid, Iuri Frosio

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对电子游戏强化学习中奖励获取、加权及稀疏性等问题,提出用VLM标注数据集,结合离线RL训练条件化智能体,并分析实验中的困难与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05493 2026-08-07 cs.PL cs.AI cs.CL cs.SE 新提交 62%

Learning Context-Free Grammars for Grammar-Constrained Decoding via Declarative Agentic Programming with Guarantees

通过带保障的声明式智能体编程学习用于语法约束解码的上下文无关文法

Kevin Cheang, Geoff Hulette, Rahul Kumar, Felipe R. Monteiro, Federico Mora, Robin Salkeld, Lin Tan, Serdar Tasiran

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出名为Autogrammar的声明式智能体,可从文档和执行数据自动学习上下文无关文法,用于语法约束解码,在三种DSLs上的实验显示其生成的文法性能优于现有基线,能显著提升端到端LM的真实任务表现。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 62%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04964 2026-08-06 cs.AI cs.LG 新提交 62%

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle:用于长时序视频世界模型的自验证强化学习

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对交互式视频世界模型的误差累积问题,提出自验证RL框架WorldCycle,利用可逆动作循环实现无标注监督,在CycleBench基准上大幅降低状态返回漂移并提升复合动作准确率。

Comments https://nevsnev.github.io/Worldcycle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28274 2026-07-31 cs.CL cs.LG 新提交 62%

MORFES: A Benchmark for Productive Inflectional Competence in Modern Greek

MORFES:现代希腊语屈折生成能力基准测试集

Ioakeim Perros, Cleopatra Papadopoulou, Ayoub Kirouane, Christos Petrocheilos

机构 * Sophea AI

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现代希腊语屈折生成能力缺乏专用基准的问题,构建了含500个条目的MORFES基准,评估多款开源模型,其中自研的Sophea-Genesis-1在屈折形态任务中表现领先。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27393 2026-07-31 cs.CL cs.AI 新提交 62%

AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes

AHA-Memes:用于理解阿拉伯语表情包中仇恨内容的细粒度多模态基准

Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Abul Hasnat, Md. Rafiul Biswas, Wajdi Zaghouani, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出首个带细粒度多标签标注的阿拉伯语仇恨表情包基准AHA-Memes,构建含5000张人工标注及6.6万张银标的数据集,对多类模型基准测试并发布资源以推动相关研究。

Comments 26 pages, 14 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26751 2026-07-30 cs.CL cs.AI eess.SP 新提交 62%

Phoneme- vs. Character-Level Targets and Selective State-Space Models for Intracortical Brain-to-Text

用于皮层下脑机文本的音素级与字符级目标及选择性状态空间模型

Lucas Zamora Vera, Jose A. Gonzalez-Lopez

机构 * Universitat Oberta de Catalunya (UOC)(加泰罗尼亚开放大学) University of Granada(格拉纳达大学) Research Centre for Information and Communication Technologies (CITIC-UGR)(信息与通信技术研究中心(CITIC-UGR))

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究在Brain-to-Text '25基准上对比GRU与混合Mamba解码器、音素级与字符级目标的脑机文本系统,发现循环基线性能最优,混合Mamba具竞争力但未超越基线。

Comments 6 pages, 1 figure, 6 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25679 2026-07-29 cs.LG cs.AI cs.MM 新提交 62%

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

DynaBridge:用于DASS结构心理健康评估的动态摘要引导跨任务多模态融合

Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对心理健康评估中通用融合模型忽略问卷标签心理测量结构的问题,提出DynaBridge框架,通过编码多模态线索并结合语义摘要进行评估,在官方验证分割上优于基线和其他方法,展现了多模态融合与心理测量结构结合的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25130 2026-07-29 cs.SE cs.AI cs.HC cs.LG 新提交 62%

Learning from 53.6K Real-World Developer Edits of AI-Generated Code

从53.6K条人工智能生成代码的真实世界开发者编辑中学习

Jenny T. Liang, Mihika Bairathi, Wayne Chi, Ameet Talwalkar, Nishant Subramani, Valerie Chen

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能生成代码的开发者编辑行为,引入DECODE数据集。通过该数据集进行数据分析及对大语言模型预测代码编辑能力的基准测试,发现多数编辑在前15分钟,且微调后开源模型表现更佳,强调以开发者为中心方法对未来AI编程助手的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 62%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23058 2026-07-28 cs.CL cs.AI 新提交 62%

ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation

ADAGE:一种用于类比推理评估的语言无关管道

Ahmed Haj Ahmed, Alvin Grissom

机构 * Haverford College(哈弗福德学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多语言推理评估依赖翻译基准的问题,提出ADAGE语言无关管道,结合母语者策划与大语言模型辅助生成构建基准,通过为多种语言构建基准并评估模型,发现文化推理差距,还发布了相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21608 2026-07-27 cs.SE cs.AI cs.CL cs.CY 新提交 62%

From Obligation to Specification: A Survey on Validating EU AI Act Requirements in RE

从义务到规范:关于在需求工程中验证欧盟人工智能法案要求的调查

T. Y. Emmy Lai, Sven Giesselbach, Matthias Koch, Héctor Allende-Cid

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究围绕欧盟人工智能法案生效后组织面临的新义务,通过混合方法探索性研究,评估组织准备及对大语言模型智能验证工具的看法,发现虽法案相关但结构化机制缺失,该工具在映射义务等方面有前景但需保障措施,还概述了闭环方法最低要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21324 2026-07-24 cs.CL cs.AI 新提交 62%

GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG

GRADRAG:用于协调多智能体RAG的跨组件提示适应

Paolo Pedinotti, Enrico Santus

机构 * Bloomberg(彭博社)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多智能体RAG系统各组件孤立优化问题,提出GRADRAG框架,通过将RAG流程建模为计算图,传播评估反馈更新上游智能体,在两种检索范式基准测试中优于单步细化基线,提升了系统性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19867 2026-07-23 cs.CL cs.AI cs.CE 新提交 62%

Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering

FinMMEval 2026任务2概述:多语言金融简答题问答

Zhuohan Xie, Xueqing Peng, Georgi Georgiev, Dimitar Dimitrov, Yuyang Dai, Rania Elbadry, Vanshikaa Jani, Lingfei Qian, Fan Zhang, Jimin Huang, Jiahui Geng, Yankai Chen, Ye Yuan, Haolun Wu, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Mingzi Song, Yu Chen, Xue Liu, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Fin AI(金融人工智能公司) FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”金融数学与信息学系) INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息技术与自动化研究所) University of Arizona(亚利桑那大学) The University of Tokyo(东京大学) Linköping University(林雪平大学) McGill University(麦吉尔大学) Mila, Quebec AI Institute(魁北克人工智能研究所) Meiji Gakuin University(明治学院大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 FinMMEval 2026任务2聚焦多语言金融简答题问答,通过特定配对和格式让系统答题,最终测试集含256个项目分两层级,依ROUGE-1 F1排名,最强系统差距小,还记录了多种相关策略。

Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏