arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2608.14841 2026-08-18 cs.AI 新提交 70%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交 70%

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 70%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14457 2026-08-17 cs.CL 新提交 70%

Information Satisfaction: A Reader-Centered Axis for Summarization Evaluation

信息满意度:面向读者的摘要评估轴

Isabel Cachola, William Walden, Reno Kriz, Mark Dredze

机构 * St. Edward’s University(圣爱德华大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出以读者的信息满意度作为摘要评估的面向读者的轴,发现主流摘要指标无法衡量该满意度,且与人工判断一致性差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14377 2026-08-17 cs.CL cs.CV 新提交 70%

A Survey of Large Models in Sports

体育领域的大模型综述

Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。

Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14132 2026-08-17 cs.HC cs.AI 新提交 70%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13565 2026-08-17 cs.AI 新提交 70%

Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking

基于幅值型专家掩码的混合专家模型的深度感知敏感性分析

Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过在XLCoST基准上对Qwen3.6-35B-A3B模型的逐层敏感性分析,发现MoE层敏感性具深度依赖性,提出聚焦晚期层的掩码策略,可在保留输出质量的同时减少专家数量,为MoE模型压缩提供了实证基础与实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 70%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12984 2026-08-14 cs.MA cs.CL 新提交 70%

Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research

一次对账,随时撰写:用于无漂移、时点研究的信任分层图书馆与多智能体撰写器

Xing Zhang, Yanwei Cui, Guanghui Wang, Peiyang He

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出双层智能体系统,通过信任分层图书馆与多智能体撰写器分离知识库与报告撰写,消除报告矛盾与漂移,实验验证其在多指标、多场景下的有效性与效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12895 2026-08-14 cs.AI cs.MA 新提交 70%

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

智能体行为契约II:不假设独立性的组合可靠性验证

Varun Pratap Bhardwaj, Garima Singh, Arun Pratap Bhardwaj

机构 * Qualixar

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体系统组合可靠性的独立性假设开展验证,发现组件共享模型时正相关性会高估冗余度,提出无依赖假设的有限样本验证方法并通过扩充矩函数提升验证效果,配套任意时间有效验证方法。

Comments 49 pages, 12 tables, 25 numbered definitions, 18 theorems with full proofs, six experiments, 65 references. Code, analysis scripts, and preregistration: https://github.com/qualixar/agentassert-abc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12352 2026-08-14 cs.CY cs.AI cs.HC 新提交 70%

Why AI Governance Frameworks Are Hard to Adopt: A Role-Based Stress Test of the NIST AI RMF

为何AI治理框架难以被采用:对NIST AI RMF的基于角色的压力测试

Joseph R. Simons, David A. Broniatowski

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对NIST AI RMF的基于角色的压力测试,发现AI治理框架的核心问题在于活动能否产生治理价值,角色、部署类型对治理价值有显著影响,仅当治理价值与结构适配性同时满足时才易实现风险降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 70%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12133 2026-08-13 cs.AI 新提交 70%

GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings

GUIDE:企业场景下从文档到制品生成的受控统一智能

Shivali Dalmia, Sumukha Thoppanahalli, Mohammadreza Sediqin, Abhishek Mukherji

机构 * Centific Research(森蒂菲克研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对企业指南文档手动处理效率低的问题,提出基于共享版本化规则库的多智能体框架GUIDE,在120份真实文档上实现96%成功率,大幅提升文档到制品的生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 70%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 70%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11650 2026-08-13 cs.SD cs.CL 新提交 70%

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

Confucius4-TTS:带有可学习说话人编码器的无文本跨语言零样本文本转语音系统

Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan

机构 * NetEase Youdao(网易有道)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出支持14种语言的Confucius4-TTS系统,采用两阶段架构,无需音频提示转录即可实现跨语言零样本TTS,在多项基准测试中表现优异,相关资源已公开。

Comments 12 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交 70%

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 70%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10806 2026-08-12 cs.CL 新提交 70%

Assessing Reliability of BERT-Based Models on Question Answering Tasks

评估基于BERT的模型在问答任务上的可靠性

Pooja Yadav, Priyanka Harjule, Basant Agarwal, Marko Robnik Šikonja

机构 * Malaviya National Institute of Technology(马拉维亚国家理工学院) Central University of Rajasthan(拉贾斯坦中央大学) University of Ljubljana(卢布尔雅那大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估BERT及其变体在问答任务上的可靠性,发现RoBERTa可靠性更高,ALBERT与DistilBERT存在显著不一致,验证了MCD作为可靠性指标的有效性,强调需同时评估QA模型的准确性与稳定性。

Comments Accepted for publication in the Journal of Experimental & Theoretical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10375 2026-08-12 cs.CE cs.AI 新提交 70%

Beyond Forecasting: Recasting Volatility Control as a Routing Problem

超越预测:将波动率控制重新定义为路由问题

Hongji Pu, Leyang Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出模块化框架VolRouter,将波动率控制转化为基于状态的估计器-控制器对路由问题,在四类金融场景中多数取得最优风险调整表现,证明波动率控制可视为策略选择问题。

Comments 24 pages, 6 figures, ACM ICAIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10224 2026-08-12 cs.AI 新提交 70%

Self-evolving Agentic Customer Support System at LinkedIn

领英的自进化智能体客户支持系统

Chih Hui Wang, Mengdie Tu, Qianyun Zhang, Wei Wu, Lili Zhou, Mingqi Shen, Changshuai Wei

机构 * LinkedIn(领英公司)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 领英提出一种集成检索增强生成、进化自动提示与模块化评估框架的自进化智能体客户支持系统,经测试可显著提升多项支持任务指标,为企业级自进化 AI 智能体提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 70%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交 70%

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 70%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08264 2026-08-11 cs.AI 新提交 70%

OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents

OBLIVION:面向已部署智能体的工作流级操作技能遗忘

Zhengyang Shan, Xu Qian, Jiayun Xin, Kun Li, Yue Zhang, Minghui Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体的技能撤销问题,提出OBLIVION框架,通过工作流建模、跨表面连贯擦除等技术降低技能复活风险,在基准与沙箱实验中有效减少攻击成功率与影响加权暴露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07873 2026-08-11 cs.AI 新提交 70%

Back to the Future: A workbook time machine for spread sheet creation benchmarks

回到未来:用于电子表格创建基准测试的工作簿时光机

Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出workbook time machine流水线,构建了含150个任务的电子表格创建评估基准wtmbench,揭示了查询特异性等因素对大语言模型Excel任务性能的关键影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-10 cs.AI 新提交 70%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06785 2026-08-10 cs.CL 新提交 70%

Multi-Perspective Triad Interaction Graph Neural Network for Cognitive Distortion Detection

用于认知扭曲检测的多视角三元组交互图神经网络

Jun Seo Kim, Hye Hyeon Kim

机构 * Gachon University(嘉泉大学) Yonsei University(延世大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对现有认知扭曲检测方法忽略扭曲思维心理结构的问题,提出MTI-GNN模型,在多数据集上验证其性能优于基线模型及生成模型,且各视角均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06539 2026-08-10 cs.CL 新提交 70%

Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

除非你知道自己在说什么,否则别跟我“嗯,实际上”:弱前提验证会降低通用问答性能

Shenran Wang, Vered Shwartz, Hila Gonen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Amii(阿尔伯塔机器智能研究所) CIFAR(加拿大高级研究所)

专题命中 评测与基准 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 该研究指出假前提问答(FPQA)的弱事实核查模块会降低通用问答性能,发现FPQ性能更好的方法往往在正常问题(TPQ)上表现更差,呼吁开发适配现实场景的FPQA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏