arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2606.26518 2026-06-26 cs.AI 新提交 70%

NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications

NeuraDock 视觉认知负荷代理教程:面向 Alpha 动态与实时应用的质量门控开源 EEG 工作流

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉元智能科技有限公司(NeuraDock))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出 NeuraDock Agent 开源 EEG 代理,通过质量门控工作流实现 Alpha 动态分析和视觉认知负荷实时应用,弥合离线与在线分析差距。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 70%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26036 2026-06-25 cs.CL cs.CR 新提交 70%

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

检测、遗忘、恢复:防御文本摘要模型免受数据投毒

Poojitha Thota, Shirin Nilizadeh

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出统一的后验防御框架,通过影响函数分析或行为审计检测微调阶段的数据投毒,并利用梯度上升遗忘恢复模型性能,在多种攻击下实现85-92%检测精度和96%行为恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 70%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25645 2026-06-25 cs.CR cs.AI 新提交 70%

Taxonomy of Risks on Automated Fact-Checking Systems Considering its Propagation

自动事实核查系统风险及其传播的分类

Jun Yajima, Tatsuya Oka, Takao Okubo

机构 * Fujitsu Limited(富士通有限公司) Institute of Information Security(信息安全研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对自动事实核查系统在传播中可能产生的风险,提出三阶段风险传播分类法,识别出32种具体风险,并用于评估DEFAME系统,发现能识别传统方法遗漏的风险。

Comments 15 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25396 2026-06-25 cs.AI 新提交 70%

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

长期模拟揭示AI伴侣的认知发展风险

Kaicheng Shen, Lingyu Li, Wen Wu, Yan Teng, Liang He, Yingchun Wang

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TSJ框架,通过角色驱动用户模拟、动态心理状态更新和回顾性评估,在12,960模拟人天交互中揭示短期测试低估长期认知发展风险,并识别出幼儿期和成年初期为最脆弱阶段。

Comments 19 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 70%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 70%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24714 2026-06-24 cs.CL cs.SD eess.AS 新提交 70%

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

CN-NewsTTS Bench:面向原始输入中文新闻TTS发音的目标级自动基准

Shijun Luo

机构 * NetEase Cloud Music(网易云音乐)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对中文新闻TTS对密集书面形式(如分数、连字符型号等)发音不准的问题,提出CN-NewsTTS Bench v0.1基准,包含自动评估集和评分器,测试七个商业系统,最佳准确率0.879。

Comments 5 pages, 1 figure, 8 tables. ICASSP-style preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24387 2026-06-24 cs.CL 新提交 70%

AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

AutoSpecNER: 用于车辆规格提取的细粒度命名实体识别数据集

Jordan Lee, Filippos Ventirozos, Abdirahman Abdullahm, Ioanna Nteka, Peter Appleby, Matthew Shardlow

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学系) Autotrader Research Group, Autotrader UK(英国Autotrader研究组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AutoSpecNER数据集,包含659条汽车广告和15类超过1万个实体,基于DeBERTa的模型达到90%微平均F1分数,优于规则方法和大型语言模型。

Comments 13 pages, 2 figures, 7 tables, Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24066 2026-06-24 cs.SD cs.CL eess.AS 新提交 70%

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho, Phuong Tuan Dat, Thi Thu Trang Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。

Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23877 2026-06-24 cs.SE cs.AI 新提交 70%

JupOtter: Cell-Level Bug Detection in Jupyter Notebooks

JupOtter: Jupyter Notebooks中的单元级错误检测

Lukas Ottenhof, Thibaud Lutellier

机构 * University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JupOtter系统,通过保留单元结构的标记化策略和单元级错误预测技术,在三个评估数据集中的两个上超越静态分析器和大型语言模型,实现高F1分数的单元级错误检测。

Comments Accepted at the 42nd International Conference on Software Maintenance and Evolution - ICSME 2026 (Research Papers Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23633 2026-06-23 cs.AI econ.GN q-fin.EC 新提交 70%

AI Exposure Scores: what they measure, what they miss, and what comes next

AI暴露分数:它们衡量什么、遗漏什么以及下一步是什么

Campbell Lund, Thomas Euyang, Zanele Munyikwa, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以2023年GPTs暴露分数为案例,分析静态暴露分数在政策分析中的结构性局限,并综述五种应对方法,强调需弥合研究-政策差距。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23403 2026-06-23 cs.AI 新提交 70%

Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

Litmus: 零标注、代码驱动的AI系统评估指标规范

Prajjwal Gupta, Prasang Gupta, Vishal Bhutani, Apoorva Sharma, Sumanth Chundru, Waqar Sarguroh, Kevin Paul

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Litmus系统,通过分析源代码自动生成评估指标,无需人工标注,在三个真实AI流水线上优于基线方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21930 2026-06-23 cs.CL 新提交 70%

MindTailor: Personalized Emotional Support via Post History-Grounded Case Formulation and Collaborative Refinement

MindTailor: 通过历史帖子基于案例构建和协作精炼的个性化情感支持

Suhyun Han, Kyunghyun Cho, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MindTailor框架,利用求助者历史帖子构建案例,并通过基于不同咨询策略的协作批评迭代精炼回复,在Reddit数据集上优于基线,提升共情和个性化。

Comments 45 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21657 2026-06-23 cs.CV cs.CL 新提交 70%

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition

Chehre: 一个用于感知多样面部表情识别的表情符号提示视频数据集

Bita Azari, Zoe Stanley, Avneet Batra, Poorvi Bhatia, Hali Kil, Manolis Savva, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出Chehre数据集,通过表情符号提示收集动态面部表情视频,并转移至合成人脸以保护隐私,定义主导和分布表情识别任务,基准测试显示现有模型表现有限。

Comments 16 pages, 8 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21618 2026-06-23 cs.CL 新提交 70%

CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

CulMind:中国文化遗产中的多模态理解与推理基准

Zhangwei Cao, Shuhan Fan, Yuting Wei, Jiajun Zhang, Yihang Peng, Qi Meng, Yangfu Zhu, Liangbin Yang

机构 * University of International Relations(国际关系学院) Kedge Business School(凯致商学院) Peking University(北京大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Capital Normal University(首都师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21222 2026-06-23 cs.RO cs.AI 新提交 70%

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20608 2026-06-23 cs.CY cs.AI cs.CV 新提交 70%

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora

CourseBlueprint:基于课程语料库的自适应教学视频生成的结构化流程

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(计算机科学系,拉特格斯理工学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,拉特格斯理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CourseBlueprint流程,通过结构化教学蓝图(含先决条件图、自适应控制、参与合约)从课程语料库生成自适应教学视频,实验证明显式教学合约比表面流畅性更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20512 2026-06-23 cs.SE cs.LG 新提交 70%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 70%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20527 2026-06-19 cs.CL cs.CV 新提交 70%

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

StylisticBias: 少数人类视觉线索驱动多模态大语言模型中的大部分社会偏见

Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Princeton Center for Information and Technology Policy(普林斯顿信息与技术政策中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出StylisticBias基准,通过控制单一视觉属性变化,发现年龄和体型主导身份层面偏见,而时尚风格等约15个属性解释近80%的偏见变化,偏见集中于少数视觉线索。

Comments Accepted to the non-archival workshops AI4Good and Culture x AI at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19965 2026-06-19 cs.CV cs.AI 新提交 70%

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

ROSE:多模态模型中感知到行动差距的基准测试

Yihao Wang, Zijian He, Jie Ren, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shaanxi Normal University(陕西师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ROSE基准,通过固定视觉场景并变化区域约束与符号输出,测试多模态大模型在不同上下文中将相同视觉证据转化为所需行动的能力,发现模型性能下降高达44.5个百分点,揭示感知到行动的瓶颈。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19881 2026-06-19 cs.CL 新提交 70%

REDACT: A Systematically Controlled Multilingual Benchmark for Personal Information Detection

REDACT:一个系统控制的个人信息检测多语言基准

Guneesh Vats, Anubha Agrawal, Shikha Singhal, Ajita Dash, Praison Selvaraj, Vidhan Jhawar, Ranga Prasad Chenna, Bharadwaj Y M G

机构 * ServiceNow

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出REDACT基准,包含13,427条记录、51种实体类型、25种语言,通过强度-2覆盖阵列采样控制9个生成轴,并引入实体级元数据(披露状态、形式、GDPR敏感层级)以支持分层评估,揭示检测器在敏感数据上的架构依赖性失败模式。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19795 2026-06-19 cs.SE cs.AI 新提交 70%

Agentic Electronic Design Automation: A Handoff Perspective

代理式电子设计自动化:一种交接视角

Jiawei Liu, Peiyi Han, Yuntao Lu, Su Zheng, Fengyu Yan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Primarius Technologies(Primarius技术公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文从交接有效性角度出发,将EDA流程中的代理系统分为三类,并提出五层代理通信协议,以解决多阶段、多工具间的状态传递和验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19647 2026-06-19 cs.CL cs.CY cs.SI 新提交 70%

From 50K to 8.2 Million in 24 Hours: Vozinha's Algorithmic Consecration and the Multilingual Making of World Cup Visibility

从5万到820万在24小时内:Vozinha的算法封圣与世界杯可见性的多语言构建

Vinicius Covas

机构 * Universidad Anáhuac México(墨西哥阿纳瓦克大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过多语言语料库和九框架叙事分类法,分析2026年世界杯后Vozinha的算法封圣过程,揭示不同语言承载不同叙事框架,将平台粉丝数作为语言对象研究可见性构建。

Comments 11 pages, 4 figures, 3 tables; v0.1 pilot preprint. Dataset and evidence package available at https://doi.org/10.5281/zenodo.20722235

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19613 2026-06-19 cs.SE cs.AI 新提交 70%

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

StaminaBench: 对编码智能体进行100轮交互的压力测试

Vlad Sobal, Shuo Yang, Yuting Zhang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19407 2026-06-19 cs.SE cs.AI 新提交 70%

JustDiag!: A Diagnostic Justification Engine for Accountable Root Cause Analysis

JustDiag!:用于可问责根本原因分析的诊断论证引擎

Tingzhu Bi, Xinrui Jiang, Xun Zhang, Pengcheng Su, Congjie He, Jinglin Li, Ping Wang, Meng Ma

机构 * Peking University(北京大学) University of Edinburgh(爱丁堡大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JustDiag诊断论证引擎,通过维护显式的过程状态(证据、发现、竞争假设、冲突和下一步检查)来支持可问责的根本原因分析,在66个真实事件上评估显示其优于仅提供流畅最终答案的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19256 2026-06-18 cs.AI 新提交 70%

X+Slides: Benchmarking Audience-Conditioned Slide Generation

X+Slides:面向受众条件的幻灯片生成基准测试

Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) SenseTime

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出X+Slides基准,通过动态评估框架和受众特定权重,衡量幻灯片生成系统在受众覆盖、领域覆盖、效率和正确性方面的表现,揭示现有系统在受众关键信息恢复上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19218 2026-06-18 cs.CL 新提交 70%

RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

RECOM:开放式 Reddit 问答中自动评估指标的有效性与区分性权衡

Pushwitha Krishnappa, Amit Das, Vinija Jain, Aman Chadha, Tathagata Mukherjee

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Meta AI Amazon GenAI(亚马逊生成人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出 RECOM 数据集,发现自动评估指标在开放式问答中无法同时兼顾有效性和区分性,余弦相似度有效性高但区分性差,BERTScore 区分性受长度影响且有效性弱。

详情

展开后加载摘要…

URL PDF HTML 收藏