arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2512.16453 2026-01-30 cs.AI 92%

TimeSeries2Report prompting enables adaptive large language model management of lithium-ion batteries

TimeSeries2Report提示使大语言模型适应性管理锂离子电池

Jiayang Yang, Martin Guay, Zhixing Cao, Chunhui Zhao

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University, Hangzhou, 310027, China(工业控制技术国家重点实验室,控制科学与工程学院,浙江大学,杭州,310027,中国) Department of Chemical Engineering, Queen’s University, Kingston, Ontario K7L 3N6, Canada(化学工程系,皇后大学,金斯顿,安大略省K7L 3N6,加拿大)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 TimeSeries2Report通过将时间序列数据转化为结构化报告,提升大语言模型在锂离子电池管理中的适应性和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14038 2026-01-30 cs.AI cs.CL cs.IR 92%

OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。

Comments 5 pages, 1 figure, 1 table, 1 code snippet

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03827 2026-01-30 cs.AI 91%

What Would an LLM Do? Evaluating Large Language Models for Policymaking to Alleviate Homelessness

LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用

Pierre Le Coz, Jia An Liu, Debarun Bhattacharjya, Georgina Curto, Serge Stinckwich

机构 * United Nations University Institute in Macau(联合国大学澳门研究所) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。

Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19236 2026-01-30 cs.CL 90%

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

在不同领域评估文本创造力:一个数据集和大语言模型评估器

Qian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu, Fang Luo, Ruihua Song

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出了一种基于CreataSet数据集的CrEval评估器,通过结合人类和合成数据提升大语言模型的创造力评估效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00590 2026-01-30 cs.CL cs.AI cs.LG 90%

Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models

Wikontic: 构建与维基数据对齐、本体感知的知识图谱

Alla Chepurova, Aydar Bulatov, Mikhail Burtsev, Yuri Kuratov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Wikontic通过多阶段流程构建维基数据对齐、本体感知的知识图谱,提升KG质量并实现高效构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12448 2026-01-30 cs.SE 90%

Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software

评估大型语言模型在航空航天软件时间序列异常检测中的应用

Yang Liu, Yixing Luo, Xiaofeng Li, Xiaogang Dong, Bin Gu, Zhi Jin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。

Comments This paper has been accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21505 2026-01-30 cs.AI cs.CL cs.HC 90%

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

风格向量对大型语言模型的控制效果:一项人类评估

Diaoulé Diallo, Katharina Dworatzyk, Sophie Jentzsch, Peer Schütt, Sabine Theis, Tobias Hecking

机构 * German Aerospace Center (DLR), Institute of Software Technology(德国航空航天中心(DLR)软件技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过人类评估验证了激活引导在控制大型语言模型情绪输出中的有效性,发现中等强度引导能显著增强目标情绪并保持文本可理解性,且模型升级后效果更稳定。

Journal ref IEEE Access 13 (2025) 191443-191457

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21375 2026-01-30 cs.AI 89%

TeachBench: A Syllabus-Grounded Framework for Evaluating Teaching Ability in Large Language Models

TeachBench: 一种基于课程的评估大语言模型教学能力的框架

Zheng Li, Siyao Song, Jingyuan Ma, Rui Li, Ying Zeng, Minghao Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 TeachBench通过多轮指导后学生表现提升评估大语言模型的教学能力,揭示不同模型和领域间教学效果的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00527 2026-01-30 cs.SE cs.AI 89%

A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models

一种分层不精确概率方法用于大型语言模型的可靠性评估

Robab Aghazadeh-Chakherlou, Qing Guo, Siddartha Khastgir, Peter Popov, Xiaoge Zhang, Xingyu Zhao

机构 * WMG, University of Warwick(沃里克大学工业与制造业学院) Center for Frontier AI Research, A*STAR(前沿人工智能研究中心) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Center for Software Reliability, City St George's, University of London(伦敦大学圣乔治学院软件可靠性中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出HIP-LLM,一种分层不精确概率框架,用于更准确地评估大型语言模型的可靠性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21235 2026-01-30 cs.CL cs.AI 89%

SHARP: Social Harm Analysis via Risk Profiles for Measuring Inequities in Large Language Models

SHARP:通过风险轮廓进行社会危害分析以衡量大语言模型中的不平等

Alok Abhishek, Tushar Bandopadhyay, Lisa Erickson

机构 * San Francisco, USA(美国旧金山) Boston, USA(美国波士顿)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SHARP通过风险轮廓分析大语言模型中的社会危害,揭示了模型在偏见、公平性和伦理方面的异质性风险结构。

Comments Pre Print, 29 pages. key words: Social harm evaluation in LLMs, Large language models, Risk sensitive model selection, Evaluation for high-stakes domains, Worst-case behavior in LLMs, Algorithmic bias, Fairness in machine learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20879 2026-01-30 cs.SE 89%

A Survey on Large Language Model Impact on Software Evolvability and Maintainability: the Good, the Bad, the Ugly, and the Remedy

对大型语言模型对软件可变性与可维护性影响的综述:好坏优劣及解决方法

Bruno Claudino Matias, Savio Freire, Juliana Freitas, Felipe Fronchetti, Kostadin Damevski, Rodrigo Spinola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大型语言模型对软件可变性与可维护性的影响,分析了其带来的积极影响、潜在风险及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19616 2026-01-30 cs.LG cs.AI cs.CV 88%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03762 2026-01-30 cs.CL cs.AI 88%

Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models

虚拟大脑:迈向大型语言模型中人工通用智能的缺失部件

Yuxi Ma, Chi Zhang, Song-Chun Zhu

机构 * Beijing Insitute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型中人工通用智能的缺失部件,提出智能代理应具备无限任务执行、任务生成、价值系统和现实世界模型等特征,并强调知与行的统一对智能发展的重要性。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 47 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06160 2026-01-30 cs.CL cs.AI cs.CY cs.LG cs.SI 87%

Navigating the Rabbit Hole: Emergent Biases in LLM-Generated Attack Narratives Targeting Mental Health Groups

穿越兔子洞:LLM生成的攻击叙事中对心理健康群体的新兴偏见

Rijul Magu, Arka Dutta, Sean Kim, Ashiqur R. KhudaBukhsh, Munmun De Choudhury

专题命中 评测与基准 :LLM(title,abstract);language model(abstract,journal_ref);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLM生成的攻击叙事中对心理健康群体的偏见问题,提出评估框架和污名分析,揭示了LLM在加剧有害话语方面的结构性倾向。

Journal ref Second Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21740 2026-01-30 cs.MM cs.SD 85%

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

MIDI-LLaMA:一种用于符号音乐理解的指令遵循多模态大语言模型

Meng Yang, Jon McCormack, Maria Teresa Llano, Wanchao Su, Chao Lei

机构 * SensiLab, Monash University, Australia(Monash大学) University of Sussex, Brighton, United Kingdom(Sussex大学) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 MIDI-LLaMA通过结合MusicBERT和Llama-3-8B,实现了对符号音乐的指令遵循理解,显著提升了音乐描述和语义对齐能力。

Comments Accepted for publication at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21347 2026-01-30 eess.AS cs.SD 85%

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

迈向鲁棒的口吃语音识别:LLM代理在WER之外的ASR后修正

Xiuwen Zheng, Sixun Dong, Bornali Phukon, Mark Hasegawa-Johnson, Chang D. Yoo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于LLM的代理用于ASR后修正,通过语义校正提升口吃语音识别的鲁棒性,实现WER降低和语义性能提升。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21261 2026-01-30 cs.CR 85%

User-Centric Phishing Detection: A RAG and LLM-Based Approach

以用户为中心的钓鱼检测:一种基于RAG和LLM的方法

Abrar Hamed Al Barwani, Abdelaziz Amara Korba, Raja Waseem Anwar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于RAG和LLM的个性化钓鱼检测方法,通过整合用户历史邮件和实时威胁情报,提升邮件检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02833 2026-01-30 cs.LG cs.AI 84%

A Comparative Study on How Data Normalization Affects Zero-Shot Generalization in Time Series Foundation Models

对数据标准化如何影响时间序列基础模型零样本泛化能力的比较研究

Ihab Ahmed, Denis Krompaß, Cheng Feng, Volker Tresp

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究比较了数据标准化对时间序列基础模型零样本泛化能力的影响,发现REVIN方法在效率和准确性之间实现了最佳权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21067 2026-01-30 cs.LG 83%

Out-of-Distribution Generalization in Graph Foundation Models

图基础模型中的分布外泛化

Haoyang Li, Haibo Chen, Xin Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文综述了图基础模型中分布外泛化的最新进展,讨论了分布偏移带来的挑战,并总结了相关方法和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10163 2026-01-30 cs.CL 81%

Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions

Compound-QA:一个评估大语言模型在复合问题上的基准

Yutao Hou, Yajing Luo, Zhiwen Ruan, Hongru Wang, Weifeng Ge, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Compound-QA基准通过评估LLM在复合问题上的表现,揭示其在理解和推理方面的不足,并提出改进策略。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21722 2026-01-30 cs.CL cs.AI 81%

Enhancing Language Models for Robust Greenwashing Detection

增强语言模型以实现稳健的绿色洗脑检测

Neil Heinrich Braun, Keane Ong, Rui Mao, Erik Cambria, Gianmarco Mengaldo

机构 * National University of Singapore(新加坡国立大学) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种参数高效框架,通过结合对比学习和顺序排名目标来增强语言模型在绿色洗脑检测中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21080 2026-01-30 cs.AI cs.LG econ.EM 81%

LLM Personas as a Substitute for Field Experiments in Method Benchmarking

LLM 人格作为方法基准测试中的实地实验替代品

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington, Seattle, USA(华盛顿大学福斯特商学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过LLM人格模拟替代实地实验,证明在特定条件下,人格模拟与改变评估人群效果相同,并定义了样本量对区分方法有效性的决定性作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21360 2026-01-30 cs.CL cs.AI cs.ET cs.LG cs.SE 80%

The Compliance Paradox: Semantic-Instruction Decoupling in Automated Academic Code Evaluation

合规悖论:自动学术代码评估中的语义指令解耦

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Vinay Chamola, Dhruv Kumar

机构 * KIIT University(KIIT大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了自动学术代码评估中模型因优先考虑隐藏格式约束而无法正确评估代码的问题,提出SPACI和AST-ASIP框架以检测和对抗此类解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21830 2026-01-30 cs.AI 79%

Looking Beyond Accuracy: A Holistic Benchmark of ECG Foundation Models

超越准确率:ECG基础模型的综合基准测试

Francesca Filice, Edoardo De Rose, Simone Bartucci, Francesco Calimeri, Simona Perri

机构 * Department of Mathematics and Computer Science, University of Calabria(卡利博大学数学与计算机科学系) DLVSystem Srl(DLVSystem公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出了一种综合基准测试框架,用于评估ECG专家基础模型的表示能力和泛化能力,结合性能评估与表示层面分析,以深入理解其在医疗领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21471 2026-01-30 cs.LG math.OC stat.ML 79%

Best Arm Identification with LLM Judges and Limited Human

使用LLM裁判和有限人力的最佳臂识别

Ruicheng Ao, Hongyu Chen, Siyang Gao, Hanwei Li, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所) School of Data Science(数据科学学院) Department of Decision Analytics and Operations(决策分析与运营部门) Department of Civil and Environmental Engineering(土木与环境工程部门) Operations Research Center(运筹学研究中心)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出了一种结合LLM裁判和有限人力的最佳臂识别算法,通过引入偏见修正和倾向调整,提高审计效率和准确性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10890 2026-01-30 cs.CL 79%

LLM$\times$MapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System

LLM×MapReduce-V3:通过MCP驱动的分层模块化代理系统实现交互式深入调研生成

Yu Chao, Siyu Lin, xiaorong wang, Zhu Zhang, Zihan Zhou, Haoyu Wang, Shuo Wang, Jie Zhou, Zhiyuan Liu, Maosong Sun

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学) Peking University(北京大学) Modelbest Inc.(Modelbest公司) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 LLM×MapReduce-V3通过MCP驱动的分层模块化代理系统实现交互式深入调研生成,提升调研内容深度与长度。

Comments Accepted by EMNLP2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20913 2026-01-30 cs.LG cs.AI cs.CV 79%

Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges

噪声但有效:通过不完美的裁判者对LLM进行稳健的统计评估

Chen Feng, Minghe Shen, Ananth Balashankar, Carsten Gerner-Beuerle, Miguel R. D. Rodrigues

机构 * Queen’s University Belfast(女王大学贝尔法斯特分校) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种稳健的LLM统计评估框架,通过建模不完美裁判行为,理论保证有限样本的一类错误控制,并验证了在不完美裁判设定下的评估有效性。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21508 2026-01-30 q-bio.NC 78%

How 'Neural' is a Neural Foundation Model?

神经基础模型的'神经'程度如何?

Johannes Bertram, Luciano Dyballa, Anderson Keller, Savik Kinger, Steven W. Zucker

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究通过分析神经基础模型中神经元的时序响应模式,揭示了模型不同处理阶段的表征结构差异,并提出改进设计以更贴近生物系统。

Comments 28 pages, 18 figures, sumbitted to ICML 2026. arXiv admin note: substantial text overlap with arXiv:2512.07869

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22155 2026-01-30 cs.CV cs.CL 77%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21387 2026-01-30 cs.CL 77%

User-Centric Evidence Ranking for Attribution and Fact Verification

以用户为中心的证据排序用于归因和事实验证

Guy Alt, Eran Hirsch, Serwar Basch, Ido Dagan, Oren Glickman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系) UKP Lab, TU Darmstadt(达姆施塔特技术大学UKP实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出证据排序任务,通过优先展示足够信息减少用户阅读负担并提升验证效率,实验表明逐步排序优于一次性排序,LLM方法在性能上优于基线模型。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏