arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-08 至 2025-12-08 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31 篇

2512.05339 2025-12-08 cs.LG 90%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03589 2025-12-08 cs.AI cs.CL cs.HC 90%

Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models

利用大语言模型进行文本中过程知识图谱提取的人类评估

Valentina Anita Carriero, Antonia Azzini, Ilaria Baroni, Mario Scrocca, Irene Celino

机构 * Princeton University(普林斯顿大学) Springer Heidelberg(斯普林格海德堡) ABC Institute(ABC研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型和提示工程方法,从文本中提取过程知识并构建知识图谱,通过用户研究评估其质量和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 89%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05537 2025-12-08 cs.CL 87%

Automated Identification of Incidentalomas Requiring Follow-Up: A Multi-Anatomy Evaluation of LLM-Based and Supervised Approaches

自动识别需要随访的偶发瘤:基于LLM和监督方法的多解剖评估

Namu Park, Farzad Ahmed, Zhaoyi Sun, Kevin Lybarger, Ethan Breinhorst, Julie Hu, Ozlem Uzuner, Martin Gunn, Meliha Yetisgen

机构 * Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, WA, USA(生物医学信息学与医学教育系,华盛顿大学,西雅图,华盛顿州,美国) Department of Information Sciences and Technology, George Mason University, Fairfax, VA, USA(信息科学与技术系,乔治·马歇尔大学,弗吉尼亚州,美国) Department of Radiology, Te Whatu Ora Health New Zealand, Te Toka Tumai Auckland, Auckland, New Zealand(放射学系,新西兰Te Whatu Ora健康机构,奥克兰,新西兰) Department of Radiology, School of Medicine, University of Washington, Seattle, WA, USA(放射学系,医学院,华盛顿大学,西雅图,华盛顿州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种基于LLM和监督方法的多解剖评估,通过结构化病变标记和解剖学上下文提升偶发瘤检测性能,达到与人类专家相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05700 2025-12-08 cs.CL cs.AI 86%

Faithfulness metric fusion: Improving the evaluation of LLM trustworthiness across domains

可信度度量融合:提升跨领域的LLM可信度评估

Ben Malin, Tatiana Kalganova, Nikolaos Boulgouris

机构 * CEDPS Brunel University London London, UK(CEDPS 布伦大学伦敦 英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过融合多种可信度度量,提升LLM在不同领域中的可信度评估能力,并通过同质化数据集验证其有效性。

Comments 9 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05334 2025-12-08 cs.IR cs.AI cs.CL 86%

The Effect of Document Summarization on LLM-Based Relevance Judgments

文档摘要对基于大语言模型的相关性判断的影响

Samaneh Mohtadi, Kevin Roitero, Stefano Mizzaro, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了文档摘要对基于大语言模型的相关性判断可靠性及IR评估的影响,发现摘要判断在稳定性上与完整文档判断相当,但引入了系统性的标签偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11222 2025-12-08 cs.SE cs.AI cs.CL cs.IR 86%

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal

ORFuzz: 测试LLM安全的'另一面' -- 检测过度拒绝

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Jiashui Wang, Xinlei Ying, Long Liu, Wenhai Wang

机构 * Zhejiang University(浙江大学) Zhejiang University Huzhou Institute of Industrial Control Technology(浙江大学湖州工业控制技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ORFuzz通过进化测试框架系统检测LLM的过度拒绝现象,生成高覆盖率的测试用例并建立新基准,提升LLM安全性。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05336 2025-12-08 cs.LG 85%

PathFinder: MCTS and LLM Feedback-based Path Selection for Multi-Hop Question Answering

PathFinder: 基于MCTS和LLM反馈的多跳问答路径选择

Durga Prasad Maram, Kalpa Gunaratna, Vijay Srinivasan, Haris Jeelani, Srinivas Chappidi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PATHFINDER通过MCTS和LLM反馈优化多跳问答的路径选择,提升训练数据质量与推理准确性。

Comments 5 PAGES, 3 IMAGES

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06211 2025-12-08 cs.CV 85%

iMotion-LLM: Instruction-Conditioned Trajectory Generation

iMotion-LLM:基于指令的轨迹生成

Abdulwahab Felemban, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen, Abduallah Mohamed, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院) Meta Reality Labs(Meta现实实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 iMotion-LLM通过结合预训练LLM与轨迹预测模块,实现基于文本指令的交互式运动生成,提升自动驾驶中的轨迹生成准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03100 2025-12-08 cs.CR 85%

Towards a standardized methodology and dataset for evaluating LLM-based digital forensic timeline analysis

迈向评估基于LLM的数字取证时间线分析的标准化方法和数据集

Hudan Studiawan, Frank Breitinger, Mark Scanlon

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种标准化方法和数据集,用于评估LLM在数字取证时间线分析中的性能,通过BLEU和ROUGE指标进行定量评估,并展示了实验结果及局限性。

Journal ref Forensic Science International: Digital Investigation 54, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05594 2025-12-08 cs.AI cs.CL 82%

Ontology Learning with LLMs: A Benchmark Study on Axiom Identification

基于LLM的本体学习:关于公理识别的基准研究

Roos M. Bakker, Daan L. Di Scala, Maaike H. T. de Boer, Stephan A. Raaijmakers

机构 * Netherlands Organisation for Applied Scientific Research (TNO)(荷兰应用科学研究院) Leiden University Centre for Linguistics (LUCL)(莱顿大学语言研究中心) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OntoAxiom基准,评估不同LLM在公理识别中的表现,发现AbA方法优于直接方法,且领域和模型大小影响性能。

Comments Submitted to Semantic Web Journal, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05536 2025-12-08 cs.HC 80%

Eye of the Beholder: Towards Measuring Visualization Complexity

眼之所见:迈向可视化复杂度的测量

Johannes Ellemose, Niklas Elmqvist

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用零样本LLM评估可视化复杂度,通过众包研究发现其在预测复杂度和提取特征方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01592 2025-12-08 cs.CL cs.AI 80%

AURA: A Diagnostic Framework for Tracking User Satisfaction of Interactive Planning Agents

AURA:一个用于跟踪交互式规划代理用户满意度的诊断框架

Takyoung Kim, Janvijay Singh, Shuhaib Mehri, Emre Can Acikgoz, Sagnik Mukherjee, Nimet Beyza Bozdag, Sumuk Shashidhar, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AURA提出一个诊断框架,用于跟踪交互式规划代理的用户满意度,通过评估代理行为阶段和中间行为来提升用户体验。

Comments NeurIPS 2025 MTI-LLM Workshop. Full version is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI 79%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05449 2025-12-08 cs.AI 77%

The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems

计划的种子:代理系统构建块中的弱点意志

Robert Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出将'意志薄弱'作为分析代理AI系统不一致性和目标漂移的基础概念,并引入Akrasia基准以评估模型的自我控制能力。

Comments 4 pages + appendix. AAAI 2026 FAST Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05176 2025-12-08 cs.SE cs.AI cs.HC 77%

Towards A Cultural Intelligence and Values Inferences Quality Benchmark for Community Values and Common Knowledge

迈向社区价值观和常识的文化智能与价值观推理质量基准

Brittany Johnson, Erin Reddick, Angela D. R. Smith

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CIVIQ基准,旨在通过社区价值观和常识对齐提升文化智能,填补美国文化多样性下的评估空白。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05659 2025-12-08 econ.GN q-fin.EC 75%

Beyond Automation: Redesigning Jobs with LLMs to Enhance Productivity

超越自动化:利用LLMs重新设计工作以提高生产率

Andrew Ledingham, Michael Hollins, Matthew Lyon, David Gillespie, Umar Yunis-Guerra, Jamie Siviter, David Duncan, Oliver P. Hauser

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文利用LLMs重新设计工作以提高生产率,发现人类在战略领导、复杂问题解决和利益相关者管理等方面具有比较优势,同时强调生产率提升而非角色替代是AI经济价值的主要来源。

Comments 98 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05202 2025-12-08 cs.DL 75%

Can ChatGPT evaluate research environments? Evidence from REF2021

ChatGPT能否评估研究环境?来自REF2021的证据

Kayvan Kousha, Mike Thelwall, Elizabeth Gadd

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究ChatGPT能否评估研究环境,发现其在REF2021中与专家评分呈正相关,但存在偏见和系统性影响的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05288 2025-12-08 cs.CR cs.AI cs.LG 73%

Beyond Detection: A Comprehensive Benchmark and Study on Representation Learning for Fine-Grained Webshell Family Classification

超越检测:面向细粒度Webshell家族分类的全面基准和研究

Feijiang Han

机构 * Feijiang Han(韩菲江)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化WebShell家族分类方法,通过动态函数调用轨迹和图结构抽象,评估多种表示方法以提升细粒度分类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05119 2025-12-08 cs.IR cs.AI cs.CL 73%

RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering

RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估

Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RAG-IGBench通过创新的评估指标和多模态数据,评估基于检索增强生成的交错生成任务,验证了模型在开放领域问答中的性能提升。

Comments 26 pages, 6 figures, NeurIPS 2025 D&B Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05529 2025-12-08 cs.CV cs.AI 70%

See in Depth: Training-Free Surgical Scene Segmentation with Monocular Depth Priors

深入观察:基于单目深度先验的训练自由手术场景分割

Kunyi Yang, Qingyu Wang, Cheng Yuan, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出一种无需训练的手术场景分割方法,利用单目深度先验和预训练模型实现高效分割,实验表明其在标注效率和分割性能上优于现有方法。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05501 2025-12-08 cs.CL 70%

SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures

SEA-SafeguardBench: 评估SEA语言和文化中的AI安全

Panuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat

机构 * VISTEC Google(谷歌) AI Singapore(AI新加坡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEA-SafeguardBench是首个针对东南亚语言和文化的AI安全评估基准,通过八种语言21640个样本验证LLMs在文化特定危害场景下的表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11081 2025-12-08 cs.SE 67%

DPS: Design Pattern Summarisation Using Code Features

DPS:利用代码特征进行设计模式摘要

Najam Nazar, Sameer Sikka, Christoph Treude

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 DPS利用代码特征和JavaParser生成设计模式摘要,通过自然语言生成技术捕捉上下文信息,实验证明其摘要在ROUGE-L、BLEU-4等指标上表现优异,且在开发者理解时间上优于无摘要情况。

Comments 32 pages, 2 figures, 8 tables

Journal ref Empirical Software Engineering 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11984 2025-12-08 cs.DB 67%

NL2SQL-BUGs: A Benchmark for Detecting Semantic Errors in NL2SQL Translation

NL2SQL-BUGs: 一个用于检测NL2SQL翻译语义错误的基准

Xinyu Liu, Shuyu Shen, Boyan Li, Nan Tang, Yuyu Luo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 NL2SQL-BUGs是一个用于检测NL2SQL翻译中语义错误的基准,通过两级分类法识别9大类31子类错误,揭示当前大语言模型在语义错误检测上的不足。

Comments 12 pages, 6 figures, 4 tables, KDD 2025

Journal ref SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05508 2025-12-08 cs.SD cs.AI cs.LG 62%

Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction

歌词很重要:利用学习到的表示力预测音乐流行度

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) Department of Electrical Engineering, IIT Bombay(印度理工学院班加罗尔电气工程系) CFILT, Department of Computer Science, IIT Bombay(印度理工学院班加罗尔计算机科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型提取歌词嵌入,结合音频和社交数据,提升音乐流行度预测精度,实验显示在SpotGenTrack数据集上MAE和MSE分别提升9%和20%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05379 2025-12-08 cs.CL cs.AI 62%

Mitigating Self-Preference by Authorship Obfuscation

通过作者混淆缓解自我偏好

Taslim Mahbub, Shi Feng

机构 * Taslim Mahbub, Shi Feng

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过作者混淆技术减少语言模型判断者的自我偏好,发现简单词义替换可有效降低偏见,但彻底消除偏见面临根本挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05954 2025-12-08 cs.AI 57%

SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code

SymPyBench: 一个用于可执行Python代码科学推理的动态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SymPyBench是一个用于科学推理的动态基准,通过可执行Python代码测试不同推理技能,提供新的评估指标以量化推理的不确定性和变化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 57%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05557 2025-12-08 cs.CV cs.AI 57%

2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency

2K角色-10K故事:一个具有解耦控制和序列一致性的质量门控风格化叙事数据集

Xingxi Yin, Yicheng Li, Gong Yan, Chenglin Li, Jian Zhao, Cong Huang, Yue Deng, Yin Zhang

机构 * Zhejiang University(浙江大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出2K-Characters-10K-Stories数据集,通过解耦控制和质量门控机制,实现高质量的风格化叙事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04442 2025-12-08 cs.AI cs.SE 57%

TaskEval: Synthesised Evaluation for Foundation-Model Tasks

TaskEval: 基础模型任务的合成评估

Dilani Widanapathiranage, Scott Barnett, Stefanus Kurniawan, Wannita Takerngsaksiri

机构 * Applied Artificial Intelligence Initiative, Deakin University(应用人工智能倡议,德坎大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 TaskEval提出一种合成评估方法,通过任务无关的元模型、交互协议和评估合成器,为基础模型任务提供自动化评估和反馈收集,提升评估效率与准确性。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏