arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2605.00620 2026-05-04 cs.CL 88%

SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models

SC-Taxo:基于语义一致性约束的层次化分类生成方法

Shiqiang Cai, Nianhong Niu, Shizhu He, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology Beijing(北京科技大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出SC-Taxo框架,利用大语言模型和层次化优化机制,解决现有分类生成方法在结构一致性和语义对齐上的不足,提升分类体系的层次性和准确性。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03265 2026-05-04 cs.LG 88%

Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models

超越后缀:在大语言模型对抗攻击中的标记位置

Hicham Eddoubi, Umar Faruk Abdullahi, Fadi Hassan

机构 * University of Cagliari(卡利里大学) Sapienza University of Rome(罗马大学) Huawei Technologies Finland Research Center(芬兰华为技术研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究探讨了在大语言模型对抗攻击中,标记位置对攻击成功率的影响,指出在Greedy Coordinate Gradient攻击中,优化攻击生成前缀而非后缀以及调整对抗标记位置对攻击效果有显著影响。

Comments 12 pages, 10 figures, presented at the "I Can't Believe It's Not Better" workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27467 2026-05-01 cs.SE cs.CL 88%

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

ScaleBox:实现大规模语言模型高保真和可扩展的代码验证

Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国科学院信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ScaleBox通过自动化特殊判题生成与管理、细粒度并行执行和配置驱动的评估套件,提升大规模代码训练的验证准确性和效率,显著优于基线方法。

Comments Accepted to ACL 2026 Demo. Our project is available at https://github.com/icip-cas/ScaleBox

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27137 2026-05-01 cs.CL 88%

Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

跨语言响应一致性在大语言模型中的研究:基于ILR的Claude多语言评估

Camelia Baluta

机构 * Independent Researcher(独立研究者) Former Faculty, Defense Language Institute Foreign Language Center(前国防语言研究院外语中心 faculty) ILR/OPI Assessment Specialist(ILR/OPI 评估专家)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文基于ILR技能描述系统,评估Claude在六种语言中的响应一致性,发现法语响应比德语更长30%,且创造性输出存在显著跨语言差异,提出ILR指导的专家评估方法补充了纯计算基准。

Comments 12 prompt clusters 6 languages 3 runs; data and code at github.com/camelbal-ship-it/crosslingual-claude-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00095 2026-05-01 cs.CV cs.AI cs.CY 88%

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22134 2026-04-30 cs.CL 88%

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

SHAPE:统一安全、帮助性和教学法以用于教育LLM

Sihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(纽约大学上海数据科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SHAPE基准,通过知识掌握图统一安全、帮助性和教学行为,改进教育LLM在对抗压力下的安全性和帮助性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25960 2026-04-30 cs.SE cs.LG cs.PL 88%

Large Language Models for Multilingual Code Intelligence: A Survey

大型语言模型用于多语言代码智能:综述

Chao Jiang, Dugang Liu, Cheng Wen, Zhiwu Xu, Hua Zheng, Muhammad Sadiq, Jawwad Ahmed Shamsi, Shengchao Qin, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) Guangzhou University of Software, China(广州软件大学,中国) Shenzhen University of Information Technology(深圳信息大学) National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16902 2026-04-30 cs.AI 88%

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

超越文本主导:理解多模态大语言模型的模态偏好

Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory(中文信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型的模态偏好现象,通过新基准和模态选择率指标量化发现,大多数模型表现出显著的视觉偏好,并通过层间探测揭示偏好在中后期层逐步出现,进而用于诊断跨模态幻觉,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22884 2026-04-28 cs.CV cs.AI 88%

Can Multimodal Large Language Models Truly Understand Small Objects?

多模态大语言模型真的能理解小物体吗?

Fujun Han, Junan Chen, Xintong Zhu, Jingqi Ye, Xuanjie Mao, Tao Chen, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。

Comments Under Peer Review (26 pages, 9 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 88%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22306 2026-04-27 cs.LO cs.AI cs.PL 88%

BLAST: Benchmarking LLMs with ASP-based Structured Testing

BLAST:基于ASP的结构化测试的LLM基准测试

Manuel Alejandro Borroto Santana, Erica Coppolillo, Francesco Calimeri, Giuseppe Manco, Simona Perri, Francesco Ricca

机构 * University of Calabria(卡利亚里大学) ICAR-CNR Artificial Intelligence LAB, DeMaCS, University of Calabria(人工智能实验室,DeMaCS,卡利亚里大学) DLVSystem(DLV系统)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLAST,首个针对LLM生成ASP代码准确性的基准方法和数据集,通过两个新提出的语义指标评估十种经典图问题和八种先进LLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21697 2026-04-24 cs.CR cs.AI cs.MM 88%

Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models

结构化视觉叙事削弱多模态大语言模型的安全对齐

Rui Yang Tan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。

Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20697 2026-04-24 cs.SD cs.AI 88%

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18038 2026-04-21 cs.CY cs.AI 88%

First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows

首先,不要伤害(与LLM一起):通过代理工作流减轻种族偏见

Sihao Xing, Zaur Gouliev

机构 * School of Enterprise Computing and Digital Transformation(企业计算与数字化转型学院) Technological University Dublin(都柏林技术大学) School of Information and Communication Studies(信息与传播研究学院) University College Dublin(都柏林大学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过代理工作流评估医疗LLM中的种族偏见,发现DeepSeek V3在诊断任务中表现最佳,嵌入代理工作流后显著降低偏见指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16646 2026-04-21 cs.AI 88%

SMART: Self-Generating and Self-Validating Multi-Dimensional Assessment for LLMs' Mathematical Problem Solving

SMART: 自生成和自验证的多维评估用于LLM的数学问题解决

Yujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang, Xuetao Ma, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(北京市教育厅人工智能教育工程研究中心智能技术与教育应用联合实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SMART通过分解数学问题解决为四个维度,评估LLM的数学能力,揭示模型在不同维度上的差异,提出All-Pass Score衡量真实问题解决能力。

Comments Need to address additional data or methodological concerns

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP 88%

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13099 2026-04-21 cs.CL 88%

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

Alexandria:一个多领域方言阿拉伯语机器翻译数据集,用于文化包容和语言多样性的LLM

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, Al-Yas Al-Ghafri, Wesam El-Sayed, Asila Al sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Areej Asiri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Brahim, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed

机构 * The University of British Columbia(不列颠哥伦比亚大学) Canada Research Chair in NLP and ML(自然语言处理和机器学习研究主席) Mohammed VI Polytechnic University(穆莱·阿卜杜勒阿齐兹国王理工学院) Birzeit University(比尔泽特大学) Western Michigan University(西部密歇根大学) Tuwaiq Academy(图瓦伊克学院) King Khalid University(国王卡利德大学) American University of Beirut(贝鲁特美国大学) Ibb University(伊卜大学) University of Hail(海勒大学) University of Technology and Applied Sciences(技术与应用科学大学) Arab Open University(阿拉伯开放大学) Minia University(米尼亚大学) Nantes University(南特大学) Prince Sultan University(沙特王子大学) Umm Al-Qura University(乌姆·阿勒·卡拉大学) University of Nouakchott(努尔人大学) Fatabyyano(法塔比亚诺) Independent Researcher(独立研究者) Hadhramout University(哈德拉姆大学) Cairo University(开罗大学) Misurata University(米斯拉塔大学) Al-Balqa Applied University(巴勒斯坦应用大学) University of Khartoum(喀土穆大学) Sultan Qaboos Higher Centre for Culture and Science(穆罕默德·本·拉希德·阿勒马克图姆文化与科学高级中心) Arab Center for Research and Policy Studies(阿拉伯研究中心) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Institut Supérieur du Numérique(数字高级学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Alexandria数据集通过多领域方言阿拉伯语对话数据,提升LLM在不同阿拉伯方言中的翻译能力,揭示现有模型在方言翻译中的挑战。

Comments Accepted to ACL 2026 Main; Project resources will be available here: https://github.com/UBC-NLP/Alexandria

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 88%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI 88%

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09363 2026-04-17 cs.AI cs.SY eess.SY 88%

BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems

BarrierBench: 评估大型语言模型在动态系统安全验证中的性能

Ali Taheri, Alireza Taban, Sadegh Soudjani, Ashutosh Trivedi

机构 * Isfahan University of Technology(伊斯法罕技术大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出BarrierBench基准,评估大型语言模型在动态系统安全验证中的能力,通过100个动态系统案例测试语言模型在生成安全证书和协调策略中的有效性。

Comments 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08064 2026-04-16 cs.AI 88%

ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models

ImplicitMemBench: 测量大语言模型中的无意识行为适应

Chonghan Qin, Xiachong Feng, Weitao Ma, Xiaocheng Feng, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ImplicitMemBench,首个评估大语言模型隐性记忆的系统基准,通过三个认知基础构念测试隐性记忆,揭示模型在自动执行任务中的局限性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12268 2026-04-15 cs.SE cs.CL 88%

CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation

CodeSpecBench: 用于可执行行为规范生成的LLM基准测试

Zaoyu Chen, Jianbo Dai, Boyu Zhu, Jingdong Wang, Huiming Wang, Xin Xu, Haoyang Yuan, Zhijiang Guo, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) CUHK (SZ)(香港中文大学(深圳)) SUTD(新加坡科技设计大学) HKUST(香港科技大学) CUHK(香港中文大学) HKUST (GZ)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CodeSpecBench,一个基于执行评估协议的LLM可执行行为规范生成基准,评估了15种最新LLM在函数和仓库级任务中的表现,发现仓库级任务性能显著下降,且规范生成比代码生成更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12128 2026-04-15 cs.CL 88%

When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models

当自我参照失效时:大型语言模型中的矩阵级动态

Ji Ho Bae

机构 * JRTI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究自我参照输入如何改变大型语言模型的内部矩阵动态,发现自我参照并非总是不稳定,非闭合真理递归(NCTR)提示导致注意力有效秩异常升高,且在多个指标上比稳定自我参照更不稳定。

Comments 14 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 88%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09548 2026-04-14 cs.IR cs.AI 88%

Retrieval-Augmented Large Language Models for Evidence-Informed Guidance on Cannabidiol Use in Older Adults

基于检索增强的大型语言模型用于指导老年人使用大麻二酚的证据支持

Ali Abedi, Charlene H. Chu, Shehroz S. Khan

机构 * Lawrence Bloomberg Faculty of Nursing, University of Toronto(多伦多大学劳伦斯·布隆伯格护理学院) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(大学健康网络多伦多康复研究所KITE研究所) College of Engineering and Technology, American University of the Middle East(中东美国大学工程与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种结合结构化提示工程与大麻二酚证据的检索增强型大型语言模型框架,用于为老年人提供安全指导,同时开发了无标注评估框架以评估AI在敏感健康场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06813 2026-04-14 cs.CL 88%

A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs

大型语言模型在风力涡轮机维护日志标注中的比较基准

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(爱丁堡大学工程学院能源系统研究所) Nadara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种可复现的框架,用于评估大型语言模型在分类复杂工业记录任务中的性能,通过对比不同模型的可靠性、效率和校准能力,发现最佳模型需结合人类在循环系统提升数据标注质量。

Comments Associated GitHub repository: https://github.com/mvmalyi/wind-farm-maintenance-logs-labelling-with-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-04-13 cs.CV cs.AI 88%

HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Zjin Liao, Yibin Wen, Yuhang Chen, Xiaoya Fan, Chan Tsz Ho, Bi Tianyuan, Haoyuan Liang, Ruifeng Su, Zihao Qian, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16165 2026-04-13 cs.SE cs.AI cs.HC 88%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 88%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07363 2026-04-10 cs.LG 88%

Benchmark Shadows: Data Alignment, Parameter Footprints, and Generalization in Large Language Models

基准阴影:大型语言模型中的数据对齐、参数足迹与泛化

Hongjian Zou, Yidan Wang, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * Vivo AI Lab, Shenzhen, China(维沃人工智能实验室,深圳,中国) Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学,香港,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型中基准表现与广度能力之间的差异,通过数据干预发现数据分布影响参数适应与泛化能力,提出参数空间诊断方法揭示不同训练模式的结构特征。

Comments 28 pages, 26 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏