arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2509.26388 2026-05-04 eess.AS cs.AI cs.CL 86%

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

Game-Time:评估口语语言模型中的时间动态

Kai-Wei Chang, En-Pei Hu, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, James Glass

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University(台湾国立台湾大学) Academia Sinica(台湾“ Academia Sinica”) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心卓越研究中心)

专题命中 评测与基准 :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Game-Time基准测试,用于评估口语语言模型在时间动态方面的能力,发现现有模型在时间约束下表现不佳,揭示了时间感知和全双工交互的不足。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03525 2026-04-28 cs.CL cs.AI eess.AS 86%

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

基于语音的认知筛查:大型语言模型适应策略的系统评估

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Haghbin, Hossein AzadMaleki, Maryam Zolnoori

机构 * Columbia University Irving Medical Center(哥伦比亚大学伊文思医疗中心) School of Nursing, Columbia University(哥伦比亚大学护理学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统评估了大型语言模型在痴呆症检测中的适应策略,发现上下文学习、推理增强提示和参数高效微调等方法对模型性能有显著影响,展示了适配模型在语音筛查中的有效性。

Journal ref https://ai.jmir.org/2026/1/e82608

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 86%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14644 2026-04-17 cs.CL cs.LG 86%

CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge

CURaTE:在实时中实现连续反学习以确保大语言模型知识的保留

Seyun Bae, Seokhan Lee, Eunho Yang

机构 * KT Corporation(KT公司) KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CURaTE方法,通过训练句子嵌入模型实现实时连续反学习,有效提升遗忘效果并保持知识完整性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09443 2026-04-15 cs.CL cs.AI 86%

Many-Tier Instruction Hierarchy in LLM Agents

多层级指令层级在大语言模型代理中的应用

Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Many-Tier Instruction Hierarchy (ManyIH) 以解决多源指令冲突,通过12层级的测试任务验证模型在复杂冲突场景下的表现,揭示了细粒度可扩展指令冲突解决的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11655 2026-04-14 cs.CL cs.AI cs.MA 86%

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理

Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani

机构 * Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系) Department of Law, University of Macerata(马切拉塔大学法律系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPA-Check框架,通过四阶段流程评估LLM基于角色扮演代理的性能,发现模型规模与过程一致性呈反比关系,小型模型在特定场景下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10590 2026-04-14 cs.CL cs.AI 86%

Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance

弥合语言鸿沟:预训练和数据集中的跨语言映射以提升多语言大语言模型性能

Weihua Zheng, Chang Liu, Zhengyuan Liu, Xin Huang, Kui Wu, Muhammad Huzaifah Md Shahrin, Aiti Aw, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research(新加坡科技研究局)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出在预训练阶段引入跨语言映射任务,提升多语言对齐能力,通过语言对齐系数量化一致性,实验显示在机器翻译、跨语言自然语言理解及问答任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09620 2026-04-14 cs.CY cs.AI cs.CL 86%

LLM Nepotism in Organizational Governance

大语言模型在组织治理中的偏袒行为

Shunqi Mao, Wei Guo, Dingxin Zhang, Chaoyi Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在组织治理中因对AI信任态度产生的偏袒现象,提出Merit-Attitude Factorization方法以缓解该偏见。

Comments 23 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08381 2026-04-10 cs.CL cs.AI 86%

A GAN and LLM-Driven Data Augmentation Framework for Dynamic Linguistic Pattern Modeling in Chinese Sarcasm Detection

一种基于GAN和LLM的数据增强框架用于中文讽刺检测中的动态语言模式建模

Wenxian Wang, Xiaohu Luo, Junfeng Hao, Xiaoming Gu, Xingshu Chen, Zhu Wang, Haizhou Wang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Law School, Sichuan University(四川大学法学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于GAN和LLM的数据增强框架,动态建模用户语言模式以提升中文讽刺检测效果,通过合成SinaSarc数据集并扩展BERT架构,实验表明模型在非讽刺和讽刺类别中均取得最高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07494 2026-04-10 cs.SE cs.AI cs.LG 86%

Triage: Routing Software Engineering Tasks to Cost-Effective LLM Tiers via Code Quality Signals

Triage: 通过代码质量信号将软件工程任务路由到成本效益高的LLM层级

Lech Madeyski

机构 * Wroclaw University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Triage利用代码健康度指标作为路由信号,将任务分配到最便宜的模型层级,通过分析代码质量与模型层级成本的关系,提升任务处理效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06906 2026-04-09 cs.CL cs.AI cs.CY 86%

The AI Skills Shift: Mapping Skill Obsolescence, Emergence, and Transition Pathways in the LLM Era

人工智能技能转变:在大语言模型时代映射技能过时、出现及转型路径

Rudra Jadhav, Janhavi Danve

机构 * Savitribai Phule Pune University(萨维特里巴伊·普纳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过SAFI指数评估职业技能的自动化可行性,揭示高风险技能、需提升技能及AI增强技能的分布,发现数学和编程自动化可行性最高,而主动倾听和阅读理解最低。

Comments 11 pages, 12 figures, 2 tables, 17 references. Code and data available at

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06814 2026-04-09 cs.LG cs.AI 86%

OmniTabBench: Mapping the Empirical Frontiers of GBDTs, Neural Networks, and Foundation Models for Tabular Data at Scale

OmniTabBench:映射GBDT、神经网络和基础模型在大规模表格数据上的经验前沿

Dihong Jiang, Ruoqi Cao, Zhiyuan Dang, Li Huang, Qingsong Zhang, Zhiyu Wang, Shihao Piao, Shenggao Zhu, Jianlong Chang, Zhouchen Lin, Qi Tian

机构 * Huawei Cloud(华为云) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OmniTabBench,最大的表格数据基准,包含3030个数据集,通过大规模实验验证各模型家族无单一优势,提供更清晰的指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18196 2026-04-09 cs.CL cs.AI 86%

Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge

对比解码缓解LLM-as-a-Judge的分数范围偏差

Yoshinari Fujinuma

机构 * Patronus AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对LLM作为评判者时的分数范围偏差问题,提出对比解码方法,通过提升与人类评判的Spearman相关性,平均提升11.7%。

Comments To appear at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05872 2026-04-08 cs.CR cs.AI cs.CL 86%

Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts

瑞士基准003:评估大语言模型在瑞士监管环境中的可靠性与对抗安全性

Fatih Uenal

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出瑞士基准003,扩展HAAS评估框架至八个维度,评估十种前沿模型在瑞士特定任务中的可靠性与对抗安全性,揭示模型在数据保护和安全方面的表现差异。

Comments 23 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05593 2026-04-08 cs.AI cs.CL 86%

Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge

标签效应:人类和LLM-as-a-Judge在信任评估中的共享启发式依赖

Xin Sun, Di Wu, Sijing Qin, Isao Echizen, Abdallah El Ali, Saku Sugawara

机构 * National Institute of Informatics (NII)(国立信息学研究所) University of Amsterdam(阿姆斯特丹大学) University of Tokyo(东京大学) Hitotsubashi University(一桥大学) Centrum Wiskunde & Informatica (CWI)(荷兰数学与计算机科学研究中心) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示人类和LLM在信任评估中受标签影响的共同机制,通过对比人类和模型的反应,发现标签对信任判断有显著偏倚,提出需警惕标签敏感的LLM评估有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05483 2026-04-08 cs.AI cs.CL 86%

Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning

我们能信任一个黑盒大语言模型吗?通过偏见扩散和多智能体强化学习进行大语言模型不可信边界检测

Xiaotian Zhou, Di Tang, Xiaofeng Wang, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GMRL-BD算法,通过知识图谱和多智能体强化学习识别大语言模型在特定主题上的偏见边界,实验表明该算法能以少量查询高效检测不可信边界,并发布包含多个流行大语言模型的标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06448 2026-04-07 cs.MA cs.AI cs.CL cs.SI 86%

When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms

当AI代理在线合谋:社交平台上基于协作LLM代理的金融欺诈风险

Qibing Ren, Zhijie Zheng, Jiaxuan Guo, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型多代理系统中集体金融欺诈的风险,通过MultiAgentFraudBench基准测试分析欺诈行为协作机制及影响因素,提出内容警告、LLM监控和群体韧性提升等缓解策略。

Comments ICLR 2026, Code is available at https://github.com/zheng977/MutiAgent4Fraud

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02527 2026-04-06 cs.LG cs.AI 86%

Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits

先发优势还是虚假开端?基于LLM初始化的多臂老虎机的理论与实证评估

Adam Bayley, Xiaodan Zhu, Raquel Aoki, Yanshuai Cao, Kevin H. Wilson

机构 * Queen’s University(女王大学) RBC Borealis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM生成的偏好在存在噪声和系统性偏差时对多臂老虎机性能的影响,发现30%以内噪声下初始化有效,40%后效果下降,50%后性能劣化。系统性偏差下,LLM初始化可能比冷启动更差,通过理论分析得出LLM初始化优于冷启动的充分条件。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02359 2026-04-06 cs.CL cs.AI 86%

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

利用LLM作为法官/陪审团推进模型响应用户表现精神病的可扩展、临床验证的安全性评估

May Lynn Reese, Markela Zeneli, Mindy Ng, Jacob Haimes, Andreea Damien, Elizabeth Stade

机构 * Apart Research Odyssean Institute London School of Economics and Political Science(伦敦政治经济学院) Stanford Institute for Human-Centered AI(斯坦福大学以人为本人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM作为法官或陪审团评估模型响应用户精神病表现的方法,开发了七项临床验证的安全标准,并展示了LLM作为法官在临床验证中的有效性。

Comments published at IASEAI 2026, preliminary work presented at GenAI4Health workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21884 2026-04-03 cs.CL cs.AI 86%

Support-Contra Asymmetry in LLM Explanations

支持-矛盾不对称性在大语言模型解释中的体现

Avinash Patil

机构 * Hewlett Packard Enterprise(慧与科技公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型生成的解释与外部模型提取的预测词汇证据之间的关系,发现正确预测的解释更倾向于引用支持性词汇,而错误预测的解释则更多引用矛盾性词汇,揭示了解释与证据之间的不对称性。

Comments 17 Pages, 12 Figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00008 2026-04-02 cs.CL cs.AI 86%

How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows

大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响

Songhee Han, Jueun Shin, Jiyoon Han, Bung-Woo Jun, Hilal Ayan Karabatman

机构 * Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29288 2026-04-01 cs.CY cs.AI cs.CL cs.HC cs.SI 86%

Sima AIunty: Caste Audit in LLM-Driven Matchmaking

Sima AIunty: LLM驱动的匹配中阶级审计

Atharva Naik, Shounok Kar, Varnika Sharma, Ashwin Rajadesingan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过实世界婚姻资料审计LLM在匹配中的阶级偏见,发现同阶级匹配评分更高,揭示现有阶级体系在AI决策中的再现,需制定文化导向的评估与干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29112 2026-04-01 cs.AI cs.CL 86%

GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification

GISTBench:通过证据基础的兴趣验证评估大语言模型的用户理解能力

Iordanis Fostiropoulos, Muhammad Rafay Azhar, Abdalaziz Sawwan, Boyu Fang, Yuchen Liu, Jiayi Liu, Hanchao Yu, Qi Guo, Jianyu Wang, Fei Liu, Xiangjun Fan

机构 * Meta Recommendation Systems (MRS)(Meta推荐系统(MRS))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GISTBench通过证据基础的兴趣验证评估大语言模型在推荐系统中理解用户的能力,提出两种新指标并验证了合成数据集的准确性。

Comments 9 figures, 20 tables; code at https://github.com/facebookresearch/GISTBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00314 2026-04-01 cs.CL cs.AI 86%

When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation

当度量标准产生分歧:自动相似性与LLM作为评判者在临床对话评估中的对比

Bian Sun, Zhenjian Wang, Orvill de la Torre, Zirui Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在临床对话评估中,LLM作为评判者与传统自动相似性度量之间的分歧,通过LoRA技术对Llama-2-7B进行领域适应,并发现自动化指标可能无法完全反映临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10780 2026-04-01 cs.CL cs.LG 86%

Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting

脚本间隙:在真实世界环境中评估LLM在印度语言本土脚本与罗马化脚本上的三线分类

Manurag Khullar, Utkarsh Desai, Poorva Malviya, Aman Dalmia, Zheyuan Ryan Shi

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在印度语言及尼泊尔语的本土脚本与罗马化脚本在真实世界中的三线分类可靠性,发现罗马化文本导致性能下降达24分,并提出基于不确定性的选择路由方法以缩小脚本差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 86%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 评测与基准 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27356 2026-03-31 cs.CL cs.AI cs.CY 86%

Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach

文化适应性可解释LLM评估用于多语言信息紊乱:一种人机协作方法

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种人机协作框架,通过本地语言标注者生成的解释性理由,评估LLM在多语言信息紊乱中的表现,提升模型的文化适应性和可解释性。

Comments 9 pages, 3 figures, 1 table. Accepted to the Information Disorder Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26830 2026-03-31 cs.LG cs.AI cs.SE 86%

A Regression Framework for Understanding Prompt Component Impact on LLM Performance

用于理解提示组件对LLM性能影响的回归框架

Andrew Lauziere, Jonathan Daugherty, Taisa Kushner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出回归框架分析提示特征对LLM性能的影响,通过回归模型解释提示部分对模型表现的解释力,发现错误示例会阻碍模型解决算术问题,正负指令对模型性能有矛盾影响。

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA 86%

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20660 2026-03-30 cs.LG cs.AI cs.SE 86%

The Dual-State Architecture for Reliable LLM Agents

双状态架构用于可靠的LLM代理

Matthew Thompson

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出双状态动作对DSAP,通过结合随机生成与确定性后置条件验证,提升LLM代理在软件工程中的可靠性,实验表明在1.2-2.1倍基准成本下可靠性提升达66个百分点。

Comments 18 pages, 2 figures, 5 tables. V2 extends and supersedes V1, introducing tri-state guard semantics, a three-level recovery hierarchy, and SWE-Bench boundary analysis

详情

展开后加载摘要…

URL PDF HTML 收藏