arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2605.17281 2026-05-19 cs.SE cs.AI 91%

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench: LLM Agents能否保持观察契约?

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出ContractBench基准测试,用于评估LLM代理在保持观察契约(如时间有效性及字节完整性)方面的能力,发现现有模型在该任务上仍存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13368 2026-05-14 cs.CL 91%

What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation

LLM精细化实际提升了什么?对文档级文学翻译的系统研究

Shaomu Tan, Dawei Zhu, Ke Tran, Michael Denkowski, Sony Trenous, Bill Byrne, Leonardo Ribeiro, Felix Hieber

机构 * University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本文系统研究了文档级文学翻译中LLM精细化的效果,发现文档级MT后接段级精细化能带来稳定提升,而文档级精细化效果有限。通用精细化提示优于特定错误提示和评估后精细化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 91%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05711 2026-05-08 cs.CV cs.GR cs.HC cs.LG cs.MM 91%

Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling

闭环:通过LLM-RL耦合实现统一的3D场景生成与沉浸式交互

Anh H. Vo, Sungyo Lee, Phil-Joong Kim, Soo-Mi Choi, Yong-Guk Kim

机构 * Department of Computer Engineering, Sejong University(全州大学计算机工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种统一框架,通过LLM-RL耦合实现语言驱动的3D场景生成与沉浸式交互的闭环,提升互动多媒体系统的适应性和沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 91%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23730 2026-04-28 cs.AI 91%

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

对日本律师考试写作任务中LLM开放式法律推理的专家评估

Jungmin Choi, Keisuke Sakaguchi, Hiroaki Yamada

机构 * Tohoku University(东大) Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次提出评估LLM在日本法律领域开放式法律推理能力的数据集,通过法律专家对模型输出的评估揭示了法律推理的局限性与挑战。

Comments 5 pages, Accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23255 2026-04-28 cs.HC cs.AI cs.CY 91%

Scalable LLM-based Coding of Dialogue in Healthcare Simulation: Balancing Coding Performance, Processing Time, and Environmental Impact

可扩展的基于LLM的医疗模拟对话编码:在编码性能、处理时间和环境影响之间取得平衡

Kiyoshige Garces, Gloria Milena Fernandez-Nieto, Linxuan Zhao, Sachini Samaraweera, Dragan Gasevic, Roberto Martinez-Maldonado, Vanessa Echeverria

机构 * RMIT University(皇家墨尔本理工大学) Monash University(墨尔本大学) Adelaide University(阿德莱德大学) The University of Hong Kong(香港大学) ESPOL University(ESPOL大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文探讨了如何通过优化提示设计和批量策略,在医疗模拟复盘中平衡编码准确性、处理时间和环境影响,展示了LLM在对话分析中的可行性及实际应用价值。

Comments 12 pages, 6 figures. Accepted at the Learning at Scale Conference (L@S) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 91%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17178 2026-04-21 cs.CL 91%

Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation

认知驱动的LLM用于情绪支持对话中认知扭曲的诊断与干预

Lin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Macau, Macao SAR, China(澳门城市大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CogBiasESC数据集和CoPoLLM框架,用于提升LLM在情绪支持对话中识别和干预认知扭曲的能力,实验显示其在诊断准确性和安全性方面优于现有方法。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16542 2026-04-21 cs.CR cs.CL 91%

TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

TWGuard:LLM安全护栏在本地化语言环境中的案例研究

Hua-Rong Chu, Kuan-Chun Wang, Yao-Te Huang

机构 * Chunghwa Telecom Laboratories(中华电信实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过定制数据集优化语言环境特定的LLM安全护栏模型,以解决语言和文化差异导致的性能与实际效果差距问题,TWGuard在F1指标上提升显著,并在误报率上表现优异。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14969 2026-04-17 cs.AI 91%

Discovering Novel LLM Experts via Task-Capability Coevolution

通过任务能力共进化发现新型大语言模型专家

Andrew Dai, Boris Meinardus, Ciaran Regan, Yingtao Tian, Yujin Tang

机构 * Sakana AI

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AC/DC框架,通过模型合并和合成数据生成实现大语言模型与任务的共进化,发现超越大模型能力的新型LLM,无需显式优化基准,在多智能体最佳N选择中提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL 91%

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12545 2026-04-15 cs.AI cs.CY 91%

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理

Wanchun Ni, Jiugeng Sun, Yixian Liu, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。

Comments To appear in the CHI 2026 Workshop on PoliSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08704 2026-03-10 cs.AI 91%

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI

Akshay Gulati, Kanha Singhania, Tushar Banga, Parth Arora, Anshul Verma, Vaibhav Kumar Singh, Agyapal Digra, Jayant Singh Bisht, Danish Sharma, Varun Singla, Shubh Garg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。

Comments 12 pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03827 2026-01-30 cs.AI 91%

What Would an LLM Do? Evaluating Large Language Models for Policymaking to Alleviate Homelessness

LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用

Pierre Le Coz, Jia An Liu, Debarun Bhattacharjya, Georgina Curto, Serge Stinckwich

机构 * United Nations University Institute in Macau(联合国大学澳门研究所) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。

Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18302 2025-11-25 cs.AI 91%

The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comprehensive Empirical Analysis of the CHC-LLM Incompatibility

人类认知框架在大语言模型评估中的灾难性悖论:对CHC-LLM不兼容性的全面实证分析

Mohan Reddy

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本研究揭示了人类认知框架与大语言模型评估之间的不兼容性悖论,指出模型在结晶知识任务上的低准确率与高IQ评分的矛盾,提出发展原生机器认知评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15899 2025-10-21 cs.AR cs.LG 91%

LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models

Kiran Thorat, Jiahui Zhao, Yaotian Liu, Amit Hasan, Hongwu Peng, Xi Xie, Bin Lei, Caiwen Ding

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19510 2025-05-30 cs.CL 91%

LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical Study

Dongil Yang, Minjin Kim, Sunghwan Kim, Beong-woo Kwak, Minjun Park, Jinseok Hong, Woontack Woo, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Metaverse, KAIST(元宇宙研究生院,韩国科学技术院) Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13044 2025-05-30 cs.CL 91%

Do we still need Human Annotators? Prompting Large Language Models for Aspect Sentiment Quad Prediction

Nils Constantin Hellwig, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group University of Regensburg(媒体信息学组德国雷根萨大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13038 2025-04-18 cs.CY cs.CL 91%

How Large Language Models Are Changing MOOC Essay Answers: A Comparison of Pre- and Post-LLM Responses

Leo Leppänen, Lili Aunimo, Arto Hellas, Jukka K. Nurminen, Linda Mannila

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09008 2025-01-15 cs.CL 91%

LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models

Xiaohao Yang, He Zhao, Dinh Phung, Wray Buntine, Lan Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments Forthcoming in Transactions of the Association for Computational Linguistics (TACL) published by MIT Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22660 2024-10-31 cs.CL 91%

Linguistics Theory Meets LLM: Code-Switched Text Generation via Equivalence Constrained Large Language Models

Garry Kuwanto, Chaitanya Agarwal, Genta Indra Winata, Derry Tanti Wijaya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04927 2024-10-03 cs.CL eess.AS 91%

Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue

Junkai Wu, Xulin Fan, Bo-Ru Lu, Xilin Jiang, Nima Mesgarani, Mark Hasegawa-Johnson, Mari Ostendorf

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(title);分类 cs.CL

Comments Accepted to IEEE SLT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12100 2024-05-21 cs.CL 91%

DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical Correction

Hao Chen, Biaojie Zeng, Xin Lin, Liang He, Aimin Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01230 2024-04-02 cs.CL 91%

LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models

Yadong Zhang, Shaoguang Mao, Tao Ge, Xun Wang, Adrian de Wynter, Yan Xia, Wenshan Wu, Ting Song, Man Lan, Furu Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00812 2024-01-09 cs.CL 91%

If LLM Is the Wizard, Then Code Is the Wand: A Survey on How Code Empowers Large Language Models to Serve as Intelligent Agents

Ke Yang, Jiateng Liu, John Wu, Chaoqi Yang, Yi R. Fung, Sha Li, Zixuan Huang, Xu Cao, Xingyao Wang, Yiquan Wang, Heng Ji, Chengxiang Zhai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09693 2023-12-18 cs.AI 91%

Prompting Large Language Models for Topic Modeling

Han Wang, Nirmalendu Prakash, Nguyen Khoi Hoang, Ming Shan Hee, Usman Naseem, Roy Ka-Wei Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.AI

Comments 6 pages, 3 figures, IEEE International Conference on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07223 2026-08-11 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 91%

TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories

TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估

Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang, Yun-Nung Chen

机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22969 2026-07-28 cs.IR 新提交 91%

When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness

少样本提示何时起作用?跨模型规模、架构和输出解析鲁棒性的样本数量效应的系统实证研究

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究少样本提示中样本数量与模型规模、架构及输出格式合规性对分类性能的影响。通过对五个LLM在六种样本数量配置下研究,发现样本数量与分类性能关系非单调、非普遍且不能仅由模型规模预测,还纠正了影响Llama 3.3 70B性能的解析工件。

Comments 12 pages, 4 figures, 8 tables. Code available at https://github.com/a-dwivedi/few-shot-prompting-study

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20355 2026-08-24 cs.CL cs.AI 新提交 91%

ExpertIVS: Sociological Expert Driven Individual Value Simulation in Large Language Models

ExpertIVS:大型语言模型中由社会学专家驱动的个体价值观模拟

Zhen Wang, Yuqi Ren, Yuehan Cui, Hongxiang Wang, Jianxiang Peng, Zhaoxia Zhang, Bingkun Zhu, Tongxuan Zhang, Dezhi Tong, Deyi Xiong

机构 * The International Joint Institute of Tianjin University(天津大学国际联合研究院) Tianjin University(天津大学) TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) National Governance Institute, Tianjin Normal University(天津师范大学国家治理研究院) College of Computer and Information Engineering, Tianjin Normal University(天津师范大学计算机与信息工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究针对大型语言模型社会模拟中个体价值观建模的不足,提出ExpertIVS框架,通过14个社会学专家智能体重构个体画像,经多国家多人群实验验证其在价值观还原、泛化等方面性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏