arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2601.15738 2026-04-01 cs.NE 89%

EvoDR: Evolving Dispatching Rules via Large Language Model for Dynamic Flexible Assembly Flow Shop Scheduling

EvoDR:基于大语言模型的动态柔性装配流水车间调度的进化调度规则

Junhao Qiu, Haoyang Zhuang, Fei Liu, Jianjun Liu, Qingfu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EvoDR框架,利用大语言模型的语义理解能力,通过双专家共演化机制生成适应动态特征的调度规则,实验表明其在降低平均延误和鲁棒性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28374 2026-03-31 cs.CY 89%

Using Games to Learn How Large Language Models Work

通过游戏学习大语言模型的工作原理

Allison Chen, Isabella Pu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出两款游戏,通过游戏化方式展示大语言模型的工作原理与数据使用方法,旨在提升AI素养。

Comments CHI Conference on Human Factors in Computing Systems Workshop on Data Literacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26142 2026-03-31 cs.HC 89%

Simulating Novice Students Using Machine Unlearning and Relearning in Large Language Models

利用机器去学习和再学习在大语言模型中模拟新手学生

Jiajia Song, Zhihan Guo, Jionghao Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于机器去学习的知识级模拟方法,通过转换知识丰富的LLM为新手级AI学生,评估其通过教学对话重新学习知识的能力,揭示了学生行为随时间的变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 89%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01754 2026-03-26 cs.CL cs.AI cs.LG 89%

Evaluation of Large Language Models via Coupled Token Generation

通过耦合标记生成评估大语言模型

Nina Corvelo Benz, Stratis Tsirtsis, Eleni Straitouri, Ivi Chatzi, Ander Artola Velasco, Suhas Thejaswi, Manuel Gomez-Rodriguez

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) Hasso Plattner Institute(哈索·platzer研究所) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Aalto University(阿尔托大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过耦合自回归生成评估大语言模型,发现其在基准数据集和人机对比中产生不同排名,表明生成过程中的随机性可能影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 89%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14565 2026-03-17 cs.DL 89%

Can Large Language Models Evaluate Grant Proposal Quality? Revisiting the Wennerås and Wold Peer Review Data

大型语言模型能否评估项目申请质量?重新审视文纳斯和沃尔德同行评审数据

Ulf Sandström, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了大型语言模型在评分项目申请方面的准确性,发现其与专家评分的相关性较低,但可能在筛选或打破平局时有应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17113 2026-03-13 stat.ME stat.CO 89%

A systematic assessment of Large Language Models for constructing two-level fractional factorial designs

对大型语言模型构建两级分数因子设计的系统评估

Alan R. Vazquez, Kilian M. Rother, Marco V. Charles-Gonzalez

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文系统评估了GPT和Gemini模型在构建不同规模的两级分数因子设计中的性能,展示了其在优化设计生成中的有效性。

Comments 31 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03114 2026-03-12 cs.SE 89%

PromCopilot: Simplifying Prometheus Metric Querying in Cloud Native Online Service Systems via Large Language Models

PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询

Chenxi Zhang, Bicheng Zhang, Dingyu Yang, Xin Peng, Miao Chen, Senyu Xie, Gang Chen, Wei Bi, Wei Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07602 2026-03-12 cs.SE 89%

OODEval: Evaluating Large Language Models on Object-Oriented Design

OODEval: 对象导向设计上评估大型语言模型

Bingxu Xiao, Yunwei Dong, Yiqi Tang, Manqing Zhang, Yifan Zhou, Chunyan Ma, Yepang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

AI总结 OODEval评估了29个大型语言模型在面向对象设计任务上的表现,揭示了LLMs在语义上的不足,并提出了CLUE度量集以评估类图生成质量。

Comments 32 pages,8 figures,10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 89%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04306 2026-03-05 stat.CO 89%

Theory Discovery in Social Networks: Automating ERGM Specification with Large Language Models

社交网络中的理论发现:利用大语言模型自动化ERGM规范

Yidan Sun, Mayank Kejriwal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02185 2026-03-03 cs.CV cs.AI cs.CL cs.LG 89%

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索

Yu Zeng, Wenxuan Huang, Zhen Fang, Shuang Chen, Yufan Shen, Yishuo Cai, Xiaoman Wang, Zhenfei Yin, Lin Chen, Zehui Chen, Shiting Huang, Yiming Zhao, Xu Tang, Yao Hu, Philip Torr, Wanli Ouyang, Shaosheng Cao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06939 2026-02-27 cs.SE 89%

FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks

FeedbackEval: 一个用于评估大型语言模型在反馈驱动的代码修复任务中的基准

Dekun Dai, MingWei Liu, Anji Li, Jialun Cao, Yanlin Wang, Chong Wang, Xin Peng, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 FeedbackEval通过系统性基准评估LLMs在反馈驱动的代码修复任务中的表现,揭示了不同反馈类型和提示结构对修复效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18935 2026-02-24 cs.DL cs.SE 89%

Responsible Intelligence in Practice: A Fairness Audit of Open Large Language Models for Library Reference Services

实践中的负责任智能:开放大型语言模型在图书馆参考服务中的公平性审计

Haining Wang, Jason Clark, Angelica Peña

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了三个开源大型语言模型在图书馆参考服务中的公平性,发现无显著种族差异,但存在轻微性别差异,强调持续监测的重要性。

Comments Invited chapter for the edited volume Artificial Intelligence and Social Justice Intersections in Library and Information Studies: Challenges and Opportunities (Emerald Group Publishing, in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17791 2026-02-23 cs.CY 89%

The Digital Divide in Generative AI: Evidence from Large Language Model Use in College Admissions Essays

生成式AI的数字鸿沟:来自大学录取文书使用大型语言模型的证据

Jinsook Lee, Conrad Borchers, AJ Alvero, Thorsten Joachims, Rene F. Kizilcec

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了生成式AI在大学录取文书中的使用差异及其对录取结果的影响,发现低社会经济地位学生更依赖AI写作工具,但其录取成功率下降更明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02129 2026-02-20 cs.CE 89%

Benchmarking Large Language Models for Polymer Property Predictions

评估大型语言模型在聚合物性质预测中的表现

Sonakshi Gupta, Akhlak Mahmood, Shivank Shukla, Rampi Ramprasad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了LLM在聚合物性质预测中的表现,发现LLaMA-3在性能上优于GPT-3.5,但整体预测准确性和效率仍低于传统方法,且单任务学习更有效。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06428 2026-02-18 cs.SE cs.CR 89%

Large Language Models for Secure Code Assessment: A Multi-Language Empirical Study

用于安全代码评估的大型语言模型:多语言实证研究

Kohei Dozono, Tiago Espinha Gasiba, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了多语言环境下大型语言模型在安全代码评估中的有效性,通过实验发现GPT-4o在漏洞检测和CWE分类中表现最佳,并开发了CODEGUARDIAN工具提升开发人员的漏洞检测效率。

Comments Accepted for publication at the 7th International Workshop on Deep Learning for Testing and Testing for Deep Learning (DeepTest 2026), co-located with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15063 2026-02-18 cs.RO cs.HC 89%

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13941 2026-02-17 cs.HC 89%

Avoiding Social Judgment, Seeking Privacy: Investigating why Mothers Shift from Facebook Groups to Large Language Models

避免社会评判,寻求隐私:探究母亲为何从Facebook群组转向大型语言模型

Shayla Sharmin, Sadia Afrin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨母亲为何从Facebook群组转向LLM,发现社会评判和隐私需求驱动这一转变,LLM提供即时且安全的支持替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11588 2026-02-13 cs.CV 89%

A Large Language Model for Disaster Structural Reconnaissance Summarization

一种用于灾害结构侦察总结的大型语言模型

Yuqing Gao, Guanren Zhou, Khalid M. Mosalam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出一种基于大型语言模型的灾害结构侦察总结框架,通过整合视觉数据与文本元数据,提升灾后结构评估的效率和准确性。

Comments 8 pages, 4 figures. Presented at the 18th World Conference on Earthquake Engineering (18WCEE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11022 2026-02-12 cs.IT math.IT 89%

Information Abstraction for Data Transmission Networks based on Large Language Models

基于大语言模型的数据传输网络中的信息抽象

Haoyuan Zhu, Haonan Hu, Jie Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出信息抽象度(DIA)作为衡量信息压缩与语义保留的度量,通过大语言模型引导的视频传输实验,展示了DIA在降低传输开销和保持语义保真方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10119 2026-02-12 cs.LG cs.AI cs.CL cs.CY 89%

Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke

大型语言模型预测急性缺血性中风后的功能结局

Anjali K. Kapoor, Anton Alyakin, Jin Vivian Lee, Eunice Yang, Annelene M. Schulze, Krithik Vishwanath, Jinseok Lee, Yindalon Aphinyanaphongs, Howard Riina, Jennifer A. Frontera, Eric Karl Oermann

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型在预测急性缺血性中风后功能结局中的有效性,发现微调后的Llama模型在准确率上表现优异,可替代传统结构化数据方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08192 2026-02-10 cs.SE 89%

Adoption of Large Language Models in Scrum Management: Insights from Brazilian Practitioners

大语言模型在Scrum管理中的应用:来自巴西实践者的洞察

Mirko Perkusich, Danyllo Albuquerque, Allysson Allex Araújo, Matheus Paixão, Rohit Gheyi, Marcos Kalinowski, Angelo Perkusich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了大语言模型在Scrum管理中的应用,发现其在提升生产率和减少手动工作方面有显著益处,但同时也面临输出准确性和保密性等风险。

Comments Accepted for publication at the 27th International Conference on Agile Software Development (XP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05401 2026-02-06 cs.CR 89%

BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models

BadTemplate: 一种通过聊天模板进行的无训练后门攻击针对大语言模型

Zihan Wang, Hongwei Li, Rui Zhang, Wenbo Jiang, Guowen Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 BadTemplate通过在系统提示中植入恶意指令实现无训练后门攻击,有效提升攻击成功率并引发严重安全风险。

Comments This paper includes biased content that may be disturbing or offensive to certain readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04358 2026-02-05 cs.SE 89%

Generative AI in Systems Engineering: A Framework for Risk Assessment of Large Language Models

生成式AI在系统工程中的应用:大型语言模型风险评估框架

Stefan Otten, Philipp Reis, Philipp Rigoll, Joshua Ransiek, Tobias Schürmann, Jacob Langner, Eric Sax

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于评估大型语言模型在系统工程中应用风险的框架,通过自主性和影响两个维度分类,帮助组织实现安全透明的部署。

Comments Accepted at IEEE SysCon 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02712 2026-02-05 cs.CL cs.AI cs.LG 89%

Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks

时间到不一致:大型语言模型对对抗攻击鲁棒性的生存分析

Yubo Li, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过生存分析方法评估大型语言模型在多轮对话中的鲁棒性,发现语义漂移对不一致风险的影响,并提出轻量级模型用于提前检测失败对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06276 2026-02-04 cs.SE cs.CR 89%

Automated Generation of Accurate Privacy Captions From Android Source Code Using Large Language Models

基于大语言模型的Android源代码中准确隐私描述的自动化生成

Vijayanta Jain, Sepideh Ghanavati, Sai Teja Peddinti, Collin McMillan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出PCapGen方法,利用大语言模型自动从Android源代码生成准确、简洁的隐私描述,有效解决现有方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15567 2026-02-03 cs.CR cs.SE 89%

MalCVE: Malware Detection and CVE Association Using Large Language Models

MalCVE: 使用大语言模型进行恶意软件检测与CVE关联

Eduard Andrei Cristea, Petter Molnes, Jingyue Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 MalCVE利用大语言模型检测恶意软件并关联CVE,实现高准确率的恶意软件识别和漏洞关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21877 2026-02-03 cs.NE 89%

Evolution of Benchmark: Black-Box Optimization Benchmark Design through Large Language Model

基准的演变:通过大语言模型进行黑盒优化基准设计

Chen Wang, Sijie Ma, Zeyuan Ma, Yue-Jiao Gong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EoB,一种基于大语言模型的自动黑盒优化基准设计师,通过双目标优化提升基准的多样性和算法区分能力,适用于多维应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏