arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-05 至 2026-01-05 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 28 篇

2505.16587 2026-01-05 cs.SE 88%

A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems

面向自动驾驶系统场景化测试的大型语言模型应用综述

Yongqi Zhao, Ji Zhou, Dong Bi, Tomislav Mihalj, Jia Hu, Arno Eichberger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在自动驾驶系统场景化测试中的应用,系统分类了其在不同测试阶段的角色,并总结了关键特性与使用策略,同时指出了五个开放挑战和研究方向。

Comments 24 pages, 11 figures

Journal ref IEEE Transactions on Intelligent Transportation Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12869 2026-01-05 cs.CL cs.AI cs.LG 87%

Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators

通过多个评估者实现语言模型无环偏好评估

Zhengyu Hu, Jieyu Zhang, Zhihan Xiong, Alexander Ratner, Kaize Ding, Ranjay Krishna

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PGED通过多个评估者构建偏好图并去噪,解决LLM偏好评估中的循环问题,提升评估可靠性与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00268 2026-01-05 cs.CL cs.AI 86%

Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity

超越完美API:对LLM代理在现实API复杂性下的全面评估

Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo

机构 * Amazon(亚马逊公司) KAIST(韩国科学技术院) University of Pittsburgh(匹兹堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildAGTEval基准测试,用于评估LLM代理在现实API复杂性下的功能调用能力,发现无关信息复杂性显著降低强LLM性能并影响用户满意度。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04481 2026-01-05 cs.GR cs.AI cs.CL cs.MM 86%

Narrative-to-Scene Generation: An LLM-Driven Pipeline for 2D Game Environments

叙事到场景生成:一种由大语言模型驱动的2D游戏环境生成管道

Yi-Chun Chen, Arnav Jhala

机构 * Yale University(耶鲁大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种由大语言模型驱动的2D游戏环境生成方法,通过时间框架分析和空间谓词提取,实现从叙述到可玩场景的自动化生成。

Comments Camera-ready version of a paper accepted at the AIIDE 2025 Workshop on Experimental AI in Games (EXAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00596 2026-01-05 cs.CL 85%

Beyond IVR: Benchmarking Customer Support LLM Agents for Business-Adherence

超越IVR:评估符合业务规范的客户支持LLM代理的基准测试

Sumanth Balaji, Piyush Mishra, Aashraya Sachdeva, Suraj Agrawal

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JourneyBench基准测试,用于评估客户支持中遵循业务政策的LLM代理,展示动态提示代理在提升政策遵循度方面的有效性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00509 2026-01-05 cs.CR cs.LG 85%

Improving LLM-Assisted Secure Code Generation through Retrieval-Augmented-Generation and Multi-Tool Feedback

通过检索增强生成和多工具反馈改进LLM辅助的安全代码生成

Vidyut Sriram, Sawan Pandita, Achintya Lakshmanan, Aneesh Shamraj, Suman Saha

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过检索增强生成和多工具反馈,改进LLM辅助的安全代码生成,显著减少安全漏洞和缺陷率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02497 2026-01-05 cs.SE 85%

Towards Bridging Language Gaps in OSS with LLM-Driven Documentation Translation

弥合开源软件中语言鸿沟的LLM驱动文档翻译

Elijah Kayode Adejumo, Mariam Guizani, Fatemeh Vares, Brittany Johnson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM在开源技术文档翻译中的能力与挑战,通过实证评估发现LLM能提供准确的语义翻译,但结构和技术内容的保持存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00716 2026-01-05 cs.CV cs.AI 83%

Detecting Performance Degradation under Data Shift in Pathology Vision-Language Model

在病理视觉-语言模型中检测数据偏移下的性能退化

Hao Guan, Li Zhou

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究提出DomainSAT工具,通过输入数据偏移检测与输出置信度指标结合,提升病理VLM在数据偏移下的性能退化检测可靠性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00624 2026-01-05 cs.LG 81%

Do Chatbot LLMs Talk Too Much? The YapBench Benchmark

聊天机器人LLM是否过于冗长?YapBench基准测试

Vadim Borisov, Michael Gröger, Mina Mikhael, Richard H. Schreiber

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 YapBench基准测试旨在评估LLM在简洁提示下的过度生成问题,通过量化用户可见的冗余长度,揭示模型在不同任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00223 2026-01-05 cs.CL cs.AI 81%

JP-TL-Bench: Anchored Pairwise LLM Evaluation for Bidirectional Japanese-English Translation

JP-TL-Bench: 基于双向日英翻译的锚定成对LLM评估

Leonard Lin, Adam Lensenmayer

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 JP-TL-Bench通过锚定成对LLM评估方法,为日英双向翻译系统提供了一种轻量级、开放的基准,以评估翻译质量并指导模型迭代。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15206 2026-01-05 cs.CV cs.LG cs.RO 79%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00133 2026-01-05 cond-mat.mtrl-sci 78%

In context learning Foundation models for Materials Property Prediction with Small datasets

基于小数据集的材料属性预测上下文学习基础模型

Qinyang Li, Rongzhi Dong, Nicholas Miklaucic, Jeffrey Hu, Sadman Sadeed Omee, Lai Wei, Sourin Dey, Ming Hu, Jianjun Hu

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出ICL-FM模型,通过整合基于成分和结构的表示,实现小数据集下的材料属性预测,显著提升性能并降低训练成本。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00641 2026-01-05 cs.CL 77%

Probabilistic Guarantees for Reducing Contextual Hallucinations in LLMs

在LLMs中减少上下文幻觉的概率保证

Nils Rautenberg, Sven Schippkus

机构 * University of Hamburg(汉堡大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过引入LLM作为判断者和多数投票机制,提供概率保证以降低LLM在固定输入下的上下文幻觉概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00559 2026-01-05 cs.CR cs.AI 77%

Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools?

破解物联网安全:大语言模型能否超越静态分析工具?

Jason Quantrill, Noura Khajehnouri, Zihan Guo, Manar H. Alalfi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00166 2026-01-05 cs.CL 77%

Pat-DEVAL: Chain-of-Legal-Thought Evaluation for Patent Description

Pat-DEVAL: 专利描述的法律思维链评估

Yongmin Yoo, Kris W Pan

机构 * Macquarie University(麦考瑞大学) Amazon(亚马逊公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Pat-DEVAL通过法律约束的推理机制,首次提出评估专利描述的多维框架,显著提升法律合规性评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23631 2026-01-05 cs.LG cs.AI 73%

BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization

通过Bandit优化发现层次化软件工程代理:BOAD

Iris Xu, Guangtao Zeng, Zexue He, Charles Jin, Aldo Pareja, Dan Gutfreund, Chuang Gan, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) Stanford(斯坦福大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 BOAD通过多臂老虎机问题自动发现层次化多代理结构,提升软件工程任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02941 2026-01-05 cs.CV cs.AI cs.CL cs.MM 73%

GameTileNet: A Semantic Dataset for Low-Resolution Game Art in Procedural Content Generation

GameTileNet:用于程序化内容生成的低分辨率游戏艺术语义数据集

Yi-Chun Chen, Arnav Jhala

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GameTileNet通过视觉-语言对齐任务,为低分辨率游戏艺术提供语义标注,以支持基于叙事的程序化内容生成。

Comments Camera-ready version of a paper accepted for oral presentation at AIIDE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16893 2026-01-05 cs.CL cs.AI 73%

From Transformers to LLMs: A Systematic Survey of Efficiency Considerations in NLP

从Transformer到LLM:NLP中基于效率考虑的系统性综述

Wazib Ansar, Saptarsi Goswami, Amlan Chakrabarti

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了NLP中基于Transformer的LLM在效率方面的研究,探讨了数据整理、模型设计等多方面效率提升方法,并评估了多个知名NLP模型的效率和有效性。

Comments 63 pages, 5 tables and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00506 2026-01-05 cs.CL 70%

Rule-Based Approaches to Atomic Sentence Extraction

基于规则的方法用于原子句子提取

Lineesha Kamana, Akshita Ananda Subramanian, Mehuli Ghosh, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 70%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00635 2026-01-05 cs.SE 69%

SEMODS: A Validated Dataset of Open-Source Software Engineering Models

SEMODS: 一个经过验证的开源软件工程模型数据集

Alexandra González, Xavier Franch, Silverio Martínez-Fernández

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(comments)

AI总结 SEMODS是一个包含3427个经过验证的开源软件工程模型的数据集,通过自动收集和人工标注结合大语言模型辅助,为软件开发生命周期中的任务提供标准化评估结果支持多种应用。

Comments Accepted at the 3rd ACM international conference on AI Foundation Models and Software Engineering (FORGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19936 2026-01-05 cs.CV 67%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00516 2026-01-05 cs.LG cs.AI 62%

Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI

轨迹守护 -- 一种轻量级、序列感知的模型,用于代理AI中的实时异常检测

Laksh Advani

机构 * Laksh Advani

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 轨迹守护通过对比学习和重建学习,实现对代理AI中任务轨迹对齐和序列有效性的联合检测,提升实时异常检测性能。

Comments Accepted to AAAI Trustagent 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00787 2026-01-05 cs.CL 57%

Adapting Natural Language Processing Models Across Jurisdictions: A pilot Study in Canadian Cancer Registries

在不同司法管辖区适应自然语言处理模型:加拿大癌症登记处的试点研究

Jonathan Simkin, Lovedeep Gondara, Zeeshan Rizvi, Gregory Doyle, Jeff Dowden, Dan Bond, Desmond Martin, Raymond Ng

机构 * School of Population and Public Health University of British Columbia(流行病学与公共卫生学院 首都大学) Newfoundland & Labrador Health Services(纽芬兰与拉布拉多省卫生服务) Data Science Institute University of British Columbia(数据科学研究所 首都大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本研究通过结合两种模型,提高了癌症登记处NLP的性能,减少了遗漏癌症并提升了错误覆盖,展示了跨司法管辖区适应的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00481 2026-01-05 cs.NI cs.AI 57%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00286 2026-01-05 cs.CV cs.AI 57%

Towards Automated Differential Diagnosis of Skin Diseases Using Deep Learning and Imbalance-Aware Strategies

利用深度学习和不平衡意识策略实现皮肤疾病的自动化差分诊断

Ali Anaissi, Ali Braytee, Weidong Huang, Junaid Akram, Alaa Farhat, Jie Hua

机构 * University of Technology Sydney, Australia(悉尼科技大学,澳大利亚) University of Sydney, Australia(悉尼大学,澳大利亚) Shaoyang University, China(邵阳学院,中国)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本研究提出基于深度学习和不平衡意识策略的皮肤疾病自动化诊断模型,实现了87.71%的准确率,为皮肤病诊断提供支持。

Comments The 23rd Australasian Data Science and Machine Learning Conference (AusDM'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23400 2026-01-05 cs.SI cs.LG 57%

Quantum Intelligence Meets BD-RIS-Enabled AmBC: Challenges, Opportunities, and Practical Insights

量子智能遇见BD-RIS赋能的AmBC:挑战、机遇与实用洞察

Abd Ullah Khan, Uman Khalid, Trung Q. Duong, Hyundong Shin

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文探讨了BD-RIS在AmBC中的应用,分析了其挑战与机遇,并通过量子增强的机器学习模型提升波束成形性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00156 2026-01-05 cs.CV 50%

Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions

聚焦区域面部:为任意选定的面部区域生成细粒度多属性描述

Kaiwen Zheng, Junchen Fu, Songpei Xu, Yaoqing He, Joemon M. Jose, Han Hu, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Shandong University(山东大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出Focal-RegionFace模型,通过多阶段微调实现对任意面部区域的细粒度多属性描述生成,提升面部状态分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏