arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-21 至 2025-11-21 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 28 篇

2511.15958 2025-11-21 cs.AI cs.CL 91%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16122 2025-11-21 cs.CL cs.AI 88%

ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models

基于集成学习的提示优化:大型语言模型的提示优化

Qing Zhang, Bing Xu, Xudong Zhang, Yifan Shi, Yang Li, Chen Zhang, Yik Chung Wu, Ngai Wong, Yijie Chen, Hong Dai, Xiansen Chen, Mian Zhang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ELPO通过集成学习方法提升大型语言模型的提示优化效果,实现更准确和稳健的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 88%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08764 2025-11-21 cs.IR cs.CL 87%

Evaluation of the phi-3-mini SLM for identification of texts related to medicine, health, and sports injuries

对phi-3-mini SLM在识别医学、健康和运动损伤相关文本中的评估

Chris Brogly, Saif Rjaibi, Charlotte Liang, Erica Lam, Edward Wang, Adam Levitan, Sarah Paleczny, Michael Cusimano

专题命中 评测与基准 :SLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文评估了phi-3-mini SLM在识别医学、健康和运动损伤相关文本中的表现,发现其在不同过滤条件下与人类评估者评分的相关性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06017 2025-11-21 cs.CL 85%

AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search

AgentSwift: 通过价值引导的分层搜索高效设计LLM代理

Yu Li, Lehui Li, Zhihao Wu, Qingmin Liao, Jianye Hao, Kun Shao, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AgentSwift通过价值引导的分层搜索高效设计LLM代理,实现8.34%的性能提升。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16131 2025-11-21 cs.DB cs.AI 85%

AskDB: An LLM Agent for Natural Language Interaction with Relational Databases

AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理

Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê

机构 * IT Operations, Mantu Group(Mantu集团信息技术部) Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AskDB是一种基于大型语言模型的代理,通过自然语言实现对关系数据库的数据分析和管理操作,提供统一且智能的交互体验。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15720 2025-11-21 cs.AI 83%

Automated Hazard Detection in Construction Sites Using Large Language and Vision-Language Models

利用大语言和视觉-语言模型进行施工工地自动危险检测

Islem Sahraoui

机构 * University of Houston Cullen College of Engineering Department of Civil and Environmental Engineering(德克萨斯大学休斯顿分校库伦工程学院土木与环境工程系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本研究利用大语言和视觉-语言模型,通过分析文本和图像数据,提高施工工地的安全隐患检测效率。

Comments Master thesis, University of Houton

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04470 2025-11-21 cs.CV cs.AI 79%

DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks

DiffuSyn Bench: 评估视觉-语言模型在现实世界复杂性中的能力,通过扩散生成的合成基准

Haokun Zhou, Yipeng Hong

机构 * Imperial College London(伦敦帝国理工学院) Shanghai University(上海大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 DiffuSyn Bench通过扩散生成的合成基准评估视觉-语言模型在现实世界复杂性中的能力,揭示其区分AI与人类图像的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20039 2025-11-21 cs.CL cs.LG 79%

AutoJudge: Judge Decoding Without Manual Annotation

AutoJudge: 无需人工标注的判断解码

Roman Garipov, Fedor Velikonivtsev, Ivan Ermakov, Ruslan Svirschevski, Vage Egiazarian, Max Ryabinin

机构 * HSE University(俄罗斯高等经济学院) Yandex IST Austria(国际应用数学研究所) Together AI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 AutoJudge通过任务特定的损失性推测解码加速LLM推理,无需人工标注,实现显著速度提升并牺牲少量准确性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07279 2025-11-21 cs.CL cs.AI 79%

MAQuA: Adaptive Question-Asking for Multidimensional Mental Health Screening using Item Response Theory

MAQuA:基于项目反应理论的多维心理健康筛查自适应提问框架

Vasudha Varadarajan, Hui Xu, Rebecca Astrid Boehme, Mariam Marlan Mirstrom, Sverker Sikstrom, H. Andrew Schwartz

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Stony Brook University(石溪大学) Aarhus University(奥胡斯大学) Department of Psychology, Lund University(吕勒欧大学心理学系) College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MAQuA通过结合IRT和因子分析,实现多维心理健康筛查的自适应提问,有效减少评估问题数量,提升诊断效率和患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23811 2025-11-21 cs.CL cs.SI 77%

Did ChatGPT or Copilot use alter the style of internet news headlines? A time series regression analysis

ChatGPT 或 Copilot 是否改变了网络新闻标题的风格?一项时间序列回归分析

Chris Brogly, Connor McElroy

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过时间序列回归分析,探讨ChatGPT和Copilot是否对网络新闻标题风格产生影响,发现部分NLP指标显示有限的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15997 2025-11-21 cs.AI cs.MM 77%

Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art

Sensorium Arc:面向海洋数据探索与交互生态艺术的AI代理系统

Noah Bissell, Ethan Paley, Joshua Harrison, Juliano Calil, Myungin Lee

机构 * Immersive Media Design University of Maryland College Park(沉浸媒体设计大学马里兰大学学院公园分校) Center for the Study of the Force Majeure University of California, Santa Cruz(重大研究机构加州大学圣克鲁兹分校) Virtual Planet Technologies(虚拟星球技术)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Sensorium Arc通过AI代理将海洋数据转化为生动叙事,结合科学洞察与生态诗意,实现沉浸式环境数据探索与交互生态艺术

Comments (to appear) NeurIPS 2025 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15168 2025-11-21 cs.SE cs.AI 77%

Finetuning LLMs for Automatic Form Interaction on Web-Browser in Selenium Testing Framework

微调大型语言模型以在Selenium测试框架中实现自动表单交互

Nguyen-Khang Le, Hiep Nguyen, Ngoc-Minh Nguyen, Son T. Luu, Trung Vo, Quan Minh Bui, Shoshin Nomura, Le-Minh Nguyen

机构 * Japan Advanced Institute of Science and Technology(日本先进科学科技研究所) Amifiable Inc.(Amifiable公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM的表单交互测试方法,通过合成和人工标注的数据集训练,显著优于现有基线模型,为网页测试研究提供了新方向和资源。

Comments Published in the Proceedings of KSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16267 2025-11-21 cs.CL cs.AI 76%

From Confidence to Collapse in LLM Factual Robustness

从信心到崩溃:大语言模型事实鲁棒性的研究

Alina Fastowski, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 本研究提出了一种通过分析令牌分布熵和温度缩放敏感性来评估大语言模型事实鲁棒性的新方法,并通过实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16245 2025-11-21 cs.HC 75%

GazeInterpreter: Parsing Eye Gaze to Generate Eye-Body-Coordinated Narrations

GazeInterpreter: 解析眼动以生成眼-身体协调的叙述

Qing Chang, Zhiming Hu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GazeInterpreter通过解析眼动数据生成眼-身体协调的叙述,提升人类行为理解的准确性与效率。

Comments Accepted to AAAI 2026. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15870 2025-11-21 cs.CE cs.AI 74%

AquaSentinel: Next-Generation AI System Integrating Sensor Networks for Urban Underground Water Pipeline Anomaly Detection via Collaborative MoE-LLM Agent Architecture

AquaSentinel:下一代集成传感器网络的AI系统,通过协作MoE-LLM代理架构实现城市地下供水管道异常检测

Qiming Guo, Bishal Khatri, Wenbo Sun, Jinwen Tang, Hua Zhang, Wenlu Wang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 AquaSentinel通过协作MoE-LLM代理架构实现城市地下供水管道异常检测,结合物理信息和稀疏传感技术,以低成本实现高精度的实时监测。

Comments 7 pages, 1 figure, 2 tables, Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI 2026), IAAI Deployed Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24767 2025-11-21 stat.AP cs.AI 70%

A survey of using EHR as real-world evidence for discovering and validating new drug indications

电子健康记录作为真实世界证据用于发现和验证新药物适应症的综述

Nabasmita Talukdar, Xiaodan Zhang, Shreya Paithankar, Hui Wang, Bin Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了利用电子健康记录发现和验证新药物适应症的方法和技术挑战,强调了大型语言模型和目标试验模拟的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07441 2025-11-21 cs.HC cs.AI cs.CY 70%

Automatically Detecting Online Deceptive Patterns

自动检测在线欺骗模式

Asmit Nayak, Shirley Zhang, Yash Wani, Rishabh Khandelwal, Kassem Fawaz

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoBot通过视觉模型和语言模型结合,自动检测网络中的欺骗模式,提供三个应用场景以帮助用户、开发者和研究人员应对在线欺骗问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16231 2025-11-21 cs.LG 70%

Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective

Pass@k指标用于RLVR:探索的诊断工具,而非目标

Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文分析了pass@k指标作为强化学习中探索诊断工具的优劣,指出其作为优化目标的局限性,并提出鼓励高效探索的机制作为替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16048 2025-11-21 cs.RO cs.AI cs.HC 70%

Semantic Glitch: Agency and Artistry in an Autonomous Pixel Cloud

语义裂隙:自主像素云中的代理与艺术性

Qing Zhang, Jing Huang, Mingyang Xu, Jun Rekimoto

机构 * The University of Tokyo(东京大学) Tokyo University of the Arts(东京艺术大学) Keio University(庆应大学) SONY CSL Kyoto(索尼 CSL 京都)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出语义裂隙,通过多模态大语言模型实现自主导航,展示低 fidelity方法在创造不完美但富有艺术性的机器人同伴中的应用。

Comments NeurIPS 2025 Creative AI Track, The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15759 2025-11-21 cs.CR cs.AI 70%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL 70%

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15757 2025-11-21 cs.SE 69%

Rethinking Kernel Program Repair: Benchmarking and Enhancing LLMs with RGym

重新思考内核程序修复:通过RGym基准测试和增强LLMs

Kareem Shehada, Yifan Wu, Wyatt D. Feng, Adithya Iyer, Gryphon Kumfert, Yangruibo Ding, Zhiyun Qian

专题命中 评测与基准 :large language model(abstract);language model(abstract);LLM(comments)

AI总结 本研究提出RGym框架,通过改进的定位技术和提示结构,提升LLMs在Linux内核程序修复中的性能和效率。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14945 2025-11-21 cs.CV 67%

Unsupervised Discovery of Long-Term Spatiotemporal Periodic Workflows in Human Activities

无监督发现人类活动中的长期时空周期性工作流

Fan Yang, Quanting Xie, Atsunori Moteki, Shoichi Masui, Shan Jiang, Kanji Uchino, Yonatan Bisk, Graham Neubig

机构 * Fujitsu Research of America, USA(美国富士通研究机构) Fujitsu Limited, Japan(日本富士通有限公司) Carnegie Mellon University, USA(美国卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出首个包含长期周期性工作流的基准,通过轻量级基线实现无监督检测和异常检测,显著优于现有方法并具备实际部署优势。

Comments accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09109 2025-11-21 cs.CV cs.CL 57%

CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation

CAIRe:通过检索增强评估进行图像文化归因

Arnav Yayavaram, Siddharth Yayavaram, Simran Khanuja, Michael Saxon, Graham Neubig

机构 * BITS Pilani(比斯·皮兰大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 CAIRe通过检索增强评估方法,评估图像在不同文化标签下的相关性,有效衡量文化偏见,提升跨文化公平性。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16347 2025-11-21 cs.CR cs.CY cs.RO 50%

The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks

具身AI的肖申克救赎:理解与评估间接环境劫持

Chunyang Li, Zifeng Kang, Junwei Zhang, Zhuo Ma, Anda Cheng, Xinghua Li, Jianfeng Ma

机构 * Xidian University(西安电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种新型的间接环境劫持攻击,通过环境注入的恶意提示劫持具身AI,并设计了自动攻击生成和基准评估框架,评估结果显示其在多个任务场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15745 2025-11-21 cs.CR 50%

Structured Extraction of Vulnerabilities in OpenVAS and Tenable WAS Reports Using LLMs

基于LLM的OpenVAS和Tenable WAS报告漏洞结构化提取

Beatriz Machado, Douglas Lautert, Cristhian Kapelinski, Diego Kreutz

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出利用LLM自动提取和结构化OpenVAS和Tenable WAS报告中的漏洞,实现非结构化数据到标准化格式的转换,提升风险管理和数据匿名化能力。

Comments 5 pages, 4 tables, 3 figures, submitted to ERRC/WRSeg 2025

详情

展开后加载摘要…

URL PDF HTML 收藏