arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-22 至 2025-12-22 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 38 篇

2507.23358 2025-12-22 cs.CL cs.AI cs.DB cs.IR 79%

Text-to-SQL Task-oriented Dialogue Ontology Construction

面向任务的对话本体构建

Renato Vukovic, Carel van Niekerk, Michael Heck, Benjamin Ruppik, Hsien-Chin Lin, Shutong Feng, Nurul Lubis, Milica Gasic

机构 * Heinrich Heine University Düsseldorf(海因里希-海涅大学杜塞尔多夫)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TeQoDO通过LLM自主构建面向任务的对话本体,结合模块化TOD系统概念,提升对话系统的可解释性和可控性。

Comments Accepted to Transactions of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17387 2025-12-22 cs.SE cs.CL 77%

CIFE: Code Instruction-Following Evaluation

CIFE:代码指令遵循评估

Sravani Gunnu, Shanmukha Guttula, Hima Patel

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research India(IBM印度研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CIFE评估了1000个Python任务的代码生成模型,通过13类约束测试,揭示了模型在遵循开发者要求方面的不足,提出C2A分数衡量正确性与约束遵循性。

Comments 20 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17146 2025-12-22 cs.CR cs.LG q-bio.QM 77%

Biosecurity-Aware AI: Agentic Risk Auditing of Soft Prompt Attacks on ESM-Based Variant Predictors

生物安全意识的AI:基于ESM变体预测器的软提示攻击代理审计

Huixin Zhan

机构 * Department of Computer Science and Engineering(计算机科学与工程系) New Mexico Institute of Mining and Technology(新墨西哥采矿与技术研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本研究提出SAGE框架,通过代理风险审计发现ESM变体预测器对软提示攻击的敏感性,揭示基因组基础模型的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06278 2025-12-22 cs.RO 75%

Mitigating Undesired Conditions in Flexible Production with Product-Process-Resource Asset Knowledge Graphs

通过产品-过程-资源资产知识图谱缓解柔性生产中的不良状况

Petr Novak, Stefan Biffl, Marek Obitko, Petr Kadera

机构 * Czech Institute of Informatics, Robotics and Cybernetics(捷克信息学、机器人学与自动控制研究所) Czech Technical University in Prague(布拉格捷克技术大学) TU Wien -- Institute of Information Systems Engineering, Faculty of Informatics(维也纳技术大学——信息系统工程研究所,信息学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PPR-AKG模型,通过结合语义技术和大语言模型,解决柔性生产中的不良状况问题,提升资源分配效率和生产质量。

Comments Originally published online by CEUR Workshop Proceedings (CEUR-WS.org, ISSN 1613-0073) within ISWC 2025 Companion Volume. Available online: https://ceur-ws.org/Vol-4085/ and https://ceur-ws.org/Vol-4085/paper9.pdf

Journal ref CEUR Workshop Proceedings (CEUR-WS.org), ISSN 1613-0073. ISWC 2025 Companion Volume. Available online: https://ceur-ws.org/Vol-4085/ and https://ceur-ws.org/Vol-4085/paper9.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17419 2025-12-22 cs.SE cs.AI cs.CL cs.LG 75%

SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories

SWE-Bench++: 一个从开源仓库生成可扩展软件工程基准的框架

Lilin Wang, Lucas Ramalho, Alan Celestino, Phuc Anthony Pham, Yu Liu, Umang Kumar Sinha, Andres Portillo, Onassis Osunwa, Gabriel Maduekwe

机构 * Research & Development, Turing(研发与图灵)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SWE-Bench++通过自动化生成多语言软件工程基准,提升仓库级代码生成的评估与改进

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17117 2025-12-22 cs.HC 75%

Alignment, Exploration, and Novelty in Human-AI Interaction

对齐、探索与新颖性在人机交互中的体现

Halfdan Nordahl Fundal, Johannes Eide Rambøll, Karsten Olsen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了人类与AI在协作叙事中的情感对齐、语义探索和创新贡献,发现人类输入在塑造叙事方向和创造性分歧中起关键作用。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17902 2025-12-22 cs.CV cs.AI cs.CR 74%

Adversarial Robustness of Vision in Open Foundation Models

开放基础模型中视觉的对抗鲁棒性

Jonathon Fox, William J Buchanan, Pavlos Papadopoulos

机构 * Blockpass ID Lab(Blockpass ID 实验室) Edinburgh Napier University(爱丁堡纳皮尔大学)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 本文研究了LLaVA-1.5-13B和Llama 3.2 Vision-8B-2在视觉输入下的对抗鲁棒性,发现Llama 3.2 Vision在高扰动水平下性能下降更小,表明视觉模态是降级开放权重VLMs的可行攻击向量。

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 74%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17756 2025-12-22 cs.CL cs.AI 73%

AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora

AncientBench: 向考古与传世中文语料的全面评估迈进

Zhihan Zhou, Daqian Shi, Rui Song, Lida Shi, Xiaolei Diao, Hao Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AncientBench通过四个维度和十个任务全面评估大语言模型对古代文字的理解能力,揭示其在古代文本场景中的潜力与与人类的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15184 2025-12-22 cs.LG 70%

Data for Mathematical Copilots: Better Ways of Presenting Proofs for Machine Learning

用于数学助手的数据:为机器学习呈现证明的更好方式

Simon Frieder, Jonas Bayer, Sam Looi, Jacob Loader, Julius Berner, Katherine M. Collins, András Juhász, Fabian Ruehle, Sean Welleck, Gabriel Poesia, Ryan-Rhys Griffiths, Adrian Weller, Anirudh Goyal, Cameron Freer, Thomas Lukasiewicz, Timothy Gowers

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Caltech(加州理工学院) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) FutureHouse Inc.(未来房屋公司) Meta Vienna University of Technology(维也纳技术大学) MIT(麻省理工学院) Imperial College London(伦敦帝国学院) Collège de France(法兰西学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出改进数学助手数据集的设计,以更真实反映数学研究实践,从而提升大语言模型的证明学习能力。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM 70%

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17183 2025-12-22 cs.RO 67%

Semantic Co-Speech Gesture Synthesis and Real-Time Control for Humanoid Robots

语义共语手势合成与人形机器人实时控制

Gang Zhang

机构 * China Mobile HangZhou(中国移动杭州)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于语义的手势生成与实时控制框架,通过整合生成检索机制和模仿学习策略,实现人形机器人自然流畅的非语言交流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17527 2025-12-22 cs.LG cs.AI cs.CR 62%

SafeBench-Seq: A Homology-Clustered, CPU-Only Baseline for Protein Hazard Screening with Physicochemical/Composition Features and Cluster-Aware Confidence Intervals

SafeBench-Seq: 一种基于同源聚类、仅CPU运行的蛋白质危险筛查基准,结合物理化学/组成特征及聚类感知置信区间

Muhammad Haris Khan

机构 * University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 SafeBench-Seq是一种基于同源聚类、仅CPU运行的蛋白质危险筛查基准,利用物理化学和组成特征及聚类感知置信区间,提供可重复的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00496 2025-12-22 cs.CL cs.AI 62%

ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics

ResearchQA: 在75个领域中大规模评估学术问答

Li S. Yifei, Allen Chang, Chaitanya Malaviya, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 ResearchQA通过整合75个领域的调研文章,生成21K问题和160K评分项,用于大规模评估LLM系统,发现多数系统在覆盖评分项方面表现不足。

Comments 12 pages main, 40 pages total, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17267 2025-12-22 cs.CL cs.AI 62%

AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators

AutoMetrics: 通过自动生成评估器进行近似人类判断

Michael J. Ryan, Yanzhe Zhang, Amol Salunkhe, Yi Chu, Di Xu, Diyi Yang

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12218 2025-12-22 cs.CV cs.CL cs.LG 62%

Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking

目的地之前:视觉忠实性在慢思考中的重要性

Rheeya Uppaal, Phu Mon Htut, Min Bai, Nikolaos Pappas, Zheng Qi, Sandesh Swamy

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS AI Labs(AWS人工智能实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出视觉忠实性评估方法,通过检测并修正不忠实的感知步骤提升多模态推理的可靠性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21041 2025-12-22 cs.CR cs.CL 57%

Clean Up the Mess: Addressing Data Pollution in Cryptocurrency Abuse Reporting Services

清理混乱:解决加密货币滥用报告服务中的数据污染

Gibran Gomez, Kevin van Liebergen, Davide Sanvito, Giuseppe Siracusano, Roberto Gonzalez, Juan Caballero

机构 * IMDEA Software Institute(IMDEA软件研究所) NEC Laboratories Europe(日本电气株式会社欧洲实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一种基于LLM的无监督分类器,用于解决加密货币滥用报告服务中的数据污染问题,并展示了其在量化不同滥用类型财务影响方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17092 2025-12-22 cs.CL 57%

Data Augmentation Supporting a Conversational Agent Designed for Smoking Cessation Support Groups

数据增强支持用于戒烟支持小组的对话代理

Salar Hashemitaheri, Ian Harris

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一种两级数据增强策略,通过合成和真实数据提升对话代理在戒烟支持小组中的表现,验证了数据增强对F1分数提升的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06000 2025-12-22 cs.CL 57%

LLMs Do Not See Age: Assessing Demographic Bias in Automated Systematic Review Synthesis

大语言模型不区分年龄:评估自动化系统性综述合成中的人口统计偏差

Favour Yahdii Aghaebe, Tanefa Apekey, Elizabeth Williams, Nafise Sadat Moosavi

机构 * University of Sheffield, UK(谢菲尔德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本研究评估了大语言模型在系统性综述合成中对年龄信息的保留能力,发现成人摘要的准确性最低,且受忽视人群更易产生幻觉,强调了对公平性评估框架的需求。

Comments Accepted at AACL 2025 Version 2 Updated with Final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17891 2025-12-22 cs.CV 50%

Keypoint Counting Classifiers: Turning Vision Transformers into Self-Explainable Models Without Training

关键点计数分类器:无需训练即可将视觉变换器转化为自解释模型

Kristoffer Wickstrøm, Teresa Dorszewski, Siyan Chen, Michael Kampffmeyer, Elisabeth Wetzer, Robert Jenssen

机构 * Department of Physics and Technology(物理与技术系) UiT The Arctic University of Norway(北摩尔曼斯克大学) Department of Applied Mathematics and Computer Science(应用数学与计算机科学系) Technical University of Denmark(技术大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出关键点计数分类器,无需重新训练即可将视觉变换器转化为自解释模型,提升人机交流的透明性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09814 2025-12-22 cs.CV 50%

On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness

CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系

Pablo Hernández-Cámara, Jose Manuel Jaén-Lorites, Alexandra Gómez-Villa, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室) Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究CLIP模型在训练过程中纹理-形状偏倚的演变,揭示其与人类感知对齐及模型鲁棒性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17499 2025-12-22 cs.CV 50%

Validation of Diagnostic Artificial Intelligence Models for Prostate Pathology in a Middle Eastern Cohort

在中东人群中的前列腺病理科人工智能模型验证

Peshawa J. Muhammad Ali, Navin Vincent, Saman S. Abdulla, Han N. Mohammed Fadhl, Anders Blilie, Kelvin Szolnoky, Julia Anna Mielcarz, Xiaoyi Ji, Nita Mulliqi, Abdulbasit K. Al-Talabani, Kimmo Kartasalo

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究在中东人群中验证了基于AI的前列腺病理科诊断模型,展示了其与病理医生的一致性及在不同扫描仪间的稳定性,为全球AI病理学应用提供了重要数据支持。

Comments 40 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17140 2025-12-22 cs.HC cs.CY 50%

Bridging Psychometric and Content Development Practices with AI: A Community-Based Workflow for Augmenting Hawaiian Language Assessments

通过人工智能弥合心理测量与内容开发实践:一种基于社区的工作流用于增强夏威夷语评估

Pōhai Kūkea-Shultz, Frank Brockmann

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种基于社区的人工智能工作流,用于增强夏威夷语评估,通过AI与人类监督相结合,解决语言模糊性和系统设计问题,促进公平和文化权威。

Comments 11 pages, 1 figure. Earlier version posted on OSF/EdArXiv: 10.35542/osf.io/cr7va_v1

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 12 篇

2512.16238 2025-12-22 cs.OS 89%

Trustworthy and Controllable Professional Knowledge Utilization in Large Language Models with TEE-GPU Execution

在大语言模型中实现可信且可控的专业知识利用:TEE-GPU执行

Yifeng Cai, Zhida An, Yuhan Meng, Houqian Liu, Pengli Wang, Hanwen Lei, Yao Guo, Ding Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出PKUS系统,通过将专业知识作为可分离的制品,实现大语言模型中可信且可控的专业知识利用,提升模型性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21791 2025-12-22 cs.CL cs.LG 88%

Quantifying the Impact of Structured Output Format on Large Language Models through Causal Inference

通过因果推理量化结构化输出格式对大语言模型的影响

Han Yuan, Yue Zhao, Li Zhang, Wuqiong Luo, Zheng Ma

机构 * Global Decision Science, American Express(全球决策科学,美国运通)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过因果推理分析结构化输出对大语言模型生成的影响,发现多数情况下无显著因果效应,但特定情况下受指令影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15877 2025-12-22 cs.LG cs.AR cs.CL 88%

Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications

基底选择:为特定应用预训练大语言模型的低秩分解

Yang Li, Daniel Agyei Asante, Changsheng Zhao, Ernie Chang, Yangyang Shi, Vikas Chandra

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种针对特定应用的LLM低秩分解方法,通过识别并去除冗余部分,有效压缩模型大小并保持性能。

Comments Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17313 2025-12-22 cs.CV 82%

Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model

辅助描述性知识用于视觉-语言模型的少样本适应

SuBeen Lee, GilHan Park, WonJun Moon, Hyun Seok Seong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天妇女大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出ADK框架,通过生成丰富的描述性提示提升视觉-语言模型在少样本适应中的性能,提供两种知识类型以增强类别区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16970 2025-12-22 cs.AI cs.CL cs.LG cs.MA 80%

PAACE: A Plan-Aware Automated Agent Context Engineering Framework

PAACE:一种计划感知的自动代理上下文工程框架

Kamer Ali Yuksel

机构 * Kamer Ali Yuksel(独立研究者)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PAACE通过计划感知的上下文工程框架提升LLM代理的准确性并减少上下文负载,实现高效多步骤任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17065 2025-12-22 cs.CL 79%

XLM: A Python package for non-autoregressive language models

XLM:一种用于非自回归语言模型的Python包

Dhruvesh Patel, Durga Prasad Maram, Sai Sreenivas Chintha, Benjamin Rozonoyer, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 XLM是一个Python包,旨在加速非自回归语言模型的实现,并提供预训练模型供研究社区使用。

Comments Code available at https://github.com/dhruvdcoder/xlm-core

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17574 2025-12-22 cs.DC cs.LG 77%

Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing

通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理

Lingxiao Zhao, Haoran Zhou, Yuezhi Che, Dazhao Cheng

机构 * Wuhan University(武汉大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理,提升吞吐量和延迟性能

详情

展开后加载摘要…

URL PDF HTML 收藏