arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 139 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 37 篇

2510.03291 2025-12-10 cs.LG cs.AI 82%

UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs

UniPruning:统一局部度量和全局反馈以实现可扩展的稀疏大语言模型

Yizhuo Ding, Wanying Qu, Jiawei Geng, Wenqi Shao, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 UniPruning通过结合局部显著性度量和全局协调,提供一种高效且可扩展的后训练剪枝方法,支持多种稀疏度格式并提升LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07898 2025-12-10 cs.MA cs.AI 81%

MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement

MARINE:多智能体递归上下文增强的理论优化与设计

Hongwei Zhang, Ji Lu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Hongwei Zhang(张宏伟) Ji Lu(卢纪) Yongsheng Du(杜永生) Yanqin Gao(高燕琴) Lingjun Huang(黄令军) Baoli Wang(王宝利) Fang Tan(谭芳) Peng Zou(邹鹏)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MARINE通过理论优化和设计实现多智能体递归上下文增强,显著提升推理性能并减少参数需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08810 2025-12-10 cs.SE cs.AI cs.LG 81%

Multicalibration for LLM-based Code Generation

面向LLM的多校准代码生成

Viola Campos, Robin Kuschnereit, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多校准方法以提升代码生成模型的置信度评分准确性,通过实验验证其在技能分数上的显著提升。

Comments Accepted at AI-SQE 2026 (The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19523 2025-12-10 cs.LG cs.AI 81%

Language Models for Controllable DNA Sequence Design

用于可控DNA序列设计的语言模型

Xingyu Su, Xiner Li, Yuchao Lin, Ziqian Xie, Degui Zhi, Shuiwang Ji

机构 * Texas A&M University(德克萨斯大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心(休斯顿))

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ATGC-Gen是一种用于可控DNA序列设计的语言模型,通过跨模态编码整合生物信号,提升序列生成的可控性和生物相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08238 2025-12-10 cs.SD cs.AI 79%

SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality

SpeechQualityLLM: 基于大语言模型的多模态语音质量评估

Mahathir Monjur, Shahriar Nirjon

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.AI

AI总结 SpeechQualityLLM是一种基于大语言模型的多模态语音质量评估系统,通过生成文本答案来提供灵活的自然语言接口,减少对大规模测试的依赖。

Comments 9 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08798 2025-12-10 cs.LG cs.AI 79%

Can TabPFN Compete with GNNs for Node Classification via Graph Tabularization?

TabPFN能否通过图表格化与GNNs在节点分类中竞争?

Jeongwhan Choi, Woosung Kang, Minseo Kim, Jongwoo Kim, Noseong Park

专题命中 评测与基准 :LLM(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 TabPFN-GN通过将图数据转换为表格特征,实现了在节点分类任务中与GNNs竞争甚至超越的性能,展示了系统性特征工程在连接表格与图领域方面的潜力。

Comments Rejected from LoG 2025 (submitted August 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08459 2025-12-10 cs.LG cs.AI cs.CY cs.ET 79%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models III: Implementing the Bacterial Biothreat Benchmark (B3) Dataset

生物威胁基准生成框架用于评估前沿AI模型III:实现Bacterial Biothreat Benchmark(B3)数据集

Gary Ackerman, Theodore Wilson, Zachary Kallenborn, Olivia Shoemaker, Anna Wetzel, Hayley Peterson, Abigail Danfora, Jenna LaTourette, Brandon Behlendorf, Douglas Clifford

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出B3数据集,用于评估大型语言模型的生物安全风险,通过试点测试验证其在识别风险源和指导缓解措施方面的有效性。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24554 2025-12-10 cs.CL cs.AI 79%

Bench4KE: Benchmarking Automated Competency Question Generation

Bench4KE:自动化能力问题生成的基准测试

Anna Sofia Lippolis, Minh Davide Ragagni, Paolo Ciancarini, Andrea Giovanni Nuzzolese, Valentina Presutti

机构 * University of Bologna, Bologna, Italy(博洛尼亚大学) CNR - Institute of Cognitive Sciences and Technologies(意大利认知科学与技术研究院) University of Pisa, Pisa, Italy(比萨大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Bench4KE是一个用于评估自动能力问题生成工具的基准测试系统,通过标准化评估和比较不同LLM驱动的CQ生成系统,推动KE自动化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23062 2025-12-10 cs.CV 78%

Shape and Texture Recognition in Large Vision-Language Models

大规模视觉-语言模型中的形状与纹理识别

Sagi Eppel, Mor Bismut, Alona Faktor-Strugatski

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究发现大规模视觉-语言模型在识别抽象形状和纹理时表现不足,而人类和简单网络表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07497 2025-12-10 cs.AI cs.SE 77%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08451 2025-12-10 cs.LG cs.AI cs.CY cs.ET 73%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models II: Benchmark Generation Process

生物威胁基准生成框架用于评估前沿AI模型II:基准生成过程

Gary Ackerman, Zachary Kallenborn, Anna Wetzel, Hayley Peterson, Jenna LaTourette, Olivia Shoemaker, Brandon Behlendorf, Sheriff Almakki, Doug Clifford, Noah Sheinbaum

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出生物威胁基准生成框架,通过三种方法生成细菌生物威胁基准数据集,用于评估前沿AI模型的生物安全风险。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08130 2025-12-10 cs.LG cs.AI cs.CY 73%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models I: The Task-Query Architecture

生物威胁基准生成框架用于评估前沿AI模型 I:任务-查询架构

Gary Ackerman, Brandon Behlendorf, Zachary Kallenborn, Sheriff Almakki, Doug Clifford, Jenna LaTourette, Hayley Peterson, Noah Sheinbaum, Olivia Shoemaker, Anna Wetzel

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出生物威胁基准生成框架,用于评估前沿AI模型的生物安全风险,通过任务-查询架构构建细菌性生物威胁方案。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08936 2025-12-10 cs.AI cs.CL 73%

SimSUM: Simulated Benchmark with Structured and Unstructured Medical Records

SimSUM: 结构化和非结构化医疗记录的模拟基准

Paloma Rabaey, Stefan Heytens, Thomas Demeester

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SimSUM通过模拟呼吸系统疾病患者记录,提供结构化与非结构化医疗数据的基准,用于研究临床信息提取及多模态数据生成。

Comments An earlier version of this dataset was published under the name SynSUM. It has since been renamed to SimSUM to avoid confusion with synthetic data generated from real data, and to emphasize the simulated nature of the dataset. The dataset is available at https://github.com/prabaey/SimSUM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08754 2025-12-10 cs.RO 71%

A Multi-Robot Platform for Robotic Triage Combining Onboard Sensing and Foundation Models

一种结合 onboard 感知与基础模型的多机器人平台用于机器人 triage

Jason Hughes, Marcel Hussing, Edward Zhang, Shenbagaraj Kannapiran, Joshua Caswell, Kenneth Chaney, Ruichen Deng, Michaela Feehery, Agelos Kratimenos, Yi Fan Li, Britny Major, Ethan Sanchez, Sumukh Shrote, Youkang Wang, Jeremy Wang, Daudi Zein, Luying Zhang, Ruijun Zhang, Alex Zhou, Tenzi Zhouga, Jeremy Cannon, Zaffir Qasim, Jay Yelon, Fernando Cladera, Kostas Daniilidis, Camillo J. Taylor, Eric Eaton

机构 * GRASP Lab, School of Engineering and Applied Sciences, University of Pennsylvania(GRASP实验室,工程与应用科学学院,宾夕法尼亚大学) Perelman School of Medicine, University of Pennsylvania(佩拉蒙医学学院,宾夕法尼亚大学)

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出一种多机器人平台,结合 onboard 感知与基础模型,实现大规模伤亡事件中的机器人 triage,涵盖伤员定位、生命体征测量和伤情评估等关键步骤。

Comments Technical Report for the DARPA Triage Challenge PRONTO team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08814 2025-12-10 cs.CL 70%

Ask, Answer, and Detect: Role-Playing LLMs for Personality Detection with Question-Conditioned Mixture-of-Experts

提问、回答与检测:基于角色扮演的LLM用于带有问题条件的专家混合模型的人格检测

Yifan Lyu, Liang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of International Business and Economics(国际经济贸易大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ROME通过角色扮演LLM模拟用户回答心理测量问卷,生成可解释的证据链接语言线索与人格标签,提升人格检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 70%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08273 2025-12-10 cs.AI 70%

AgentEval: Generative Agents as Reliable Proxies for Human Evaluation of AI-Generated Content

AgentEval: 生成代理作为人类评估AI生成内容的可靠代理

Thanh Vu, Richi Nayak, Thiru Balasubramaniam

机构 * Centre for Data Science, School of Computer Science, Queensland University of Technology(数据科学中心、计算机科学学院、昆士兰科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentEval通过生成代理高效评估AI生成内容,减少人工评估成本,提升内容质量与一致性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06277 2025-12-10 cs.CY cs.AI 70%

The Prompt War: How AI Decides on a Military Intervention

提示战争:AI如何决定军事干预

Maxim Chupilkin

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了AI在军事干预决策中的影响因素,发现成功概率和国内支持是主要决定因素,且模型对上下文敏感但对经济冲击无显著反应。

Comments 22 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 70%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI 70%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08078 2025-12-10 cs.IR 67%

A Comparative Study of Retrieval Methods in Azure AI Search

Azure AI Search中检索方法的比较研究

Qiang Mao, Han Qin, Robert Neary, Charles Wang, Fusheng Wei, Jianping Zhang, Nathaniel Huber-Fliflet

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文比较了Azure AI Search中多种检索方法的性能,旨在提升电子发现中早期案件评估的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00238 2025-12-10 cs.CV cs.CL cs.IR cs.LG 62%

ZeShot-VQA: Zero-Shot Visual Question Answering Framework with Answer Mapping for Natural Disaster Damage Assessment

ZeShot-VQA:一种基于零样本学习的视觉问答框架,用于自然灾害损害评估

Ehsan Karimi, Maryam Rahnemoonfar

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于零样本学习的ZeShot-VQA框架,用于自然灾害损害评估,无需微调即可处理新数据集并生成未见过的答案。

Comments Accepted by the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08896 2025-12-10 cs.LG 57%

Open Polymer Challenge: Post-Competition Report

开放聚合物挑战:赛后报告

Gang Liu, Sobin Alosious, Subhamoy Mahajan, Eric Inae, Yihan Zhu, Yuhan Liu, Renzheng Zhang, Jiaxin Xu, Addison Howard, Ying Li, Tengfei Luo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Kaggle

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 开放聚合物挑战通过发布首个社区开发的聚合物基准数据集,推动多任务聚合物属性预测,促进分子AI在聚合物科学中的应用。

Comments The report for the competition: "NeurIPS - Open Polymer Prediction 2025". Kaggle Page: https://www.kaggle.com/competitions/neurips-open-polymer-prediction-2025. Website: https://open-polymer-challenge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08812 2025-12-10 cs.SD cs.AI 57%

Emovectors: assessing emotional content in jazz improvisations for creativity evaluation

Emovectors:评估爵士即兴演奏中的情感内容以进行创造力评估

Anna Jordanous

机构 * School of Computing University of Kent(计算学院肯特大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于嵌入的方法,用于量化爵士即兴演奏中的情感内容,以评估创造力。

Comments Presented at IEEE Big Data 2025 3rd Workshop on AI Music Generation (AIMG 2025). https://www.intellisky.org/workshops/AIMG2025/workshop_AIMG2025.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07037 2025-12-10 cs.CV cs.LG 57%

Evaluating and Preserving High-level Fidelity in Super-Resolution

评估和保持超分辨率中的高水平保真度

Josep M. Rocafort, Shaolin Su, Alexandra Gomez-Villa, Javier Vazquez-Corral

机构 * Computer Vision Center(计算机视觉中心) Universitat Autonoma de Barcelona(巴塞罗那自治大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出通过保真度度量评估超分辨率模型的可靠性,构建了首个注释数据集并展示了通过微调提升语义和感知质量的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07865 2025-12-10 cs.LG 57%

Using Text-Based Life Trajectories from Swedish Register Data to Predict Residential Mobility with Pretrained Transformers

利用瑞典注册数据中的基于文本的生命轨迹预测居住流动性

Philipp Stark, Alexandros Sopasakis, Ola Hall, Markus Grillitsch

机构 * Department of Human Geography (KEG), Lund University, Sweden(人类地理系(KEG),隆德大学,瑞典) Department of Mathematics, Lund University, Sweden(数学系,隆德大学,瑞典) CIRCLE (Centre for Innovation, Research and Competence in the Learning Economy), Lund University, Sweden(创新、研究与学习经济竞争力中心(CIRCLE),隆德大学,瑞典)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 利用瑞典注册数据中的文本生命轨迹,结合Transformer模型预测居住流动性,展示语义丰富数据与现代语言模型在纵向分析中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08627 2025-12-10 cs.CV 50%

Trajectory Densification and Depth from Perspective-based Blur

轨迹密集化与基于视角的模糊深度估计

Tianchen Qiu, Qirun Zhang, Jiajian He, Zhengyue Zhuge, Jiahui Xu, Yueting Chen

机构 * College of Optical Science and Engineering(光学科学与工程学院) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08233 2025-12-10 cs.RO 50%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 24 篇

2506.06301 2025-12-10 cs.AI 91%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22334 2025-12-10 cs.PF cs.AI 90%

Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends

边缘部署的小语言模型:CPU、GPU和NPU后端的综合比较

Pablo Prieto, Pablo Abad

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本研究比较了CPU、GPU和NPU在边缘部署小语言模型的性能和能效,发现NPU在性能和能效上表现最佳。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏