arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 37 篇

2512.08894 2025-12-10 cs.LG cs.AI cs.CL 90%

Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training

重新审视大型语言模型训练中下游指标的缩放特性

Jakub Krajewski, Amitis Shidani, Dan Busbridge, Sam Wiseman, Jason Ramapuram

机构 * Apple(苹果公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出直接框架建模LLM训练预算与下游任务性能的缩放关系,发现幂律可准确描述log准确率,且优于传统两阶段方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25643 2025-12-10 cs.AI 89%

SOCK: A Benchmark for Measuring Self-Replication in Large Language Models

SOCK:一种衡量大语言模型自我复制能力的基准

Justin Chavarria, Rohan Raizada, Justin White, Eyad Alhetairshi

机构 * Albion College(阿尔比恩学院) Hunter College(亨特学院) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SOCK提出了一种评估大语言模型自我复制能力的基准,旨在建立标准并减少多代理系统中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14295 2025-12-10 cs.CL cs.AI cs.LG 89%

AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models

AraLingBench:一个用于评估大型语言模型阿拉伯语语言能力的人工标注基准

Mohammad Zbeeb, Hasan Abed Al Kader Hammoud, Sina Mukalled, Nadine Rizk, Fatima Karnib, Issam Lakkis, Ammar Mohanna, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯泰克大学) American University of Beirut (AUB)(贝鲁特美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AraLingBench通过150道人工标注的多项选择题评估阿拉伯语LLM的语言能力,揭示模型在语法和句法推理上的不足,强调了记忆与模式识别对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV 89%

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08057 2025-12-10 cs.AI 88%

Large Language Models for Education and Research: An Empirical and User Survey-based Analysis

大型语言模型在教育与研究中的应用:基于实证和用户调查的分析

Md Mostafizer Rahman, Ariful Islam Shiplu, Md Faizul Ibne Amin, Yutaka Watanobe, Lu Peng

机构 * Tulane University, New Orleans, LA, USA Dhaka University of Engineering \& Technology, Gazipur, Bangladesh The University of Aizu, Aizu-Wakamatsu, Fukushima, Japan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过实证和用户调查分析,评估ChatGPT和DeepSeek在教育与研究中的表现,揭示其在语言理解、编程和专业问题解决中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07215 2025-12-10 cs.CV cs.AI 88%

VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation

基于视觉基础模型和视觉语言模型的3D姿态估计视觉比较:VFM-VLM

Md Selim Sarowar, Sungho Kim

机构 * Dept. of Electronic Engineering Yeungnam University Advanced Visual Intelligence Lab(电子工程系 韩国又南大学 高级视觉智能实验室)

专题命中 评测与基准 :language model(title,abstract);foundation model(title,abstract);分类 cs.AI

AI总结 本文比较了基于CLIP和DINOv2的视觉模型在3D姿态估计中的性能,展示了两者在语义理解和几何精度上的互补优势,为机器人抓取应用提供了模型选择依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02350 2025-12-10 cs.CL cs.AI 86%

LLMSQL: Upgrading WikiSQL for the LLM Era of Text-to-SQL

LLMSQL: 为大语言模型时代升级WikiSQL

Dzmitry Pihulski, Karol Charchut, Viktoria Novogrodskaia, Jan Kocoń

机构 * Department of Artificial Intelligence(人工智能系) Trusted Artificial Intelligence(可信人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLMSQL为大语言模型时代升级WikiSQL,提供干净的自然语言问题和完整SQL查询,提升文本到SQL模型的生成与评估效率。

Comments To appear in the Proceedings of the IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08867 2025-12-10 cs.SE 86%

SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA

SimpleDevQA:在开发知识问答上评估大语言模型

Jing Zhang, Lianghong Guo, Yanlin Wang, Mingwei Liu, Jiachi Chen, Yuchi Ma, Ensheng Shi, Terry Yue Zhuo, Hongyu Zhang, Zibin Zheng

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 SimpleDevQA是一个基于真实用户对话构建的多语言基准,用于评估大语言模型在开发知识问答任务中的表现,通过三阶段流程生成2740个问答对,发现代码LLM在该任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07867 2025-12-10 q-fin.RM cs.AI econ.EM 83%

LLM-Generated Counterfactual Stress Scenarios for Portfolio Risk Simulation via Hybrid Prompt-RAG Pipeline

基于混合提示-检索管道的LLM生成反事实压力情景用于投资组合风险模拟

Masoud Soleimani

机构 * Department of Information Engineering, University of Pisa(信息工程系,比萨大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种混合提示-检索管道,利用LLM生成宏观经济压力情景,通过结构化提示和检索机制,实现投资组合风险模拟的可解释和可验证方法。

Comments 22 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03291 2025-12-10 cs.LG cs.AI 82%

UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs

UniPruning:统一局部度量和全局反馈以实现可扩展的稀疏大语言模型

Yizhuo Ding, Wanying Qu, Jiawei Geng, Wenqi Shao, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 UniPruning通过结合局部显著性度量和全局协调,提供一种高效且可扩展的后训练剪枝方法,支持多种稀疏度格式并提升LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07898 2025-12-10 cs.MA cs.AI 81%

MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement

MARINE:多智能体递归上下文增强的理论优化与设计

Hongwei Zhang, Ji Lu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Hongwei Zhang(张宏伟) Ji Lu(卢纪) Yongsheng Du(杜永生) Yanqin Gao(高燕琴) Lingjun Huang(黄令军) Baoli Wang(王宝利) Fang Tan(谭芳) Peng Zou(邹鹏)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MARINE通过理论优化和设计实现多智能体递归上下文增强,显著提升推理性能并减少参数需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08810 2025-12-10 cs.SE cs.AI cs.LG 81%

Multicalibration for LLM-based Code Generation

面向LLM的多校准代码生成

Viola Campos, Robin Kuschnereit, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多校准方法以提升代码生成模型的置信度评分准确性,通过实验验证其在技能分数上的显著提升。

Comments Accepted at AI-SQE 2026 (The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19523 2025-12-10 cs.LG cs.AI 81%

Language Models for Controllable DNA Sequence Design

用于可控DNA序列设计的语言模型

Xingyu Su, Xiner Li, Yuchao Lin, Ziqian Xie, Degui Zhi, Shuiwang Ji

机构 * Texas A&M University(德克萨斯大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心(休斯顿))

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ATGC-Gen是一种用于可控DNA序列设计的语言模型,通过跨模态编码整合生物信号,提升序列生成的可控性和生物相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08238 2025-12-10 cs.SD cs.AI 79%

SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality

SpeechQualityLLM: 基于大语言模型的多模态语音质量评估

Mahathir Monjur, Shahriar Nirjon

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.AI

AI总结 SpeechQualityLLM是一种基于大语言模型的多模态语音质量评估系统,通过生成文本答案来提供灵活的自然语言接口,减少对大规模测试的依赖。

Comments 9 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08798 2025-12-10 cs.LG cs.AI 79%

Can TabPFN Compete with GNNs for Node Classification via Graph Tabularization?

TabPFN能否通过图表格化与GNNs在节点分类中竞争?

Jeongwhan Choi, Woosung Kang, Minseo Kim, Jongwoo Kim, Noseong Park

专题命中 评测与基准 :LLM(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 TabPFN-GN通过将图数据转换为表格特征,实现了在节点分类任务中与GNNs竞争甚至超越的性能,展示了系统性特征工程在连接表格与图领域方面的潜力。

Comments Rejected from LoG 2025 (submitted August 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08459 2025-12-10 cs.LG cs.AI cs.CY cs.ET 79%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models III: Implementing the Bacterial Biothreat Benchmark (B3) Dataset

生物威胁基准生成框架用于评估前沿AI模型III:实现Bacterial Biothreat Benchmark(B3)数据集

Gary Ackerman, Theodore Wilson, Zachary Kallenborn, Olivia Shoemaker, Anna Wetzel, Hayley Peterson, Abigail Danfora, Jenna LaTourette, Brandon Behlendorf, Douglas Clifford

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出B3数据集,用于评估大型语言模型的生物安全风险,通过试点测试验证其在识别风险源和指导缓解措施方面的有效性。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24554 2025-12-10 cs.CL cs.AI 79%

Bench4KE: Benchmarking Automated Competency Question Generation

Bench4KE:自动化能力问题生成的基准测试

Anna Sofia Lippolis, Minh Davide Ragagni, Paolo Ciancarini, Andrea Giovanni Nuzzolese, Valentina Presutti

机构 * University of Bologna, Bologna, Italy(博洛尼亚大学) CNR - Institute of Cognitive Sciences and Technologies(意大利认知科学与技术研究院) University of Pisa, Pisa, Italy(比萨大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Bench4KE是一个用于评估自动能力问题生成工具的基准测试系统,通过标准化评估和比较不同LLM驱动的CQ生成系统,推动KE自动化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23062 2025-12-10 cs.CV 78%

Shape and Texture Recognition in Large Vision-Language Models

大规模视觉-语言模型中的形状与纹理识别

Sagi Eppel, Mor Bismut, Alona Faktor-Strugatski

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究发现大规模视觉-语言模型在识别抽象形状和纹理时表现不足,而人类和简单网络表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07497 2025-12-10 cs.AI cs.SE 77%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08451 2025-12-10 cs.LG cs.AI cs.CY cs.ET 73%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models II: Benchmark Generation Process

生物威胁基准生成框架用于评估前沿AI模型II:基准生成过程

Gary Ackerman, Zachary Kallenborn, Anna Wetzel, Hayley Peterson, Jenna LaTourette, Olivia Shoemaker, Brandon Behlendorf, Sheriff Almakki, Doug Clifford, Noah Sheinbaum

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出生物威胁基准生成框架,通过三种方法生成细菌生物威胁基准数据集,用于评估前沿AI模型的生物安全风险。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08130 2025-12-10 cs.LG cs.AI cs.CY 73%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models I: The Task-Query Architecture

生物威胁基准生成框架用于评估前沿AI模型 I:任务-查询架构

Gary Ackerman, Brandon Behlendorf, Zachary Kallenborn, Sheriff Almakki, Doug Clifford, Jenna LaTourette, Hayley Peterson, Noah Sheinbaum, Olivia Shoemaker, Anna Wetzel

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出生物威胁基准生成框架,用于评估前沿AI模型的生物安全风险,通过任务-查询架构构建细菌性生物威胁方案。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08936 2025-12-10 cs.AI cs.CL 73%

SimSUM: Simulated Benchmark with Structured and Unstructured Medical Records

SimSUM: 结构化和非结构化医疗记录的模拟基准

Paloma Rabaey, Stefan Heytens, Thomas Demeester

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SimSUM通过模拟呼吸系统疾病患者记录,提供结构化与非结构化医疗数据的基准,用于研究临床信息提取及多模态数据生成。

Comments An earlier version of this dataset was published under the name SynSUM. It has since been renamed to SimSUM to avoid confusion with synthetic data generated from real data, and to emphasize the simulated nature of the dataset. The dataset is available at https://github.com/prabaey/SimSUM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08754 2025-12-10 cs.RO 71%

A Multi-Robot Platform for Robotic Triage Combining Onboard Sensing and Foundation Models

一种结合 onboard 感知与基础模型的多机器人平台用于机器人 triage

Jason Hughes, Marcel Hussing, Edward Zhang, Shenbagaraj Kannapiran, Joshua Caswell, Kenneth Chaney, Ruichen Deng, Michaela Feehery, Agelos Kratimenos, Yi Fan Li, Britny Major, Ethan Sanchez, Sumukh Shrote, Youkang Wang, Jeremy Wang, Daudi Zein, Luying Zhang, Ruijun Zhang, Alex Zhou, Tenzi Zhouga, Jeremy Cannon, Zaffir Qasim, Jay Yelon, Fernando Cladera, Kostas Daniilidis, Camillo J. Taylor, Eric Eaton

机构 * GRASP Lab, School of Engineering and Applied Sciences, University of Pennsylvania(GRASP实验室,工程与应用科学学院,宾夕法尼亚大学) Perelman School of Medicine, University of Pennsylvania(佩拉蒙医学学院,宾夕法尼亚大学)

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出一种多机器人平台,结合 onboard 感知与基础模型,实现大规模伤亡事件中的机器人 triage,涵盖伤员定位、生命体征测量和伤情评估等关键步骤。

Comments Technical Report for the DARPA Triage Challenge PRONTO team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08814 2025-12-10 cs.CL 70%

Ask, Answer, and Detect: Role-Playing LLMs for Personality Detection with Question-Conditioned Mixture-of-Experts

提问、回答与检测:基于角色扮演的LLM用于带有问题条件的专家混合模型的人格检测

Yifan Lyu, Liang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of International Business and Economics(国际经济贸易大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ROME通过角色扮演LLM模拟用户回答心理测量问卷,生成可解释的证据链接语言线索与人格标签,提升人格检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 70%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08273 2025-12-10 cs.AI 70%

AgentEval: Generative Agents as Reliable Proxies for Human Evaluation of AI-Generated Content

AgentEval: 生成代理作为人类评估AI生成内容的可靠代理

Thanh Vu, Richi Nayak, Thiru Balasubramaniam

机构 * Centre for Data Science, School of Computer Science, Queensland University of Technology(数据科学中心、计算机科学学院、昆士兰科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentEval通过生成代理高效评估AI生成内容,减少人工评估成本,提升内容质量与一致性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06277 2025-12-10 cs.CY cs.AI 70%

The Prompt War: How AI Decides on a Military Intervention

提示战争:AI如何决定军事干预

Maxim Chupilkin

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了AI在军事干预决策中的影响因素,发现成功概率和国内支持是主要决定因素,且模型对上下文敏感但对经济冲击无显著反应。

Comments 22 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 70%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI 70%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08078 2025-12-10 cs.IR 67%

A Comparative Study of Retrieval Methods in Azure AI Search

Azure AI Search中检索方法的比较研究

Qiang Mao, Han Qin, Robert Neary, Charles Wang, Fusheng Wei, Jianping Zhang, Nathaniel Huber-Fliflet

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文比较了Azure AI Search中多种检索方法的性能,旨在提升电子发现中早期案件评估的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏