arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2509.21609 2026-03-11 cs.CV cs.LG 57%

VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment

VLCE:一种用于灾害评估图像描述的知识增强框架

Md. Mahfuzur Rahman, Kishor Datta Gupta, Marufa Kamal, Fahad Rahman, Sunzida Siddique, Ahmed Rafi Hasan, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) BRAC University(布拉克大学) United International University(国际联合大学) Daffodil International University(花王国际大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。

Comments 28 pages, 30 figures, 1 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16952 2026-03-11 cs.LG 57%

FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization

FrontierCO: 机器学习求解组合优化问题的现实世界和大规模评估

Shengyu Feng, Weiwei Sun, Shanda Li, Ameet Talwalkar, Yiming Yang

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 FrontierCO通过现实世界结构和大规模实例评估,揭示了机器学习求解器在组合优化中的性能差距及优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09896 2026-03-11 cs.CV 50%

Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports

迈向赛场:评估体育中的空间智能

Yuchen Yang, Yuqing Shao, Duxiu Huang, Linfeng Dong, Yifei Liu, Suixin Tang, Xiang Zhou, Yuanyuan Gao, Wei Wang, Yue Zhou, Xue Yang, Yanfeng Wang, Xiao Sun, Zhihang Zhong

专题命中 评测与基准 :language model(abstract)

AI总结 CourtSI通过大规模体育场景数据集评估VLMs的空间智能,发现现有基准存在局限,并验证了模型在体育场景中的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09820 2026-03-11 cs.SD 50%

EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions

EmoSURA:迈向精确评估详细且长上下文情感语音字幕

Xin Jing, Andreas Triantafyllopoulos, Jiadong Wang, Shahin Amiriparian, Jun Luo, Björn Schuller

机构 * CHI – Chair of Health Informatics, TUM University Hospital, Munich, Germany(慕尼黑大学医院健康信息学系) MCML - Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心) Huawei, Netherlands(荷兰华为) GLAM, Imperial College London, UK(伦敦帝国理工学院GLAM研究中心)

专题命中 评测与基准 :LLM(abstract)

AI总结 EmoSURA通过原子验证机制和SURABench基准,提供更可靠的长上下文情感语音字幕评估方法

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09744 2026-03-11 cond-mat.mtrl-sci 50%

AI-driven Inverse Design of Complex Oxide Thin Films for Semiconductor Devices

基于AI的复杂氧化物薄膜逆向设计用于半导体器件

Bonwook Gu, Trinh Ngoc Le, Wonjoong Kim, Zunair Masroor, Han-Bo-Ram Lee

专题命中 评测与基准 :foundation model(abstract)

AI总结 IDEAL平台通过结合生成模型与原子层沉积技术,实现复杂氧化物薄膜的逆向设计,揭示了带隙与介电响应之间的权衡,并验证了其在半导体器件中的应用。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09213 2026-03-11 cs.CV 50%

Geometry-Aware Metric Learning for Cross-Lingual Few-Shot Sign Language Recognition on Static Hand Keypoints

基于几何的度量学习用于静态手关键点上的跨语言少样本手语识别

Chayanin Chamachot, Kanokphan Lertniponphan

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出基于几何的度量学习框架,利用静态手关键点的20维关节点角度描述符,提升跨语言少样本手语识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01433 2026-03-11 cs.CV 50%

DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis

DOCFORGE-BENCH:一个全面的零样本文档伪造检测与分析基准

Zengqi Zhao, Weidi Xia, En Wei, Yan Zhang, Jane Mo, Tiannan Zhang, Yuanqin Dai, Zexi Chen, Yiran Tao, Simiao Ren

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Irvine(加州大学尔湾分校) Washington University in St. Louis(圣路易斯华盛顿大学) Duke University(杜克大学) University of California, Davis(加州大学戴维斯分校) New York University(纽约大学) Georgetown University(乔治城大学)

专题命中 评测与基准 :LLM(abstract)

AI总结 DOCFORGE-BENCH提出首个零样本文档伪造检测基准,揭示校准失败问题,强调阈值适应对实际部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08897 2026-03-11 cs.CV 50%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17203 2026-03-11 cs.MA cs.GT 50%

Algorithmic Collusion at Test Time: A Meta-game Design and Evaluation

测试时的算法合谋:一种元游戏设计与评估

Yuhong Luo, Daniel Schoepflin, Xintong Wang

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出了一种元游戏设计,研究在测试时间限制下算法合谋的风险,通过模拟不同策略的智能体行为,评估合谋的可能性及定价策略的有效性。

Comments AAMAS 2026. 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01616 2026-03-11 cs.SE 50%

Automated Generation of Issue-Reproducing Tests by Combining LLMs and Search-Based Testing

通过结合大语言模型和基于搜索的软件测试生成问题复现测试

Konstantinos Kitsios, Marco Castelluccio, Alberto Bacchelli

专题命中 评测与基准 :LLM(abstract)

AI总结 BLAST通过结合大语言模型和基于搜索的软件测试,自动从问题-补丁对中生成问题复现测试,提升测试覆盖率和补丁有效性

Comments 13 pages, 8 figures, accepted for publication (to appear) in the 40th IEEE/ACM International Conference on Automated Software Engineering, ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 28 篇

2603.09173 2026-03-11 cs.CV 90%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08066 2026-03-11 cs.AI cs.CL eess.SP 90%

Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression

信息容量:通过文本压缩评估大语言模型的效率

Cheng Yuan, Jiawei Shao, Xuelong Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出信息容量作为评估大语言模型效率的新指标,通过文本压缩性能与计算复杂性关系衡量模型效率,并揭示主流模型的语言偏见问题。

Comments Code: https://github.com/TeleAI-AI-Flow/InformationCapacity. Data: https://huggingface.co/datasets/TeleAI-AI-Flow/InformationCapacity

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08801 2026-03-11 quant-ph cs.AI 89%

Large Language Model-Assisted Superconducting Qubit Experiments

大语言模型辅助的超导量子比特实验

Shiheng Li, Jacob M. Miller, Phoebe J. Lee, Gustav Andersson, Christopher R. Conner, Yash J. Joshi, Bayan Karimi, Amber M. King, Howard L. Malc, Harsh Mishra, Hong Qiao, Minseok Ryu, Xuntao Wu, Siyuan Xing, Haoxiong Yan, Jian Shi, Andrew N. Cleland

机构 * University of Chicago(芝加哥大学) Pritzker School of Molecular Engineering(普ritz克分子工程学院) Aalto University School of Science(阿alto大学科学学院) Pico group(Pico组) QTF Centre of Excellence(QTF卓越中心) Department of Applied Physics(应用物理系) Department of Mathematics(数学系) Applied Materials, Inc(应用材料公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型自动化超导量子比特实验,实现快速部署标准协议和新型实验程序,提升复杂量子硬件控制的灵活性和易用性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13251 2026-03-11 cs.NE 88%

Large Language Model Assisted Automated Algorithm Generation and Evolution via Meta-black-box optimization

通过元黑箱优化实现大型语言模型辅助的自动算法生成与进化

Xu Yang, Rui Wang, Kaiwen Li, Wenhua Li, Weixiong Huang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出AwesomeDE,利用大型语言模型生成约束进化算法的更新规则,提升计算效率和解的准确性,并展示其在不同领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20503 2026-03-11 cs.RO cs.AI cs.CL cs.CV cs.LG 87%

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

基于基础模型的具身AI在移动服务机器人中的应用:系统综述

Matthew Lisondra, Beno Benhabib, Goldie Nejat

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。

Comments v2: Expanded systematic review; resubmitted to Robotics

Journal ref Robotics 2026, 15(3), 55

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09216 2026-03-11 cs.DC 85%

PIM-SHERPA: Software Method for On-device LLM Inference by Resolving PIM Memory Attribute and Layout Inconsistencies

PIM-SHERPA:一种通过解决PIM内存属性和布局不一致性的软件方法实现设备端LLM推理

Sunjung Lee, Sanghoon Cha, Hyeonsu Kim, Seungwoo Seo, Yuhwan Ro, Sukhan Lee, Byeongho Kim, Yongjun Park, Kyomin Sohn, Seungwon Lee, Jaehoon Yu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PIM-SHERPA通过解决PIM内存属性和布局不一致问题,实现了设备端LLM推理的高效性能和内存节省。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 85%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08745 2026-03-11 cs.AR cs.MA cs.PF 85%

ChatNeuroSim: An LLM Agent Framework for Automated Compute-in-Memory Accelerator Deployment and Optimization

ChatNeuroSim:一种用于自动计算在内存加速器部署和优化的LLM代理框架

Ming-Yen Lee, Shimeng Yu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ChatNeuroSim是一种基于LLM的代理框架,用于自动部署和优化计算在内存加速器,通过设计空间修剪技术提升优化效率。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08739 2026-03-11 cs.AR cs.DC 85%

Adaptive Multi-Objective Tiered Storage Configuration for KV Cache in LLM Service

自适应多目标分层存储配置用于LLM服务中的KV缓存

Xianzhe Zheng, Zhengheng Wang, Ruiyan Ma, Rui Wang, Xiyu Wang, Rui Chen, Peng Zhang, Sicheng Pan, Zhangheng Huang, Chenxin Wu, Yi Zhang, Bo Cai, Kan Liu, Teng Ma, Yin Du, Dong Deng, Sai Wu, Guoyun Zhu, Wei Zhang, Feifei Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Kareto通过自适应资源管理优化LLM服务中的KV缓存配置,提升吞吐量、降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13223 2026-03-11 cs.DC 85%

BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure

BanaServe:统一的KV缓存和动态模块迁移以平衡AI基础设施中的解耦LLM服务

Yiyuan He, Minxian Xu, Jingfeng Wu, Jianmin Hu, Chong Ma, Min Shen, Le Chen, Chengzhong Xu, Lin Qu, Kejiang Ye

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 BanaServe通过统一的KV缓存和动态模块迁移,平衡解耦LLM服务中的计算与内存资源,提升吞吐量和效率。

Comments 23 pages

Journal ref Software: Practice and Experience 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01290 2026-03-11 cs.LG cs.AI 84%

Rating Quality of Diverse Time Series Data by Meta-learning from LLM Judgment

通过LLM判断对异质时间序列数据进行质量评级

Shunyu Wu, Dan Li, Wenjie Feng, Haozheng Ye, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) State Key Laboratory of Al Safety(人工智能安全国家重点实验室) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TSRating框架,利用LLM判断对异质时间序列数据进行质量评级,通过元学习提升跨领域适应性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08163 2026-03-11 cs.DC cs.LG 83%

Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet

Covenant-72B:通过互联网无信任同伴预训练一个72B LLM

Joel Lidin, Amir Sarfi, Erfan Miahi, Quentin Anthony, Shivam Chauhan, Evangelos Pappas, Benjamin Thérien, Eugene Belilovsky, Samuel Dare

机构 * Covenant AI Mila

专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 Covenant-72B通过全球分布式预训练实现了大规模无许可参与,展示了去中心化训练的可行性与高效性。

Comments 26 pages, 6 figures, 4 tables; minor update, no content changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05433 2026-03-11 cs.LG cs.NE 83%

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

多模态大语言模型辅助进化搜索用于程序化控制策略

Qinglong Hu, Xialiang Tong, Mingxuan Yuan, Fei Liu, Zhichao Lu, Qingfu Zhang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出多模态大语言模型辅助进化搜索方法,用于生成透明且可验证的程序化控制策略,通过结合视觉反馈与进化搜索提高策略发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08741 2026-03-11 cs.AR cs.LG 81%

The AetherFloat Family: Block-Scale-Free Quad-Radix Floating-Point Architectures for AI Accelerators

AetherFloat家族:面向AI加速器的无块缩放四进制浮点架构

Keita Morisaki

机构 * Keita Morisaki(独立研究者)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 AetherFloat家族是一种面向AI加速器的无块缩放四进制浮点架构,通过显式尾数和四进制缩放实现更高的动态范围和更低的功耗,同时支持量化感知训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07857 2026-03-11 cs.LG 79%

SA$^{2}$GFM: Enhancing Robust Graph Foundation Models with Structure-Aware Semantic Augmentation

SA$^{2}$GFM: 通过结构感知语义增强提升鲁棒图基础模型

Junhua Shi, Qingyun Sun, Haonan Yuan, Xingcheng Fu

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 SA$^{2}$GFM通过结构感知语义增强提升图基础模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08729 2026-03-11 cs.CY cs.CL 79%

Self-hosted Lecture-to-Quiz: Local LLM MCQ Generation with Deterministic Quality Control

本地讲座到测验:本地LLM多选题生成与确定性质量控制

Seine A. Shintani

机构 * Department of Biomedical Science, College of Life and Health Sciences, Chubu University(生物医学科学系、生命与健康科学学院、Chubu大学) Center for AI, Mathematical and Data Sciences, Chubu University(人工智能中心、数学与数据科学、Chubu大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出一种自托管的本地LLM生成多项选择题方法,结合确定性质量控制,确保生成问题的准确性和可靠性,并通过实验验证其有效性。

Comments 16 pages, 8 tables, appendix included. Includes ancillary files (anc/) with JSONL/CSV exports, QC traces, reproducibility notebook, and dummy lecture PDFs

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16722 2026-03-11 cs.CV 78%

Active Prompt Learning with Vision-Language Model Priors

基于视觉-语言模型先验的主动提示学习

Hoyoung Kim, Seokhee Jin, Changhwan Sung, Jaechang Kim, Jungseul Ok

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出了一种基于视觉-语言模型先验的主动提示学习框架,通过类引导聚类和自适应阈值筛选,提升主动学习效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08747 2026-03-11 cs.AR cs.AI 77%

Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4

诊断FP4推理:NVFP4和MXFP4的逐层和分块敏感性分析

Musa Cim, Burak Topcu, Mahmut Taylan Kandemir

机构 * Department of Computer Science and Engineering The Pennsylvania State University(计算机科学与工程系宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过分析MXFP4和NVFP4在不同模型规模下的敏感性,揭示了FP4量化在不同层和分块中的表现差异,为理解FP4推理行为提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08713 2026-03-11 cs.AR cs.AI cs.LG cs.PF 73%

Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction

揭示MXFP4量化潜力:降低量化误差的策略

Jatin Chhugani, Geonhwa Jeong, Bor-Yiing Su, Yunjie Pan, Hanmei Yang, Aayush Ankit, Jiecao Yu, Summer Deng, Yunqing Chen, Nadathur Satish, Changkyu Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MXFP4通过OAS和MBS技术显著提升量化精度,将与NVFP4的准确性差距从10%降至1%,同时保持硬件效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 70%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏