arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 46 篇

2603.08927 2026-03-11 cs.CV cs.MM 67%

MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering

MEGC2026:面向视觉问答的微表情大奖挑战

Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, CAS & Department of Psychology, University of the Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室及中国科学院大学心理学系) School of Mathematical and Computer Sciences, Heriot-Watt University Malaysia(赫瑞-沃森大学马来西亚分校数学与计算机科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 MEGC2026通过视觉问答任务探索微表情识别,利用多模态大语言模型和大视觉-语言模型提升微表情分析能力。

Comments MEGC 2026 at IEEE FG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 67%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09184 2026-03-11 cs.LG cs.AI 62%

Latent-DARM: Bridging Discrete Diffusion And Autoregressive Models For Reasoning

Latent-DARM: 联结离散扩散与自回归模型以实现推理

Lina Berrayana, Ahmed Heakl, Abdullah Sohail, Thomas Hofmann, Salman Khan, Wei Chen

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Latent-DARM通过结合离散扩散模型与自回归模型,提升多智能体系统在推理任务中的表现和协作效率。

Comments Published at LIT Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 62%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09641 2026-03-11 cs.AI cs.IR 57%

PRECEPT: Planning Resilience via Experience, Context Engineering & Probing Trajectories A Unified Framework for Test-Time Adaptation with Compositional Rule Learning and Pareto-Guided Prompt Evolution

PRECEPT:通过经验、上下文工程与轨迹探测进行规划韧性 一个具有组合规则学习和帕累托引导提示演化的测试时间适应统一框架

Arash Shahmansoori

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 PRECEPT通过经验、上下文工程与轨迹探测,结合组合规则学习和帕累托引导提示演化,提升测试时间适应的鲁棒性和泛化能力。

Comments 50 pages, 14 figures. Code and reproducibility resources: https://github.com/arash-shahmansoori/precept-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09268 2026-03-11 cs.AI 57%

Logos: An evolvable reasoning engine for rational molecular design

Logos:一种可进化推理引擎用于理性分子设计

Haibin Wen, Zhe Zhao, Fanfu Wang, Tianyi Xu, Hao Zhang, Chao Yang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) Lanzhou University(兰州大学) Riltide Medicines(Riltide医药公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Logos是一种集成多步逻辑推理与严格化学一致性的分子推理模型,通过分阶段训练和化学规则优化,在多个基准数据集上实现了结构准确性和化学有效性上的高性能,同时参数量仅为通用语言模型的几分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01267 2026-03-11 cs.LG 57%

Iterative In-Context Learning to Enhance LLMs Abstract Reasoning: The Case-Study of Algebraic Tasks

迭代上下文学习以增强大语言模型的推理能力:代数任务的案例研究

Stefano Fioravanti, Matteo Zavatteri, Roberto Confalonieri, Kamyar Zeinalipour, Paolo Frazzetto, Alessandro Sperduti, Nicolò Navarin

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 本研究通过迭代上下文学习方法提升大语言模型在代数任务中的推理能力,发现简单示例能提高模型泛化性能。

Comments Accepted at KNLP 2026 - ACM SAC 2026 Special Track on Knowledge and Natural Language Processing. https://knlp-sac.github.io/2026/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10931 2026-03-11 cs.FL cs.LO 50%

An Elementary Proof of the FMP for Kleene Algebra

Kleene代数中FMP的初等证明

Tobias Kappé

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文通过变换自动机的方法,给出了Kleene代数有限模型性质的初等证明,并推导出Kozen和Pratt定理。

Journal ref Fundamenta Informaticae, Volume 195, Issues 1-4: Relational and Algebraic Methods in Computer Science 2024 (February 6, 2026) fi:12445

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09743 2026-03-11 cs.CV 50%

LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos

LAP:一种语言感知的规划模型用于教学视频中的过程规划

Lei Shi, Victor Aregbede, Andreas Persson, Martin Längkvist, Amy Loutfi, Stephanie Lowry

机构 * Örebro University(奥雷布罗大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 LAP通过利用语言描述提升过程规划的准确性,实现教学视频中动作序列的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09512 2026-03-11 cs.CV 50%

Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning

探测驾驶视觉语言模型的可靠性:从不一致响应到基于现实的时序推理

Chun-Peng Chang, Chen-Yu Wang, Holger Caesar, Alain Pagani

机构 * DFKI Augmented Vision(DFKI增强视觉实验室) TU Delft(代尔夫特理工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文研究了驾驶视觉语言模型的可靠性问题,通过引入FutureVQA数据集和自监督微调方法,提升模型在时序推理和一致性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 50%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 推理与问题求解 :language model(abstract)

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08988 2026-03-11 cs.RO 50%

Characterization, Analytical Planning, and Hybrid Force Control for the Inspire RH56DFX Hand

Inspire RH56DFX手的表征、分析规划与混合力控

Xuan Tan, William Xie, Nikolaus Correll

机构 * Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文通过硬件表征、MuJoCo模型和混合力控方法改进Inspire RH56DFX手,提升其在抓取任务中的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03733 2026-03-11 cs.CV 50%

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

RegionReasoner: 基于区域的多轮视觉推理

Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Anhui University(安徽大学) Westlake University(西湖大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 RegionReasoner通过强化学习框架,结合接地保真度和全局-局部语义对齐,提升多轮视觉推理的准确性和一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 57 篇

2603.09100 2026-03-11 cs.SE 90%

Class Model Generation from Requirements using Large Language Models

基于大型语言模型的需求生成类模型

Jackson Nguyen, Rui En Koe, Fanyu Wang, Chetan Arora, Alessio Ferrari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大型语言模型在自动从自然语言需求生成UML类图方面的有效性,通过双验证框架评估模型生成的准确性和一致性。

Comments Accepted by The Eighth Workshop on Modeling and Simulation of Software-Intensive Systems (MSSiS 2026), ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09884 2026-03-11 cs.CL cs.CY 89%

Benchmarking Political Persuasion Risks Across Frontier Large Language Models

在前沿大语言模型中评估政治说服风险基准

Zhongren Chen, Joshua Kalla, Quan Le

机构 * Yale University(耶鲁大学) Department of Statistics & Data Science(统计与数据科学系) Coefficient Giving

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了前沿大语言模型在政治说服方面的风险,发现Claude模型说服力最强,Grok最弱,且信息提示效果因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04664 2026-03-11 cs.CL cs.AI 88%

CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models

CRANE: 多语言大语言模型中语言特异性神经元的因果相关性分析

Yifan Le, Yunliang Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CRANE通过神经元层面的干预分析,揭示多语言大模型中语言特异性神经元的因果相关性,更精确地分离语言特异性组件。

Comments 10 pages, 6 figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09452 2026-03-11 cs.CR cs.CL 88%

CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?

CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?

Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre, Sudipto Rakshit, Diana Duvieilh, Ashley Picone, Nan Tang

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。

Comments Accepted at TMLR

Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09533 2026-03-11 cs.AI cs.CL 88%

Enhancing Debunking Effectiveness through LLM-based Personality Adaptation

通过基于大语言模型的人格适应增强反驳效果

Pietro Dell'Oglio, Alessandro Bondielli, Francesco Marcelloni, Lucia C. Passaro

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过基于LLM的人格适应技术生成个性化虚假新闻反驳信息,发现开放性特质提升说服力,神经质降低说服力,并探讨了多模型评估的必要性及伦理问题。

Comments In: Computational Intelligence. IJCCI 2025. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09535 2026-03-11 cs.MM cs.AI cs.CL cs.DL 86%

AI Blob! LLM-Driven Recontextualization of Italian Television Archives

AI Blob!:基于大型语言模型的意大利电视档案再上下文化

Roberto Balestri

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AI Blob!利用大型语言模型和语义技术对意大利电视档案进行再上下文化,通过自动语音识别和向量数据库实现动态检索与叙事重构。

Comments Preprint

Journal ref 16th Media Mutations International Conference (pp. 123-133) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08999 2026-03-11 cs.CR cs.AI 85%

MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Servers

MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器

Arash Ahmadi, Sarah Sharif, Yaser M. Banad

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。

Comments 42 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22706 2026-03-11 cond-mat.mtrl-sci 85%

LLM-driven discovery for carbon allotropes with bond-network entropy

基于大语言模型的碳同素异形体发现及其键网络熵

Yuzhou Hao, Yujie Liu, Xuejie Li, Turab Lookman, Xiangdong Ding, Jun Sun, Zhibin Gao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 利用大语言模型和机器学习势能结合,发现具有混合sp-sp³杂化的新型碳同素异形体,展现极端热各向异性和超硬特性。

Journal ref Appl. Phys. Lett. 128, 102202 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 84%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 83%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00184 2026-03-11 cs.CV cs.AI 83%

Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1

基于基础模型的零样本和监督鸟类图像分割:结合Grounding DINO~1.5、YOLOv11和SAM~2.1的双管道方法

Abhinav Munagala

专题命中 评测与基准 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出基于基础模型的双管道方法,利用Grounding DINO、YOLO和SAM实现零样本和监督的鸟类图像分割,提升分割精度并简化领域适应过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09940 2026-03-11 cs.LG 79%

SignalMC-MED: A Multimodal Benchmark for Evaluating Biosignal Foundation Models on Single-Lead ECG and PPG

SignalMC-MED: 一种用于评估单导联ECG和PPG上生物信号基础模型的多模态基准

Fredrik K. Gustafsson, Xiao Gu, Mattia Carletti, Patitapaban Palo, David W. Eyre, David A. Clifton

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 SignalMC-MED是一个用于评估单导联ECG和PPG上生物信号基础模型的多模态基准,展示了多模态融合和长时信号在提升模型性能上的优势。

Comments Code is available at https://github.com/fregu856/SignalMC-MED

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09043 2026-03-11 cs.AI 79%

Time, Identity and Consciousness in Language Model Agents

时间、身份与语言模型代理的意识

Elija Perrier, Michael Timothy Bennett

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种基于时间间隙的框架,用于评估语言模型代理的身份持续性,通过分离成分发生与共存,建立身份形态空间并提供保守的评估工具。

Comments Accepted at AAAI 2026 Spring Symposium - Machine Consciousness: Integrating Theory, Technology, and Philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08930 2026-03-11 cs.CV cs.AI 79%

Using Vision Language Foundation Models to Generate Plant Simulation Configurations via In-Context Learning

利用视觉语言基础模型通过上下文学习生成植物模拟配置

Heesup Yun, Isaac Kazuo Uyehara, Earl Ranario, Lars Lundqvist, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 本文利用视觉语言基础模型通过上下文学习生成植物模拟配置,解决高复杂度和低吞吐量的问题,提供可扩展的农业数字孪生框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08852 2026-03-11 cs.AI cs.MA cs.SE 79%

LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems

LDP:一种面向多智能体LLM系统的身份感知协议

Sunil Prakash

机构 * Indian School of Business(印度管理学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 LDP是一种面向多智能体LLM系统的身份感知协议,通过五种机制提升委托效率与可控性。

Comments 16 pages, 9 figures, 8 tables, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 79%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09826 2026-03-11 cs.CV 78%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 评测与基准 :language model(title,abstract)

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏