arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2601.21617 2026-01-30 cs.CV 78%

PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization

PathReasoner-R1: 通过知识引导的策略优化在病理视觉-语言模型中引入结构化推理

Songhan Jiang, Fengchun Liu, Ziyue Wang, Linghan Cai, Yongbing Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Technical University of Dresden(德累斯顿技术大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 PathReasoner-R1通过知识引导的策略优化,在病理视觉-语言模型中引入结构化推理,提升模型的临床推理能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17614 2026-01-27 cs.HC 78%

AlignUI: A Method for Designing LLM-Generated UIs Aligned with User Preferences

AlignUI: 一种用于设计与用户偏好一致的LLM生成UI的方法

Yimeng Liu, Misha Sra, Chang Xiao

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 AlignUI通过用户偏好数据集引导LLM生成与用户任务和偏好一致的UI,提升UI设计与用户需求的匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14506 2026-01-27 cs.RO 78%

InteLiPlan: An Interactive Lightweight LLM-Based Planner for Domestic Robot Autonomy

InteLiPlan:一种交互式轻量级基于大语言模型的规划器,用于家用机器人自主性

Kim Tien Ly, Kai Lu, Ioannis Havoutis

机构 * Middlesex University(中塞克斯大学) Oxford Robotics Institute, University of Oxford(牛津机器人研究所,牛津大学)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 InteLiPlan是一种基于大语言模型的轻量级交互式规划器,通过实时机载计算实现家用机器人自主性和鲁棒性的提升,成功完成95%的任务执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16458 2026-01-26 cs.SE cs.CR 78%

Bridging Expert Reasoning and LLM Detection: A Knowledge-Driven Framework for Malicious Packages

弥合专家推理与大语言模型检测:一种基于知识的恶意包检测框架

Wenbo Guo, Shiwen Song, Jiaxun Guo, Zhengzi Xu, Chengwei Liu, Haoran Ou, Mengmeng Ge, Yang Liu

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 IntelGuard通过整合专家推理与大语言模型,实现高准确率的恶意包检测,发现54个未报告恶意包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14778 2026-01-22 cs.CR 78%

STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model

STEAD: 基于扩散语言模型的鲁棒可证明安全语言隐写术

Yuang Qi, Na Zhao, Qiyi Yao, Benlong Wu, Weiming Zhang, Nenghai Yu, Kejiang Chen

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 STEAD利用扩散语言模型实现鲁棒且可证明安全的语言隐写术,通过部分并行生成和纠错策略提升隐写文本的抗篡改能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14566 2026-01-22 cs.HC 78%

SCSimulator: An Exploratory Visual Analytics Framework for Partner Selection in Supply Chains through LLM-driven Multi-Agent Simulation

SCSimulator: 一种基于LLM驱动多智能体模拟的供应链伙伴选择探索性可视化分析框架

Shenghan Gao, Junye Wang, Junjie Xiong, Yun Jiang, Yun Fang, Qifan Hu, Baolong Liu, Quan Li

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 SCSimulator通过LLM驱动的多智能体模拟与人机协作,探索供应链伙伴选择的动态博弈,提供透明的决策解释和可交互的分析工具。

Comments ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13933 2026-01-21 cs.SE 78%

VulnResolver: A Hybrid Agent Framework for LLM-Based Automated Vulnerability Issue Resolution

VulnResolver: 一种基于大语言模型的混合代理框架用于LLM驱动的自动漏洞问题解决

Mingming Zhang, Xu Wang, Jian Zhang, Xiangxin Meng, Jiayi Zhang, Chunming Hu

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 VulnResolver是一种基于大语言模型的混合代理框架,通过上下文预收集和安全属性分析代理,实现自动化漏洞问题的高效解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13705 2026-01-21 cs.CV 78%

Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles

推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型

Maria Lymperaiou, Vasileios Karampinis, Giorgos Filandrianos, Angelos Vlachos, Chrysoula Zerva, Athanasios Voulodimos

机构 * National Technical University of Athens(国家技术大学雅典) Instituto de Telecomunicações(电信研究所)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05839 2026-01-21 cs.CV 78%

GeoSurDepth: Harnessing Foundation Model for Spatial Geometry Consistency-Oriented Self-Supervised Surround-View Depth Estimation

GeoSurDepth:利用基础模型实现以空间几何一致性为导向的自监督周围视图深度估计

Weimin Liu, Wenjun Wang, Joshua H. Meng

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(1 智能绿色车辆与移动国家重点实验室,车辆与移动学院,清华大学,北京100084,中国) California PATH, University of California, Berkeley, CA, United States(2 加州PATH,加州大学伯克利分校,加州,美国)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 GeoSurDepth通过利用基础模型和几何一致性,实现了更鲁棒的自监督周围视图深度估计,验证了其在自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12626 2026-01-21 cs.CV 78%

Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models

线性机制用于视觉语言模型中的时空推理

Raphi Kang, Hongqiao Chen, Georgia Gkioxari, Pietro Perona

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出了一种线性机制用于视觉语言模型中的时空推理,通过分析空间ID和时间ID的结合,揭示了模型内部的因果推理过程,以提升模型的可解释性和设计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16475 2026-01-21 cs.HC cs.RO 78%

LLM-Glasses: GenAI-driven Glasses with Haptic Feedback for Navigation of Visually Impaired People

LLM-Glasses: 基于生成式AI的具有触觉反馈的眼镜用于盲人导航

Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Yara Mahmoud, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 LLM-Glasses通过生成式AI和触觉反馈为视障人士提供导航支持,实验显示其在不同障碍物环境下具有较高的导航准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11322 2026-01-19 cs.CV cs.LO 78%

Enhancing Vision Language Models with Logic Reasoning for Situational Awareness

通过逻辑推理增强视觉语言模型以提升情境感知能力

Pavana Pradeep, Krishna Kant, Suya Yu

机构 * CIS Department, Temple University(Temple大学计算机与信息科学系) ARL(美国陆军研究实验室)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文通过整合逻辑推理与传统计算机视觉方法,提升视觉语言模型在情境感知中的准确性与细粒度事件识别能力。

Comments Accepted for publication in IEEE Transactions on AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07695 2026-01-16 cs.CV 78%

Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model

平滑操作符:平滑可验证奖励激活视觉-语言模型的空间推理能力

Siwen Jiao, Tianxiong Lv, Kangan Qian, Chenxu Zhao, Xiuyuan Zhu, Tianlun Li, Xiaolong Cheng, Jinyu Li, Zhihao Liao, Yang Cai

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出平滑可验证奖励激活方法,通过平滑操作符和绝对保持GRPO框架提升视觉-语言模型对3D场景的理解能力,实现性能与数据效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20412 2026-01-16 cs.CR 78%

MindGuard: Intrinsic Decision Inspection for Securing LLM Agents Against Metadata Poisoning

MindGuard:内在决策检查用于保护LLM代理免受元数据中毒攻击

Zhiqiang Wang, Haohua Du, Guanquan Shi, Junyang Zhang, HaoRan Cheng, Yunhao Yao, Kaiwen Guo, Xiang-Yang Li

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 MindGuard通过决策依赖图检测和归因LLM代理中的元数据中毒攻击,实现高精度的污染调用检测与溯源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06464 2026-01-13 cs.CV 78%

On the Adversarial Robustness of 3D Large Vision-Language Models

关于3D大视觉-语言模型的对抗鲁棒性

Chao Liu, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04752 2026-01-09 cs.CV 78%

Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition

基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用

Masatomo Yoshida, Haruto Namura, Nicola Adami, Masahiro Okuda

机构 * Doshisha University Kyoto, 610-0394 Japan University of Brescia Brescia, 25134 Italy Independent Researcher Tokyo, Japan

专题命中 推理与问题求解 :language model(title);foundation model(abstract)

AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。

Comments accepted to ITC-CSCC 2025

Journal ref Proc. ITC-CSCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 78%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04118 2026-01-09 cs.CV 78%

GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning

GeoReason: 通过逻辑一致性强化学习对遥感视觉-语言模型中的思考与回答进行对齐

Wenshuai Li, Xiantai Xiang, Zixiao Wen, Guangyao Zhou, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuxin Hu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 GeoReason通过逻辑一致性强化学习提升遥感视觉-语言模型的推理可靠性与可解释性,实现思考与决策的同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23019 2026-01-06 cs.RO 78%

Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration

通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架

Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。

Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21250 2025-12-25 cs.CR cs.MA 78%

CoTDeceptor:Adversarial Code Obfuscation Against CoT-Enhanced LLM Code Agents

CoTDeceptor:对抗增强CoT的LLM代码代理的对抗性代码混淆

Haoyang Li, Mingjin Li, Jinxin Zuo, Siqi Li, Xiao Li, Hao Wu, Yueming Lu, Xiaochuan He

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 CoTDeceptor通过构建多阶段混淆策略链,有效对抗增强CoT的LLM检测器,实现对14个漏洞类别的绕过。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20417 2025-12-24 cs.CV cs.MA 78%

Chain-of-Anomaly Thoughts with Large Vision-Language Models

基于大视觉-语言模型的异常思维链

Pedro Domingos, João Pereira, Vasco Lopes, João Neves, David Semedo

机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学与技术学院) NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内尔大学) DeepNeuronic

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出CoAT框架,通过引入异常偏见提升大视觉-语言模型在异常检测和分类任务中的性能。

Comments 2 pages, 3 figures, 1 table. Accepted for RECPAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21559 2025-12-23 cs.CV 78%

X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning

X-CoT:基于LLM链式推理的可解释文本到视频检索

Prasanna Reddy Pulakurthi, Jiamian Wang, Majid Rabbani, Sohail Dianat, Raghuveer Rao, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 X-CoT通过基于LLM的链式推理实现文本到视频检索的可解释性,提升检索性能并提供详细的推理依据。

Comments 12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)

Journal ref Proc. EMNLP 2025, pages 31172-31183, Suzhou, China, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16561 2025-12-19 cs.CV 78%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 78%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12656 2025-12-16 cs.LO 78%

Argumentative Reasoning with Language Models on Non-factorized Case Bases

基于非因子化案例库的语言模型论证推理

Wachara Fungwacharakorn, May Myo Zin, Ha-Thanh Nguyen, Yuntao Kong, Ken Satoh

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出AAM-CBR框架,通过语言模型实现非因子化案例库的基于案例推理,提升灵活性和隐私性,并展示在因素数量增加时需结合符号推理以提高效果。

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 78%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10610 2025-12-12 cs.MA 78%

Thinking While Driving: A Concurrent Framework for Real-Time, LLM-Based Adaptive Routing

驾驶中思考:一种用于实时、基于大语言模型的自适应路由的并发框架

Xiaopei Tan, Muyang Fan

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 该研究提出了一种基于大语言模型的实时自适应路由框架,通过并发处理实现动态路径规划与拥堵绕行,提升交通效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04441 2025-12-09 cs.CV 78%

MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving

MindDrive: 一个整合世界模型和视觉-语言模型的全功能框架,用于端到端自动驾驶

Bin Sun, Yaoguang Cao, Yan Wang, Rui Wang, Jiachen Shang, Xiejie Feng, Jiayi Lu, Jia Shi, Shichun Yang, Xiaoyu Yan, Ziying Song

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Laboratory of Intelligent Transportation System, Beihang University(北京航空航天大学智能交通系统国家重点实验室) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新院) Contemporary Amperex Technology Co., Limited (CATL)(当代电动车技术有限公司(CATL)) Research Institute of Aero-Engine, Beihang University(北京航空航天大学航空发动机研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) China Automotive Engineering Research Institute Co., Ltd.(中国汽车工程研究院股份有限公司)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 MindDrive通过整合世界模型和视觉-语言模型,提出了一种端到端自动驾驶框架,实现高质量轨迹生成与多目标决策推理,提升自动驾驶的安全性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02185 2025-12-03 cs.CL cs.AI cs.LG 78%

Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models

在行动前剪枝:面向推理语言模型的自反思结构剪枝

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Guanchu Wang, Minwoo Lee, Shu-ping Yeh, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学) Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 RESP通过自反思结构化剪枝框架,在保持推理连贯性的同时显著提升稀疏度下的性能

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 78%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏