arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5035 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5035 篇

2603.22091 2026-03-24 cs.CV 50%

P-Flow: Prompting Visual Effects Generation

P-Flow:提示视觉效果生成

Rui Zhao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21288 2026-03-24 cs.HC cs.CY 50%

Unpacking Interaction Profiles and Strategies in Human-AI Collaborative Problem Solving: A Cognitive Distribution and Regulation Perspective

解析人机协作问题解决中的交互特征与策略:一种认知分布与调节视角

Zhanxin Hao, Xiaobo Liu, Jiaxin Fan, Yun Long, Jifan Yu, Wenli Chen, Yu Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文通过聚类分析发现,人类与AI协作解决复杂问题时存在三种模式:委托推理、协同解释和委托扩展,其中委托推理组表现最佳,语义相似度最高,而协同解释组自我调节策略使用更频繁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21024 2026-03-24 cs.IR 50%

Query, Decompose, Compress: Structured Query Expansion for Efficient Multi-Hop Retrieval

查询、分解、压缩:面向高效多跳检索的结构化查询扩展

JungMin Yun, YoungBin Kim

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出DeCoR框架,通过结构化信息精炼提升多跳检索效率,采用查询分解和文档压缩技术,使小模型在复杂检索中表现优于大模型。

Comments Accepted to CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20143 2026-03-23 cs.CV 50%

Synergistic Perception and Generative Recomposition: A Multi-Agent Orchestration for Expert-Level Building Inspection

协同感知与生成重组:一种多智能体协作方法用于专家级建筑检查

Hui Zhong, Yichun Gao, Luyan Liu, Xusen Guo, Zhaonian Kuang, Qiming Zhang, Xinhu Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出FacadeFixer框架,通过多智能体协作解决建筑立面缺陷检测难题,利用生成代理实现语义重组,提升检测与分割模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16963 2026-03-19 q-bio.QM cs.CV 50%

Topology-Guided Biomechanical Profiling: A White-Box Framework for Opportunistic Screening of Spinal Instability on Routine CT

拓扑引导的生物力学分析:一种白盒框架用于常规CT中脊柱不稳定性的机会性筛查

Zanting Ye, Xuanbin Wu, Guoqing Zhong, Shengyuan Liu, Jiashuai Liu, Ge Song, Zhisong Wang, Jing Hao, Xiaolong Niu, Yefeng Zheng, Yu Zhang, Lijun Lu

机构 * Southern Medical University(南方医科大学) The Affiliated Cancer Hospital of Zhengzhou University(郑州大学附属肿瘤医院) The Chinese University of Hong Kong(香港中文大学) Xi'an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学) Westlake University(西湖大学) Guangdong Provincial People's Hospital(广东省人民医院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一种白盒框架,通过拓扑引导的生物力学分析,解决常规CT中脊柱不稳定性的筛查问题,通过几何创新和可解释的AI方法提高诊断准确性。

Comments 11 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06231 2026-03-19 cs.CV 50%

RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models

RSRefSeg 2: 解耦引用遥感图像分割与基础模型

Keyan Chen, Chenyang Liu, Bowen Chen, Jiafan Zhang, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北京航空航天大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 RSRefSeg 2通过解耦传统三阶段流程,提出双阶段协作框架,结合CLIP的跨模态对齐与SAM的分割泛化能力,提升遥感图像分割精度与复杂语义解释能力。

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-20, 2026, Art no. 4700420

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16458 2026-03-18 cs.NI cs.SY eess.SY 50%

Agentic AI for SAGIN Resource Management_Semantic Awareness, Orchestration, and Optimization

面向SAGIN资源管理的代理AI:语义感知、编排与优化

Linghao Zhang, Haitao Zhao, Bo Xu, Hongbo Zhu, Xianbin Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于大语言模型的代理AI框架,用于自主管理空间-空气-地面一体化网络资源,通过语义感知、意图驱动编排和自适应学习代理协作,实现动态环境下的高效资源管理。

Comments eg.: 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12000 2026-03-17 cs.SI cs.CR cs.CY cs.HC econ.GN q-fin.EC 50%

Credibility Matters: Motivations, Characteristics, and Influence Mechanisms of Crypto Key Opinion Leaders

可信度至关重要:加密货币关键意见领袖的动机、特征及影响机制

Alexander Kropiunig, Svetlana Kremer, Bernhard Haslhofer

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 本文研究加密货币关键意见领袖的动机、特征及影响机制,基于SDT理论分析其可信度的自我决定性实践,提出四个可信度标志,并探讨高风险加密生态系统中的可信度设计。

Comments 17 pages, 3 figures. Accepted at ACM CHI 2026, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13890 2026-03-17 cs.MA 50%

Beyond Self-Interest: Modeling Social-Oriented Motivation for Human-like Multi-Agent Interactions

超越自我利益:为类人多智能体交互建模社会导向动机

Jingzhe Lin, Ceyao Zhang, Yaodong Yang, Yizhou Wang, Song-Chun Zhu, Fangwei Zhong

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出ASVO智能体,通过整合欲望驱动自主性与社会价值导向理论,实现类人多智能体交互中的社会导向动机建模,提升行为自然性和人类拟真性。

Comments 9 pages, 6 figures. Accepted to AAMAS 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13840 2026-03-17 cs.MA 50%

ClimateAgents: A Multi-Agent Research Assistant for Social-Climate Dynamics Analysis

ClimateAgents: 一种用于社会-气候动态分析的多智能体研究助手

Shan Shan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出ClimateAgents,一种多智能体研究助手,通过整合多模态数据检索、统计建模和自动推理,帮助研究者探索社会-环境动态,提升气候分析的适应性和解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13394 2026-03-17 cs.CV 50%

Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models

基于强化学习的语言引导标记压缩在大视觉-语言模型中

Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology(哈尔滨工业大学) College of Information and Control Engineering(信息与控制工程学院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV 50%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 复杂问题求解 :planning(abstract)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12644 2026-03-16 cs.CR 50%

Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw

揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例

Zonghao Ying, Xiao Yang, Siyang Wu, Yumeng Song, Yang Qu, Hainan Li, Tianlin Li, Jiakai Wang, Aishan Liu, Xianglong Liu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10343 2026-03-12 eess.SP 50%

Multi-Modal Intelligent Channel Modeling: From Fine-tuned LLMs to Pre-trained Foundation Models

多模态智能信道建模:从微调大语言模型到预训练基础模型

Lu Bai, Zengrui Han, Mingran Sun, Xiang Cheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09599 2026-03-11 cs.SE 50%

Preparing Students for AI-Driven Agile Development: A Project-Based AI Engineering Curriculum

为AI驱动的敏捷开发培养学生:一种基于项目的AI工程课程

Andreas Rausch, Stefan Wittek, Tobias Geger, David Inkermann

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一种基于项目的AI工程课程,通过整合敏捷实践与AI赋能的工程,培养学生在AI驱动的敏捷开发中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09134 2026-03-11 cs.CR cs.MA cs.SE 50%

AgenticCyOps: Securing Multi-Agentic AI Integration in Enterprise Cyber Operations

AgenticCyOps:保障企业网络操作中的多智能体AI集成安全

Shaswata Mitra, Raj Patel, Sudip Mittal, Md Rayhanur Rahman, Shahram Rahimi

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AgenticCyOps提出了一种基于信任边界的多智能体AI集成安全框架,通过分解攻击面并定义五个防御原则,有效减少攻击向量和提升企业网络安全水平。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08812 2026-03-11 cs.CV 50%

VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model

VisionCreator-R1: 一种增强反思的原生视觉生成代理模型

Jinxiang Lai, Wenzhe Zhao, Zexin Lu, Hualei Zhang, Qinyu Yang, Rongwei Quan, Zhimin Li, Shuai Shao, Song Guo, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文言) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 复杂问题求解 :planning(abstract)

AI总结 VisionCreator-R1通过引入反射-计划联合优化方法,提升视觉生成代理在单图和多图任务中的表现,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 50%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00121 2026-03-06 cs.MA 50%

Graph-theoretic Agreement Framework for Multi-agent LLM Systems

图论同意框架用于多智能体大语言模型系统

Muhammad Umar Javed

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出图论框架用于分析多智能体大语言模型中的共识稳定性,通过映射Transformer交叉熵到带符号拉普拉斯矩阵,解决不可观测死锁问题,并验证了共识定理和多项式时间算法。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12112 2026-03-06 cs.CR 50%

BRIDG-ICS: AI-Grounded Knowledge Graphs for Intelligent Threat Analytics in Industry~5.0 Cyber-Physical Systems

BRIDG-ICS:面向工业5.0 CPS的AI驱动知识图谱用于智能威胁分析

Padmeswari Nandiya, Ahmad Mohsin, Ahmed Ibrahim, Iqbal H. Sarker, Helge Janicke

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BRIDG-ICS通过AI驱动的知识图谱实现工业5.0中网络物理系统的智能威胁分析与韧性评估

Comments 44 Pages, To be published in Springer Cybersecurity Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15569 2026-03-04 cs.HC 50%

What Are You Doing? Effects of Intermediate Feedback from Agentic LLM In-Car Assistants During Multi-Step Processing

你在做什么?代理LLM车载助手在多步骤处理中的中间反馈影响

Johannes Kirmayr, Raphael Wennmacher, Khanh Huynh, Lukas Stappen, Elisabeth André, Florian Alt

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨了代理式LLM车载助手在多步骤处理中中间反馈对用户体验的影响,发现中间反馈能提升信任和效率,同时减少任务负荷,提出适应性反馈策略以平衡透明度与效率。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04426 2026-03-04 cs.CV 50%

Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation

自适应与自纠正的遮蔽预测用于电影预告片生成

Sidan Zhu, Hongteng Xu, Dixin Luo

机构 * Key Laboratory of Artificial Intelligence Ministry of Education, Shanghai(教育部人工智能重点实验室,上海)

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 SSMP通过双向上下文建模和逐步自纠正方法实现电影预告片生成的最先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02590 2026-03-04 cs.CR 50%

Extending the Formalism and Theoretical Foundations of Cryptography to AI

扩展密码学形式化和理论基础以适应人工智能

Federico Villa, F. Betül Durak, Tadayoshi Kohno, Tapdig Maharramli, Franziska Roesner

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23141 2026-03-04 cs.CV 50%

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent: 解锁地球观测的全貌与潜力

Peilin Feng, Zhutao Lv, Junyan Ye, Xiaolei Wang, Xinjie Huo, Jinhua Yu, Wanghan Xu, Wenlong Zhang, Lei Bai, Conghui He, Weijia Li

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04366 2026-03-03 cs.HC cs.MM 50%

Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent-Child Interaction

向人类专家对齐多模态大语言模型:聚焦亲子互动

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。

Comments Accepted at CHI 2026 Full Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00926 2026-03-03 cs.RO 50%

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作

Xiongfeng Peng, Jiaqian Yu, Dingzhe Li, Yixiang Jin, Lu Xu, Yamin Mao, Chao Zhang, Weiming Li, Sujin Jang, Dongwook Lee, Daehyun Ji

机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Hanyang University ERICA(翰洋大学ERICA)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 50%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23980 2026-03-02 cs.CV 50%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 复杂问题求解 :CoT(abstract)

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14245 2026-03-02 cs.IR 50%

XR: Cross-Modal Agents for Composed Image Retrieval

XR:跨模态代理用于组合图像检索

Zhongyu Yang, Wei Pang, Yingfang Yuan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 XR通过多代理协作提升组合图像检索性能,实现38%的提升

Comments Accepted by WWW 2026. Project: https://01yzzyu.github.io/xr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27566 2026-02-27 cs.IR 50%

Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval

Interact-RAG: 基于语义交互的检索增强生成,超越黑盒检索

Yulong Hui, Chao Chen, Zhihang Fu, Yihao Liu, Jieping Ye, Huanchen Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Interact-RAG通过引入语义交互引擎,使LLM代理能够主动操控检索过程,从而提升复杂信息检索任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏