arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5035 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5035 篇

2608.25711 2026-08-27 cs.CR 新提交 50%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25099 2026-08-27 math.OC math.DS 新提交 50%

A Control-Theoretic Approach for Resource-Aware Consensus in Multi-Agent AI

面向多智能体AI中资源感知共识的控制论方法

James Flagg, Esteban A. Hernandez-Vargas

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究针对LLM-MAS共识性能与计算资源关联保证不足的问题,提出将集体信念动态表征为离散时间切换系统的控制论方法,构建共识-预算证书区域,实现资源感知的多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 50%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24374 2026-08-26 cs.SD 新提交 50%

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐

Peiwei Ren, Jinbo Hu, Fang Kang, Shan Liang, Yin Cao

机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) University of Oulu(奥卢大学) Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 50%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23050 2026-08-26 cs.HC 版本更新 50%

What Makes an Initial Reaction Ready for Discussion?: Multi-Persona AI Support for Stance Reflection and Writing

是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持

Sky Shih-Kai Hong, Mu-Tien Kuo, Wei-Ji Chen, Dennis Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。

Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 (https://taichi2026.taiwanchi.org/program)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23115 2026-08-25 cs.SE 新提交 50%

A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis

基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架

Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi, Qing Shan, Geerten M. Hengeveld, Ioannis N. Athanasiadis, Zhiming Zhao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。

Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22151 2026-08-25 cs.SE cs.ET 新提交 50%

Towards Actionable Visualization: Ten Years Later, What Generative AI Changes and What It Cannot

面向可操作的可视化:十年之后,生成式AI带来了什么改变,又有什么是它做不到的

Leonel Merino, Mohammad Ghafari, Oscar Nierstrasz

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究回顾了十年前软件可视化领域的研究现状,探讨生成式AI对该领域的改变与局限,提出未来应聚焦于帮助人类理解复杂软件系统及AI生成内容,并指出可操作可视化已成为该领域可达成的标准。

Comments 2026 IEEE Working Conference on Software Visualization (VISSOFT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 50%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-08-20 cs.CV 版本更新 50%

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17960 2026-08-19 cs.CR 新提交 50%

COMA: A Compositional Misleading Attack Class on Security-RAG, and a Causal Counterfactual Defense

COMA:针对安全检索增强生成(Security-RAG)的组合式误导攻击类别及因果反事实防御

Chinmay Gondhalekar, Urjitkumar Patel

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究针对Security-RAG提出COMA组合式误导攻击,含行动破坏与结论翻转两种实现,提出因果反事实防御(ccd)可有效定位并防御该攻击,已发布攻击种子与ccd参考实现。

Comments Accepted at the IEEE Conference on Generative AI for Secure Systems (GAISS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13536 2026-08-17 cs.OS 版本更新 50%

Don't Let AI Agents YOLO Your Files: Information and Control in Agent-Native Filesystems

别让AI代理占用你的文件:将信息和控制移交给文件系统以实现代理安全和自主性

Shawn Wanxiang Zhong, Junxuan Liao, Jing Liu, Mai Zheng, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 本文研究了AI代理对文件系统的滥用问题,提出YoloFS文件系统通过三种技术提升代理的安全性和自主性,减少用户交互并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28080 2026-08-17 cs.DB 50%

Can Large Language Models be a Cardinality Estimator? An Empirical study

大语言模型可以成为基数估计器吗?一项实证研究

Liangzu Liu, Yiyan Wang, Yinjun Wu, Runze Su, Zhuo Chang, Peizhi Wu, Jianjun Chen, Fuxin Jiang, Rui Shi, Bin Cui, Tieying Zhang

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 本文探讨了大语言模型在基数估计中的应用,通过实验证明其在泛化能力、复杂查询支持和数据效率方面的优势,展示了其在数据库管理系统中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13384 2026-08-14 cs.IR cs.DB 新提交 50%

Structure then Query: Enabling Precise Analytical Queries over Unstructured Documents

先结构后查询:支持对非结构化文档进行精确分析查询

Teng Lin, Yuyu Luo, Nan Tang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AnnoIndex通过注释索引与结构化查询引擎,解决非结构化文档精确分析查询难题,在三个数据集上平均F1达0.87,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 50%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12533 2026-08-14 physics.ed-ph 新提交 50%

Probing AI-generated physics solutions and preparing students to critique them

探究人工智能生成的物理解答并培养学生对其进行评判的能力

Nikhil Sanjay Borse, Amir Bralin, Sean Savage, N. Sanjay Rebello

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。

Comments 6 pages, 1 figure, Physics Education Research Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16616 2026-08-13 cs.DB 版本更新 50%

LDI: Localized Data Imputation for Text-Rich Tables

LDI:面向文本丰富表的局部数据填补

Soroush Omidvartehrani, Davood Rafiei

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出LDI框架,通过局部推理利用LLM填补文本丰富表中的缺失值,提升准确性和可解释性,实验证明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10187 2026-08-12 cs.IR cs.SI 新提交 50%

ConnectionMind: Leveraging Social Networks and Large Language Models for Personalized Recommendation at Meta

ConnectionMind:利用社交网络与大语言模型实现 Meta 平台的个性化推荐

Haoyu Han, Yuming Liu, Lei Huang, Lizhu Zhang, Jiliang Tang, Xiangjun Fan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出 ConnectionMind 框架,结合社交网络与 LLM,经两阶段学习训练后,在 Meta 部署并通过 A/B 测试实现视频观看时长 0.43% 的提升,解决传统推荐模型的多关系上下文整合不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08497 2026-08-11 cs.HC cs.MA cs.SI 新提交 50%

SocialFiVis: A Visual Analytics Sandbox for LLM-Grounded Multi-Agent Simulation in Social Finance

SocialFiVis:面向社会金融中基于大语言模型的多智能体模拟的可视分析沙箱

Yi-Fan Cao, Qing Shi, Liangwei Wang, Leo Yu-Ho Lo, Lin Chen, Yuzi Han, Yang Wang, Kani Chen

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出嵌入IAD框架的可视分析沙箱SocialFiVis,结合LLM与PRA引擎模拟多智能体,支持探索社会金融领域反事实政策并解释相关涌现现象。

Comments 11 pages, 7 figures, 2 tables. Accepted to IEEE VIS 2026; to appear in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08413 2026-08-11 cs.SE 新提交 50%

Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications

Tangent:基于大语言模型的智能体应用测试实践的实证研究

Rangeet Pan, Tyler Stennett, Divya Sankar, Bridget McGinn, Alessandro Orso, Raju Pavuluri, Saurabh Sinha, Maja Vukovic

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Tangent通过对开源项目和行业从业者的研究,分析了LLM智能体应用的测试现状,发现其以单元测试为主、存在覆盖不足等问题,并提出了相关研究方向。

Comments Accepted at ASE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23065 2026-08-11 cs.HC 版本更新 50%

Touching or Chatting: The Utility of LLMs and Tactile Charts for Learning about Complex Chart Types by BLV Individuals

触摸还是聊天:大语言模型和触觉图表对视力障碍者学习复杂图表类型的效用

Tingying He, Maggie McCracken, Daniel Hajas, Sarah Creem-Regehr, Alexander Lex

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨大语言模型对视力障碍者图表类型学习的影响及触觉学习的作用,通过扩展触觉图表学习工具并比较两种学习形式,发现触觉模板有助于形成心理模型,利于后续数据探索,无触觉支持的文本加LLM解释在空间推理任务中有弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16623 2026-08-11 cs.NE 版本更新 50%

How to Build Marcus's Algebraic Mind: From Minsky's Emotion-Machine Viewpoint

如何构建马库斯的代数思维:从明斯基的情感机器视角出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文从明斯基的《情感机器》视角解读VaCoAl架构,探讨如何构建马库斯的代数思维。通过精确可逆性实现内省,将思考分三层,还承载泛类比和信用分配观点,有助于提升到内省层次并找到交叉点,为构建代数思维提供新视角。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16573 2026-08-11 cs.NE 版本更新 50%

How to Build Marcus's Algebraic Mind: From Thagard's Brain--Mind Viewpoint

如何构建马库斯的代数思维:从萨伽德的脑-心观点出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究从萨伽德的脑-心观点出发,探讨如何构建马库斯的代数思维。提出VaCoAl和PyVaCoAl架构,其绑定操作具有可逆等特性,能填补马库斯代数思维组件空缺,消除卷积退化,还通过相关主张阐述了能力、必要性及自身立场。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07304 2026-08-10 cs.PF cs.CE 新提交 50%

The Token Efficiency Index: A Peer-Benchmarked Composite Indicator for AI Token Efficiency

令牌效率指数:用于AI令牌效率的同行基准复合指标

Caden Wong, Vikram Das, Himanshu Dhami

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出TEI,一种同行基准复合指标,通过纳入组织AI使用数据计算三类指标并聚合,生成0-100分等结果,以透明方式基准AI令牌效率并识别支出优化机会。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14778 2026-08-10 physics.ed-ph 50%

Analyzing Undergraduate Problem-Solving in Physics Through Interaction With an AI Chatbot

Syed Furqan Abbas Hashmi, N. Sanjay Rebello

专题命中 复杂问题求解 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 50%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 复杂问题求解 :planning(abstract)

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 50%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04166 2026-08-06 cs.HC 新提交 50%

Enacting Constructive Conflicts with AI Agents to Enhance Reconsideration among Novice Interaction Designers

借助AI智能体构建建设性冲突以提升新手交互设计师的重新考量能力

Howard Ziyu Han, Nikolas Martelaro

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究构建受对抗性设计理论启发的AI智能体,通过45名设计学生的实验发现,该智能体实施的建设性冲突可提升新手交互设计师的重新考量能力,推动设计改进与创意拓展。

Comments 8 pages, 4 figures, conditionally accepted to Human-Agent Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 50%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏