arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5035 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5035 篇

2605.16561 2026-05-19 cs.PL cs.CR 50%

Compile-time Security Analysis and Optimization of Sensitive String Producers

编译时敏感字符串生成器的安全分析与优化

Mike Samuel, Tom Palmer, Shaw Summa, Robert Grayson

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 本文提出一种通用安全内容编译框架,通过扩展内容语言并整合到通用编程语言中,减少安全与不安全惯用法的词法距离,提升运行性能并提供开发者面向的诊断信息。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15792 2026-05-18 cs.CV 50%

Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

反向流动:大型多模态模型中的生成到理解协同效应

Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出生成到理解协同效应,通过生成过程作为中间推理步骤提升多模态理解,揭示生成与理解的双向关系及模型自我反思的不足。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15322 2026-05-18 cs.HC 50%

Overreliance in Writing Tasks: Exploring Similarity-Based Measures of AI Influence on Writing and Proposing a Reflective Writing Interface Intervention

写作任务中的过度依赖:探索基于相似性的AI对写作影响的测量并提出反思性写作界面干预

Vitor H. A. Welzel, Nicholas Vincent

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨了生成式AI对写作任务的影响,通过混合方法研究发现AI建议重用现象,并设计评估了支持写作过程中反思的界面,提升用户对AI输出的意识。

Comments Accepted to ACM FAccT 2026; 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15300 2026-05-18 cs.CV 50%

Deep Pre-Alignment for VLMs

视觉语言模型的深度预对齐

Tianyu Yu, Kechen Fang, Zihao Wan, Kaidong Zhang, Yicheng Zhang, Jun Song, Bo Zheng, Yuan Yao

机构 * Tsinghua University Shanghai Qi Zhi Institute Taobao \& Tmall Group of Alibaba

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。

Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14795 2026-05-15 cs.CV 50%

COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking

COAL: 基于反事实和观察增强的对齐学习用于判别性参照多目标跟踪

Shukun Jia, Shiyu Hu, Yipei Wang, Ximeng Cheng, Yichao Cao, Xiaobo Lu

机构 * School of Automation, Southeast University, Nanjing, China(东南大学自动化学院,南京,中国) Key Laboratory of Measurement and Control of Complex Systems of Engineering, Ministry of Education, Nanjing, China(工程复杂系统测量与控制国家重点实验室,教育部,南京,中国) School of Physical & Mathematical Sciences, Nanyang Technological University, Singapore(南洋理工大学物理与数学科学学院,新加坡) Big Data Institute, Central South University, Changsha, China(中南大学大数据研究院,长沙,中国)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 COAL通过知识正则化解决RMOT中高判别性需求与稀疏语义监督的矛盾,引入显式语义注入和反事实学习提升多目标跟踪的判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 50%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 复杂问题求解 :planning(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23477 2026-05-15 cs.DB 50%

SEMA-SQL: Beyond Traditional Relational Querying with Large Language Models

SEMA-SQL:超越传统关系查询的大型语言模型

Yin Lin, Tianjing Zeng, Zhongjun Ding, Rong Zhu, Bolin Ding, H. V. Jagadish, Jingren Zhou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SEMA-SQL通过结合关系操作与LLM语义推理,自动回答自然语言问题,提升查询能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20206 2026-05-15 cs.CV 50%

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13382 2026-05-14 cs.RO 50%

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

BlockVLA: 通过块扩散微调加速自回归VLA

Ruiheng Wang, Shuanghao Bai, Haoran Zhang, Badong Chen, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出BlockVLA框架,通过块扩散方法将预训练自回归模型转化为高效离散扩散策略,减少推理延迟并提升训练效率,实验证明在复杂长周期任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19207 2026-05-13 cs.CV 50%

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

长话短说:在对比视觉语言模型中解构组合性与长描述理解

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文研究对比视觉语言模型中组合推理与长描述理解之间的关系,通过实验发现两者存在双向但敏感的关联,高质量数据和合理架构设计有助于提升模型泛化能力。

Comments To be published in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09927 2026-05-12 physics.optics physics.data-an 50%

Information Extraction of Nested Complex Structure of Quantum Cascade Lasers via Large Language Models

通过大语言模型提取量子级联激光器嵌套复杂结构的信息

Xiao Fang, Ming Lü, Hanwen Liang, Xingshen Song, Kele Xu, Hui Cai, Chaofan Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于JSON Schema指导的信息提取流程,提升复杂结构数据提取精度,通过12种先进LLM测试,最高F1分数达83.4%,显著提升中等和开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09304 2026-05-12 cs.SE cs.HC 50%

Generating Complex Code Analyzers from Natural Language Questions

从自然语言问题生成复杂代码分析器

Amirmohammad Nazari, Sadra Sabouri, Wang Bill Zhu, Robin Jia, Souti Chattopadhyay, Mukund Raghothaman

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出Merlin系统,通过整合LLM与CodeQL,解决复杂代码分析问题,提升代码问题解答的准确性和效率。

Comments 12 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09265 2026-05-12 cs.CE 50%

Agentic AI for Particle-Based Simulation: Automating SPH Workflows for Debris Flow Modeling

基于代理的AI用于粒子模拟:自动化SPH工作流用于碎屑流建模

Danrong Zhang, Ruijia Wang, Chenying Liu, Yumeng Zhao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出首个用于无网格模拟的代理AI工作流,通过整合工具编排、多模态输入和人机交互,实现了碎片流建模的端到端模拟,展示了多模态输入在提升用户体验和减少失败模式方面的优势。

Comments 24 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV 50%

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01158 2026-05-05 cs.CY 50%

The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining

思考的隐性成本:语言模型的能耗与环境影响(超出预训练阶段)

Jacob Morrison, Noah A. Smith, Emma Strubell

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究分析了语言模型全开发流程的环境影响,发现推理模型在数据中心能耗上是指令模型的17倍,开发成本占总计算量的82.2%,整体能耗达12.3GWh,排放4251吨CO2eq,水耗15887千升,需纳入环境报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 50%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00282 2026-05-04 cs.HC 50%

Developing an AI Concept Envisioning Toolkit to Support Reflective Juxtaposition of Values and Harms

开发一种AI概念展望工具包以支持反思性地比较价值观与危害

Pitch Sinlapanuntakul, Soyun Moon, Yuri Kawada, Yeha Chung, Mark Zachry

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出AI概念展望工具包,通过价值-危害卡片和价值-张力图,帮助设计者在早期阶段反思价值观与潜在危害,提升伦理透明度。

Comments 22 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00280 2026-05-04 cs.HC 50%

How Designers Envision Value-Oriented AI Design Concepts with Generative AI

设计师如何用生成式AI构思价值导向的人工智能设计概念

Pitch Sinlapanuntakul, Aayushi Dangol, Xiaoyi Xue, Mark Zachry

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨设计师在使用生成式AI工具时如何平衡价值与潜在危害,揭示了递归价值冲突及多层级价值张力,提出通过元设计推理进行前瞻性判断的方法。

Comments 19 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26462 2026-04-30 cs.CV 50%

A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows

一种多阶段提取流水线用于长扫描金融文档:工业KYC工作流的实证研究

Yuxuan Han, Yuanxing Zhang, Yushuo Wang, Yichao Jin, Kenneth Zhu Ke, Jingyuan Zhao

机构 * OCBC

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出多阶段提取框架,整合图像预处理、多语言OCR、混合页面级检索和紧凑VLM基于结构化提取,提升复杂多页文档的提取精度,实验证明在工业KYC工作中性能优于直接PDF到VLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25880 2026-04-29 cs.SE 50%

From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions

从线程到轨迹:一个多LLM管道用于从GitHub问题讨论中提取社区知识

Nazia Shehnaz Joynab, Soneya Binta Hossain

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SWE-MIMIC-Bench数据集,通过多LLM管道从GitHub讨论生成问题轨迹,用于提取复杂问题的结构化知识,提升软件工程社区的协作理解与LLM训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24118 2026-04-28 cs.CR 50%

AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization

AgentVisor: 通过语义虚拟化防御LLM代理的提示注入

Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 本文提出AgentVisor框架,通过语义权限分离防御LLM代理的提示注入攻击,结合经典操作系统安全原语设计审计协议,并引入自修正机制,实验表明其在安全性和实用性上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22217 2026-04-27 cs.SE 50%

RAG-Reflect: Agentic Retrieval-Augmented Generation with Reflections for Comment-Driven Code Maintenance on Stack Overflow

RAG-Reflect:基于反思的代理检索增强生成用于Stack Overflow的评论驱动代码维护

Mehedi Hasan Shanto, Muhammad Asaduzzaman, Alioune Ngom

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出RAG-Reflect框架,通过检索增强推理和自我反思机制,实现精确的评论-编辑预测,提升代码维护效率。

Comments 27 pages, submitted to the TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19899 2026-04-23 cs.IR 50%

A Reproducibility Study of Metacognitive Retrieval-Augmented Generation

元认知检索增强生成的可重复性研究

Gabriel Iturra-Bocaz, Petra Galuscakova

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文研究了元认知检索增强生成(MetaRAG)的可重复性,评估了点wise和listwise重排器的效果,并与SIM-RAG进行比较,发现MetaRAG在相对改进上优于标准RAG,但绝对分数较低,反映了闭源LLM更新和实现细节缺失的问题。

Comments Paper accepted at ACM SIGIR Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13533 2026-04-23 cs.RO cs.CV 50%

Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization

可进化具身代理:通过长期短期反思与优化实现机器人操作

Jianzong Wang, Botao Zhao, Yayun He, Junqing Peng, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 复杂问题求解 :planning(abstract)

AI总结 本文提出EEAgent框架,通过长短期反思优化机制提升机器人在复杂任务中的适应能力,实现自我进化,优于现有方法。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20553 2026-04-23 cs.SE 50%

DeepParse: Hybrid Log Parsing with LLM-Synthesized Regex Masks

DeepParse: 基于LLM合成的混合日志解析

Amir Shetaia, Sean Kauffman

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出DeepParse,通过LLM提取日志变量模式并结合Drain算法实现高效准确的日志解析,提升提取精度与一致性,降低误报并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06771 2026-04-23 cs.SI 50%

Heterogeneous Interaction Network Analysis (HINA): A New Learning Analytics Approach for Modelling, Analyzing, and Visualizing Complex Interactions in Learning Processes

异质交互网络分析(HINA):一种新的学习分析方法,用于建模、分析和可视化学习过程中的复杂交互

Shihui Feng, Baiyue He, Dragan Gasevic, Alec Kirkley

专题命中 复杂问题求解 :planning(abstract)

AI总结 本文提出HINA,一种多层级学习分析框架,用于建模多样化实体间的复杂学习过程,通过案例研究揭示学生与同伴和AI的交互特征及学习行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18834 2026-04-22 cs.SE cs.SY eess.SY 50%

Structural Verification for Reliable EDA Code Generation without Tool-in-the-Loop Debugging

结构验证用于无需工具在回路调试的可靠EDA代码生成

Dinithi Jayasuriya, Aravind Saravanan, Nilesh Ahuja, Amanda Rios, Amit Trivedi

专题命中 复杂问题求解 :verifier(abstract)

AI总结 本文提出通过强制执行结构正确性来提高EDA代码生成的可靠性与效率,采用结构依赖图作为显式执行合同,并通过验证引导合成框架进行图条件检索、约束生成和分阶段预执行验证,从而在单步和多步任务中显著提升通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20640 2026-04-22 cs.NI cs.MA 50%

Reflection-Driven Self-Optimization 6G Agentic AI RAN via Simulation-in-the-Loop Workflows

基于回溯的自优化6G智能代理AI无线接入网

Yunhao Hu, Xinchen Lyu, Chenshan Ren, Keda Chen, Qimei Cui, Xiaofeng Tao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于回溯的自优化框架,整合智能代理AI与高保真网络仿真,实现自校正系统,提升干扰优化吞吐量17.1%,用户QoS满意度提升67%,低流量时段资源利用率降低25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18500 2026-04-21 cs.MA q-fin.GN 50%

QRAFTI: An Agentic Framework for Empirical Research in Quantitative Finance

QRAFTI:量化金融领域实证研究的代理框架

Terence Lim, Kumar Muthuraman, Michael Sury

专题命中 复杂问题求解 :planning(abstract)

AI总结 QRAFTI框架通过整合面板数据研究工具与MCP服务器,支持对大规模金融面板数据进行因子研究,可复现已有因子、测试新信号并生成标准化报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08491 2026-04-21 cs.HC 50%

Figures as Interfaces: Toward LLM-Native Artifacts for Scientific Discovery

图表作为接口:迈向面向大语言模型的科学发现原生图件

Yifang Wang, Rui Sheng, Erzhuo Shao, Yifan Qian, Haotian Li, Nan Cao, Dashun Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出LLM原生图件概念,通过融合语言-视觉接口,实现数据驱动的可解释图件,提升科学发现的可重复性和透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏