arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2604.18738 2026-08-21 cs.CL 版本更新 57%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02353 2026-08-21 cs.CL 57%

Detecting AI-Generated Essays in Writing Assessment: Responsible Use and Generalizability Across LLMs

在写作评估中检测AI生成的论文:在LLMs中的负责任使用与通用性

Jiangang Hao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在写作评估中检测AI生成论文的挑战,分析了不同LLM间检测器的泛化能力,并提出了负责任使用检测器的指南。

Comments 21 pages, 2 figures

Journal ref Artificial Intelligence Applications in Educational Learning and Assessment, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 57%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-08-20 physics.optics cs.LG 新提交 57%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18017 2026-08-19 cs.AI 新提交 57%

Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach

大语言模型能否解释飞行安全事件?一种先验引导的基于语义大语言模型的方法

Lu Xu, Xu Li, Linjiang Zheng, Fan Li, Riquan Zhang, Jiaxing Shang

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Sichuan Flight Engineering Technology Research Center, Civil Aviation Flight University of China(中国民航飞行学院四川飞行工程技术研究中心) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海对外经贸大学统计与数据科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对飞行安全事件解释难题,提出FlightLLM方法,结合特征工程、语义离散化、CatBoost先验引导及对比小样本学习等技术,在704个A320飞行样本上实现了良好分类与合理事件原因解释。

Comments 14 pages, 6 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17596 2026-08-19 cs.RO cs.AI 新提交 57%

tinyDSM: A Framework for Skill Modeling and Development for Resource-Constrained Millirobots

tinyDSM:面向资源受限毫米级机器人的技能建模与开发框架

Markus D. Kobelrausch, Michael Miedler, Axel Jantsch

机构 * Institute of Computer Technology, TU Wien(维也纳工业大学计算机技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出面向资源受限毫米级机器人的 tinyDSM 框架,结合内在动机与适应性评估,依托分层知识图谱等实现技能建模,使机器人15分钟内自主掌握从基础到复杂的运动技能。

Comments Manuscript submitted to IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10448 2026-08-19 cs.AI 版本更新 57%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18046 2026-08-19 cs.LG 版本更新 57%

SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用

Zhuohang Fan, Beichen Zhang, Yuanfa Li, Changqiao Wu, Wei Liu, Jian Luan, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。

Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-19 cs.CL 版本更新 57%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16578 2026-08-18 cs.AI cs.MA cs.SI 新提交 57%

Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents

智能体物理学:统计力学预测AI智能体的集体行为

Batu El, Jinhee Paeng, Fatih Dinc, Shiye Su, Mete Erdogan, Aneesh Pappu, Haotian Ye, Wanjia Zhao, Surya Ganguli, James Zou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究以10000余个语言模型智能体社区为对象,用统计力学模型将其集体动态分为三种状态,预测个体轨迹优于基线,揭示了AI智能体集体行为遵循可预测动力学规律。

Comments 51 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16461 2026-08-18 cs.ET cs.AI cs.CE cs.CY 新提交 57%

A Human-LLM Teaming Framework for Privacy Risk Analysis: An Illustration with CBDC-Based Welfare Schemes

一种用于隐私风险分析的人-大语言模型(LLM)协同框架:以基于央行数字货币(CBDC)的福利方案为例

Sourya Joyee De, Abdessamad Imine

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出用于隐私风险分析的人-LLM协同框架PRIAM,以CBDC福利方案为例验证,该框架通过人机迭代协作优化隐私风险评估,为相关领域提供基础贡献。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15394 2026-08-18 cs.CL 新提交 57%

The Machine's Internal Clock: Do LLMs Share Human Temporal Illusions?

机器的内部时钟:大型语言模型(LLMs)是否会共享人类的时间错觉?

Catherine Bao, Vivek Srikumar

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究构建含5种错觉的6684个叙事对基准,发现人类仅在2种错觉中偏好预期场景,而14个LLMs在4种错觉中与文献预测一致,其一致性源于心理学研究检索而非类人时间偏差。

Comments 25 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14707 2026-08-18 cs.AI 新提交 57%

Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems

分层多智能体系统中基于语义不确定性的协调策略

John Knowlton, Aritra Guha, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AT&T Chief Data Office(AT&T首席数据办公室) Cognizant AI Lab(高知特人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HASSUM框架,利用语义熵和密度估计不确定性实现多智能体自适应协调,在StrategyQA等基准上验证其可提升复杂推理任务的可靠性。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14668 2026-08-18 cs.MA cs.AI 新提交 57%

BRA-Audit: Budgeted Runtime Auditing for LLM Multi-Agent Systems via Cumulative-Exposure Audit-Point Placement

BRA-Audit:基于累积暴露审计点放置的LLM多智能体系统预算运行时审计

Kaixiang Wang, Yidan Lin, Jiong Lou, Jie Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 BRA-Audit是一种预算感知的LLM多智能体系统运行时审计框架,通过贪心调度放置审计点,在保障防护性能的同时降低了17.2%-40.6%的端到端token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14065 2026-08-18 cs.SE cs.AI 版本更新 57%

Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency

重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响

Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。

Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14631 2026-08-18 cs.LG 57%

Synergistic Fusion of Multi-Source Knowledge via Evidence Theory for High-Entropy Alloy Discovery

Minh-Quyet Ha, Dinh-Khiet Le, Duc-Anh Dao, Tien-Sinh Vu, Duong-Nguyen Nguyen, Viet-Cuong Nguyen, Hiori Kino, Van-Nam Huynh, Hieu-Chi Dam

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-08-17 cs.RO cs.AI cs.CV 新提交 57%

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) Tsinghua University(清华大学) Juxi Tech(矩芯科技) IntelliFusion Inc.(智融公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings, 2026, pp. 1346-1357

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06737 2026-08-17 cs.SE cs.AI 57%

A Self-Healing Framework for Reliable LLM-Based Autonomous Agents

基于大语言模型的自主代理的自修复框架

Cheonsu Jeong, Younggun Shin

机构 * AX Center, SAMSUNG SDS(三星SDS AX中心) Dept. of Artificial Intelligence, Graduate School of Engineering, Yonsei University(延世大学工程研究生院人工智能系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种可靠性感知的自修复框架,通过故障检测、可靠性评估和自动恢复机制提升基于大语言模型的自主代理的可靠性,实验表明该方法显著提高了任务成功率并增强了系统鲁棒性。

Comments 13 pages, 3 figures,1 table

Journal ref International Journal of Software Engineering and Knowledge Engineering,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 57%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12351 2026-08-14 cs.CY cs.AI 新提交 57%

Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection

生成式人工智能(GenAI)时代的评估设计:用于测试学生AI素养、学习成果与反思的X1-X2-X3评估模式

Riasat Islam, Thomas Roelleke

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文针对GenAI对在线评估的挑战,提出可复用的X1-X2-X3评估模式,用于测试学生AI素养等,为教师适配GenAI时代评估提供实践指导。

Comments 30 pages, 1 figure, 11 tables. Submitted to the following journal: Assessment & Evaluation in Higher Education (Taylor & Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12338 2026-08-14 cs.CL 新提交 57%

SDAM: Structure-Difference-Aware Memory Evolution for Complex Text-to-SQL

SDAM:面向复杂文本转SQL的结构差异感知记忆演化

Keyan Xu, Dingzirui Wang, Xuanliang Zhang, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对现有文本转SQL记忆设计的缺陷,提出SDAM方法,集成至SDAM-SQL框架,在BIRD-dev和Spider-test数据集上实现指标提升,验证了方法有效性。

Comments 19 pages, 5 figures, 12tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12326 2026-08-14 cs.CL 新提交 57%

On Measuring Semantic Preservation in Legal Ontology Learning

论法律本体学习中的语义保留度量

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文针对法律本体学习的语义保留评估问题,提出通过对比LLM在源文档与转换后表示上的任务性能量化语义损失,经多模型多方法实验发现语义损失随模型-方法配对显著变化,为法律知识系统配置选择提供指导。

Comments Accepted for publication at the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10840 2026-08-14 cs.LG 版本更新 57%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22366 2026-08-14 cs.CL 57%

Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models

Max Malyi, Jonathan Shek, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 57%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10339 2026-08-12 stat.ME cs.AI stat.AP 新提交 57%

Expert-Guided g-computation with Large Language Models for Estimating Causal Effects on Timings: Applications to Hospital Quality Improvement

基于大型语言模型的专家引导g计算法估计时序因果效应:在医院质量改进中的应用

Patrick Vossler, Jialin Ouyang, F. Richard Guo, Anran Huang, Ali Shojaie, Lucas Zier, Fan Xia, Jean Feng

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出专家引导g计算法(egg-computation),结合专家判断与LLM技术,用于估计医院干预措施对平均住院时长的因果效应,在模拟和真实医院数据中表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10974 2026-08-12 cs.CL 新提交 57%

MUSE: A Full-Text Cross-Domain Knowledge Base of Scientific Problems, Solutions, and Rationales

MUSE:一个包含科学问题、解决方案及原理的全文跨领域知识库

Tsofia Cohen, Tom Hope

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Allen Institute for AI (Ai2)(艾伦人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出MUSE知识库,通过模块化抽取流程构建含3.7万个P-S-R三元组的跨领域资源,实验表明原理监督可提升复杂问题的性能但会损害简单问题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10504 2026-08-12 cs.AI 新提交 57%

MEGA: Self-Evolving Agent Optimization Infrastructure via Wisdom Graph

MEGA:基于智慧图的自进化智能体优化基础设施

Jung Hwan Lee, Kyu Ho Lee, Gwang Hoon Yoo

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MEGA是一种自进化智能体优化基础设施,通过三层架构实现智慧积累、组合推理与自进化,可系统性优化异构智能体系统,将优化与知识进化融为一体。

Comments 29 pages, 10 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10483 2026-08-12 cs.AI cond-mat.mtrl-sci 新提交 57%

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

基于动态少样本学习的大语言模型预测双钙钛矿的空间群

Jongwon Park, Inhyo Lee, Junhyeong Lee, Seunghwa Ryu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基于LLM智能体的DyRIS框架,通过动态少样本检索与规则引导推理,在不平衡双钙钛矿数据集上提升了空间群预测的整体及少数类性能,验证了领域知识与LLM结合的有效性。

Comments 46 pages, 6 figures, Supplementary Information included(24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏