arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 275 篇

2604.16987 2026-08-07 cs.CV 版本更新 50%

DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection

DVAR:对抗性多智能体辩论用于视频真实性检测

Hongyuan Qi, Feifei Shao, Ming Li, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学) Guangming Lab(光明实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 DVAR通过多智能体辩论框架,将视频真实性检测转化为结构化推理过程,利用生成假设代理与自然机制代理的竞争,结合MDL框架和GenVideoKB知识库,实现对未知生成架构的强泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13105 2026-08-07 cs.AR 版本更新 50%

Knowledge-Driven Hybrid SSD Management Enhanced by Fine-Tuned LLMs

微调大语言模型(LLMs)增强的知识驱动混合固态硬盘(SSD)管理

Qian Wei, Yi Li, Zehao Chen, Tianren Zhou, Zhaoyan Shen, Dongxiao Yu, Bingzhe Li

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出LLM-hybridSSD框架,将混合SSD管理转化为参数调优问题,结合LLM与强化学习优化,使吞吐量平均提升58.92%、写放大降低28.56%。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02323 2026-08-06 cs.SE 版本更新 50%

ECLAIR: A Causally-Grounded AI Framework for Scientific Discovery in Empirical Software Engineering

ECLAIR:一种用于实证软件工程科学发现的因果基础AI框架

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Denys Poshyvanyk

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出因果基础AI框架ECLAIR,将LLMs整合到软件工程科学过程各阶段,通过案例研究揭示提示设计对LLMs代码生成准确率的影响,为AI辅助软件工程实证研究提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00280 2026-08-05 cs.OS cs.SE 版本更新 50%

Benchmarking LLMs on File System Design and Implementation

在文件系统设计与实现上对大语言模型(LLMs)进行基准测试:优势、不足与缺陷

Yuqi Xue, Daixuan Li, Jian Huang

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出针对文件系统特定任务的LLM基准框架phi-Bench,含505项六类任务,测试开源与专有LLMs,揭示模型效率、失败原因及缓解技术,将开源phi-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新 50%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 50%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00919 2026-08-04 cs.CV cs.RO 版本更新 50%

DriveCode: Domain Specific Numerical Encoding for LLM-Based Autonomous Driving

DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码

Zhiye Wang, Yanbo Jiang, Rui Zhou, Bo Zhang, Fang Zhang, Zhenhua Xu, Yaqin Zhang, Jianqiang Wang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi, Beijing, China(滴滴出行) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。

Comments The project page is available at https://shiftwilliam.github.io/DriveCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03414 2026-08-03 q-bio.NC 版本更新 50%

Cognitive Dark Matter: Measuring What AI Misses

认知暗物质:测量AI所缺失的东西

Patrick J. Mineault, Thomas L. Griffiths, Sean Escola

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出认知暗物质概念,旨在通过测量AI缺失的认知功能提升模型的通用智能,同时促进对人类智能的理解。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10345 2026-07-31 cs.SE 版本更新 50%

Recovering Fine-Grained Code Change Rationale from Multiple Software Artifacts

细粒度多文档提取与代码变更理由生成

Mehedi Sun, Antu Saha, Nadeeshan De Silva, Antonio Mastropaolo, Oscar Chaparro

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究如何从多个文档中提取代码变更理由,提出ARGUS方法,通过LLM生成简洁的变更理由摘要,提升代码理解和维护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09181 2026-07-29 cs.DB 版本更新 50%

Evaluating the Practical Effectiveness of LLM-Driven Index Tuning on Microsoft SQL Server

评估基于大语言模型的索引优化的实用性效果:微软数据库优化顾问

Xiaoying Wang, Wentao Wu, Vivek Narasayya, Surajit Chaudhuri

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过工业基准和真实企业工作负载评估LLM驱动的索引优化效果,对比微软数据库优化顾问(DTA),发现LLM在部分情况下能提供更优执行时间配置,但生产环境中应用仍面临性能波动、集成影响和验证成本等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10397 2026-07-28 cs.IR 版本更新 50%

RecoWorld: Building Simulated Environments for Agentic Recommender Systems

RecoWorld:为代理推荐系统构建模拟环境

Fei Liu, Xinyu Lin, Hanchao Yu, Mingyuan Wu, Jianyu Wang, Qiang Zhang, Zhuokai Zhao, Yinglong Xia, Yao Zhang, Weiwei Li, Mingze Gao, Qifan Wang, Lizhu Zhang, Benyu Zhang, Xiangjun Fan

专题命中 其他推理 :reasoning(abstract)

AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。

Comments HCRS @ WWW 2026, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07666 2026-07-20 q-bio.QM cs.MA 版本更新 50%

A hierarchical memory architecture overcomes context limits in long-horizon multi-agent computational modeling

分层内存架构克服长期多智能体计算建模中的上下文限制

Shivendra G. Tewari, Holly Kimko

专题命中 其他推理 :reasoning(abstract)

AI总结 研究针对大语言模型在长期多智能体计算建模中因无状态架构受限的问题,提出Ensemble QSP多智能体框架,其分层内存架构可保持上下文稳定,经测试能自主进行药代动力学 - 药效学模型选择,提升参数恢复能力,且架构与领域无关。

Comments 19 pages, 4 figures, 2 tables. Preprint submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22804 2026-07-16 cs.CV 版本更新 50%

CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams

CoVStream: 面向长视频流的边缘-云协作理解

Xu Liu, Guikun Chen, Zihao Yan, Kanzhi Wu, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) vivo Mobile Communication Co., Ltd., Shenzhen, China(深圳 vivo 通信有限公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出边缘-云协作框架CoVStream,边缘节点将视频流压缩为视觉特征和语义描述传输至云端,云服务器构建实体图与全局视觉上下文,仅在用户查询时激活大模型,在LVBench上带宽降低87.6%且准确率保持99.2%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12198 2026-07-16 cs.IR 版本更新 50%

LLM-Based User Personas for Recommendations at Scale

基于LLM的用户画像用于大规模推荐

Haoting Wang, Haokai Lu, Zheyun Feng, Jenny Huang, Yifat Amir, Gregory Hinkson, Ben Most, Zelong Zhao, Yixin Kelly Cui, Rein Zhang, Fabio Soldo, Yu Xia, Nihar Bhupalam, Minmin Chen, Konstantina Christakopoulou, Lichan Hong, Ed H. Chi

专题命中 其他推理 :reasoning(abstract)

AI总结 提出实时生成LLM用户兴趣画像的框架,通过知识蒸馏、异步推理和语义聚类优化,平衡利用-探索权衡,提升大规模视频推荐效果。

Comments Accepted by 2026 RecSys Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17343 2026-07-14 cs.CV 版本更新 50%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11549 2026-07-10 cs.HC 版本更新 50%

UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization

UNIPO:统一的交互式可视化用于RL微调策略优化

Aeree Cho, Alexander D. Greenhalgh, Jonathan Bodea, Anthony Peng, Duen Horng Chau

专题命中 其他推理 :reasoning(abstract)

AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07056 2026-07-08 cs.CY cs.HC cs.SI stat.AP 版本更新 50%

The University AI Didn't Replace -- Rethinking Universities in the AI Era

人工智能未取代大学——人工智能时代大学的重新思考

Karol P. Binkowski, Andrew Hopkins

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了人工智能在高等教育中的影响,提出大学AI采用的四个层级框架,并通过案例研究展示如何从孤立创新转向战略整合,以推动教育变革。

Comments 8 pages, 1 figure. Position paper on Generative AI and the transition from isolated educational innovation to institutionally supported adoption in higher education

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20659 2026-07-07 cs.RO 版本更新 50%

StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models

StageCraft: 通过执行意识缓解VLA模型中干扰和障碍故障

Kartikay Milind Pangaonkar, Prabin Rath, Omkar Patil, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 StageCraft通过利用大规模视觉语言模型进行推理,改进预训练VLA策略性能,通过操控环境初始状态避免执行故障,实现在三个真实任务领域中性能提升40%。

Comments Accepted to IEEE International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28864 2026-07-03 cs.CV 版本更新 50%

On Test-Time Scaling for Vision-Language Models

关于视觉-语言模型的测试时扩展

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) imec

专题命中 其他推理 :reasoning(abstract)

AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20870 2026-07-03 cs.CY 版本更新 50%

Learning AI Without a STEM Background: Mixed-Methods Evidence from a Diverse, Mixed-Cohort AIED Program

无需STEM背景的学习AI:来自多样化混合队列AIED项目的混合方法证据

Valentina Kuskova, Dmitry Zaytsev, Richard Johnson

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了无需STEM背景的AI教育模型,通过混合方法数据展示学习者在伦理判断、情境推理和责任方面的提升,强调伦理素养和指导在AI教育中的重要性。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02444 2026-07-03 cs.DB 版本更新 50%

From Textual Columns to Query Plans: A Unified Relational-Semantic Execution Framework for Hybrid Query Processing

OmniTQA:一种面向半结构化数据的混合查询处理成本感知系统

Nima Shahbazi, Seiji Maekawa, Nikita Bhutani, Estevam Hruschka

专题命中 其他推理 :reasoning(abstract)

AI总结 OmniTQA通过整合LLM语义操作与传统关系运算符,提出了一种成本感知的混合查询处理框架,有效处理结构化与半结构化数据,提升复杂查询和大规模表的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10710 2026-07-03 cs.CV 版本更新 50%

From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

从一对一到多对多:面向深度视觉-语言融合的动态跨层注入

Cheng Chen, Yuyu Guo, Pengpeng Zeng, Jingkuan Song, Peng Di, Hang Yu, Lianli Gao

机构 * Tongji University(同济大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19570 2026-07-02 cs.CV 版本更新 50%

RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation

RF-HiT:校正流分层变换器用于通用医学图像分割

Ahmed Marouane Djouamaa, Abir Belaala, Abdellah Zakaria Sellam, Salah Eddine Bekhouche, Cosimo Distante, Abdenour Hadid

机构 * Computer Science department Mohamed Khider University Biskra, Algeria ISASI, CNR \& University of Salento 73100 Lecce, Italy AI University of the Basque Country (UPV/EHU), Spain Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE

专题命中 其他推理 :reasoning(abstract)

AI总结 RF-HiT通过整合hourglass变换器骨干和多尺度分层编码器,实现高效的医学图像分割,在保持精度的同时提升效率,达到91.27%的Dice系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04862 2026-06-29 cs.SD 版本更新 50%

Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

先聚焦后聆听:探索用于噪声鲁棒的大规模音频语言模型的即插即用音频增强器

Han Yin, Yang Xiao, Younghoo Kwon, Ting Dang, Jung-Woo Choi

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出即插即用的音频增强器FTL,通过分离语音与非语音并利用模态路由器预测目标模态,生成任务自适应增强信号,无需微调即可提升LALMs在噪声环境下的性能。

Comments Accepted by ICML 2026 Workshop (Machine Learning for Audio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04160 2026-06-29 cs.GT 版本更新 50%

Representation theorems for actual and alpha powers over two-agent general concurrent game frames

关于双智能体一般并发博弈框架中实际权力和α权力的表示定理

Zixuan Chen, Fengkui Ju, Thomas Agotnes

专题命中 其他推理 :reasoning(abstract)

AI总结 本文针对双智能体一般并发博弈框架,证明了实际权力和α权力的八种类型分别可由八类邻域框架表示,推广了已有结果,并指出双智能体实际权力刻画无法推广到任意有限智能体集合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04554 2026-06-25 cs.CV 版本更新 50%

Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

伪造答案:针对无OCR文档视觉问答的对抗性伪造

Marco Pintore, Maura Pintor, Dimosthenis Karatzas, Battista Biggio

机构 * University of Cagliari, Italy(卡利亚里大学) Computer Vision Center, UAB, Spain(UAB计算机视觉中心)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出一种视觉上不可察觉但语义上定向的对抗攻击方法,通过伪造文档内容诱导DocVQA模型产生错误答案,在Pix2Struct和Donut模型上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 50%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 其他推理 :reasoning(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28919 2026-06-23 cs.RO 版本更新 50%

Why That Robot? A Qualitative Analysis of Justification Strategies for Robot Color Selection Across Occupational Contexts

为什么那个机器人?跨职业背景下机器人颜色选择论证策略的定性分析

Jiangen He, Wanqi Zhang, Jessica K. Barfield

机构 * The University of Tennessee, Knoxville(田纳西大学,基洛纳分校) University of Kentucky(肯塔基大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 通过定性分析1038名参与者的4146条开放式理由,研究用户在不同职业中如何合理化对机器人肤色和拟人化特征的选择,发现功利主义功能主义是主要策略,但偏见常潜藏于理性化之下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06495 2026-06-18 cs.CR 版本更新 50%

Graphs Don't Stay Secret: Practical Subgraph Reconstruction Attacks on Defended Graph RAG

图并非保密:对防御图RAG的实用子图重构攻击

Minkyoo Song, Jaehan Kim, Myungchul Kang, Hanna Kim, Seungwon Shin, Sooel Son

专题命中 其他推理 :reasoning(abstract)

AI总结 提出GRASP攻击,通过多轮查询从防御的图RAG系统中重构子图,达到82.9 F1,并评估防御措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15499 2026-06-16 cs.CR 版本更新 50%

HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment

HarmRLVR: 利用可验证奖励进行有害大模型对齐

Yuexiao Liu, Lijun Li, Xingjun Wang, Jing Shao

专题命中 其他推理 :reasoning(abstract)

AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。

详情

展开后加载摘要…

URL PDF HTML 收藏