arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2601.10609 2026-07-15 cs.IR 版本更新 50%

iTIMO: An LLM-empowered Synthesis Dataset for Travel Itinerary Modification

iTIMO:一个基于大语言模型的旅行行程修改合成数据集

Zhuoxuan Huang, Yunshan Ma, Hongyu Zhang, Hua Ma, Zhu Sun

专题命中 推理评测 :planning(abstract)

AI总结 iTIMO通过基于大语言模型的意图驱动扰动任务,构建了一个用于旅行行程修改的合成数据集,用于评估和改进旅行推荐系统。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02235 2026-07-15 cs.SE 版本更新 50%

Agent-Based Software Artifact Evaluation

基于代理的软件工件评估

Zhaonan Wu, Yanjie Zhao, Zhenpeng Chen, Zheng Wang, Haoyu Wang

专题命中 推理评测 :planning(abstract)

AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11451 2026-07-14 cs.HC 新提交 50%

ManiScope: LLM-Assisted Visual Analytics of Cryptocurrency Manipulation Risk

ManiScope:基于大语言模型的加密货币操纵风险可视化分析

Xiaolin Wen, Feng Liang, Yuanye Ma, Qishuang Fu, Zhengyu Sun, Feng Zhu, Can Liu, Yong Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 针对加密货币市场操纵风险评估问题,提出ManiScope系统,利用大语言模型辅助可视化分析,提供多方面协同视图及人机协作框架,经案例和用户研究验证,该系统能有效评估风险、减少人工并围绕假设组织发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 50%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09979 2026-07-14 cs.SE 新提交 50%

Using LLMs to Adjudicate Static-Analysis Alerts with Error Reduction Techniques

使用具有错误减少技术的大语言模型来判定静态分析警报

William Klieber, David Svoboda, Lori Flynn, Ruben Martins

专题命中 推理评测 :reasoning(abstract)

AI总结 研究用大语言模型判定静态分析警报,采用一致性检查和LLM推理评估两种方法,在三个测试套件上评估多个LLMs,中级推理LLMs经错误缓解后召回率和特异性高,还探讨了相关问题及合成程序作为证据的结果。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03024 2026-07-14 cs.CR cs.SE 版本更新 50%

SkillGuard: A Permission-Centric Framework for Agent Skill Security

SkillGuard:一种面向智能体技能的权限框架

Shidong Pan, Xiaoyu Sun, Tianyi Zhang, Dianshu Liao, Kaiwen Yang, Zhenchang Xing

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SkillGuard权限框架,通过双平面治理模型联合管控上下文影响和动作副作用,以缩小技能声明意图与运行时行为之间的安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17665 2026-07-14 cs.CV 版本更新 50%

OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

OpenEarthAgent:一个用于工具增强地理空间代理的统一框架

Akashah Shabbir, Muhammad Umer Sheikh, Muhammad Akhtar Munir, Hiyam Debary, Mustansar Fiaz, Muhammad Zaigham Zaheer, Paolo Fraccaro, Fahad Shahbaz Khan, Muhammad Haris Khan, Xiao Xiang Zhu, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) IBM Research(IBM研究院) Linköping University(林霍姆斯大学) Technical University Munich(慕尼黑技术大学) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07978 2026-07-14 cs.IR 版本更新 50%

Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on Large Language Models

基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性

Benedict Wolff, Jacopo Bennati

专题命中 推理评测 :reasoning(abstract)

AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。

Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新 50%

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08514 2026-07-10 cs.CV 新提交 50%

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato, Dima Damen

机构 * The University of Tokyo(东京大学) University of Twente(特温特大学) University of Bristol(布里斯托大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 50%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07457 2026-07-10 physics.ed-ph 50%

How Well Do AI Systems Solve AP Physics? A Comparative Evaluation of Large Language Models on Algebra-Based Free Response Questions

AI系统如何解决AP物理问题?对大型语言模型在代数基础自由回答问题上的比较评估

Bilas Paul, Jashandeep Kaur, Shantanu Chakraborty, Shruti Shrestha

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了AI系统在解答AP物理自由回答问题上的表现,发现其在代数问题解决上表现良好,但在空间推理和视觉解释方面存在局限。

Comments 10 pages, 3 figures

Journal ref Phys. Educ. 61 045008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新 50%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05711 2026-07-09 cs.CV 版本更新 50%

From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Elorian AI

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05742 2026-07-08 cs.HC 新提交 50%

PERSONAJUDGE: Simulating Individual Human Preference Judgments with Evaluator-Specific Demonstration Data

PERSONAJUDGE:使用特定评估者的示范数据模拟个体人类偏好判断

Zeyu He, Xuan Qi, Subramanian Chidambaram, Zhichao Xu, Vinayak Arannil, Lydia Chilton, Alex C. Williams

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对大语言模型作评判时忽略个体评估者差异的问题,提出结合分类判断与特定评估者辅助数据的模拟方法,经实证研究发现该方法有改进,推理痕迹作用大,还明确了模拟难度及相关属性,为个性化评估提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 50%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05434 2026-07-08 cs.CR cs.CV cs.CY 新提交 50%

Abductive Corroboration of Probabilistic AI Models for Forensic Synthetic Media Detection

用于法医合成媒体检测的概率人工智能模型的溯因确证

Junade Ali

机构 * NCSC, part of GCHQ(英国国家网络安全中心(NCSC))

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对法医合成媒体检测问题,利用溯因推理确证多种方法输出以识别最可能结论,应用该方法可降低误报风险,还对OpenAI的SynthID进行实证评估及评估不同检测方法互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06683 2026-07-08 cs.SE 版本更新 50%

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

基于混合评估的软件需求到架构生成基准测试

Minxiao Li, Li Zhang, Shuying Yan, Fang Liu, Liehao Li, Yang Liu, Xiaoli Lian

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 50%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交 50%

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

专题命中 推理评测 :planning(abstract)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04255 2026-07-07 eess.SY cs.SY 新提交 50%

Towards Effcient Low Altitude Sensing: A Dual Heterogeneous Graph Learning Method for UAV Task Allocation

迈向高效低空传感:一种用于无人机任务分配的双异构图学习方法

Guangyu Lei, Tianhao Liang, Bingyan Xie, Tingting Zhang

专题命中 推理评测 :planning(abstract)

AI总结 针对传统无人机任务分配方法难捕捉任务依赖与通信关系的问题,提出基于双异构图学习的方法,构建任务图与通信图,将分配问题转为结构匹配问题,用图注意力网络和交叉注意力机制优化匹配,提升任务完成率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03720 2026-07-07 cs.HC 新提交 50%

Between Knowledge and Care: A Mixed-Methods Evaluation of Generative AI for T2DM Self-Management from Patient and Physician Perspectives

知识与关怀之间:从患者和医生角度对用于2型糖尿病自我管理的生成式人工智能的混合方法评估

Ruiqi Chen, Yibo Meng, Huidi Lu, Xiaolan Ding

专题命中 推理评测 :reasoning(abstract)

AI总结 该混合方法研究从患者和医生角度评估用于2型糖尿病自我管理的生成式人工智能。通过分析患者查询、医生评分及访谈,发现模型优缺点,得出两个分析概念,为四个设计方向提供依据。

Comments arXiv admin note: text overlap with arXiv:2510.10048

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02972 2026-07-07 cs.CY 新提交 50%

A Scalable Approach to Evaluating Moral Sensitivity in LLMs

一种评估大语言模型道德敏感性的可扩展方法

Daniel Kilov, Secil Yanik Guyot, Caroline Hendy, Sichao Li, Seth Lazar

专题命中 推理评测 :reasoning(abstract)

AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。

Comments 9 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02719 2026-07-07 cs.CV 新提交 50%

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

GRCD:用于多发现胸部X光对的地面区域变化检测

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai

机构 * Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 50%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 50%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 推理评测 :reasoning(abstract)

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02590 2026-07-07 cs.SE 新提交 50%

OmniPresent: Generating Coherent Presentation Suites from Scientific Papers

OmniPresent:从科学论文生成连贯的演示文稿套件

Qianli Ma, Jipeng Xiao, Siyu Wang, Zhiheng Tian, Wangyu Feng, Shibo Wang, Chang Guo, Shuochen Chang, Qingyang Liu, Zhipeng Zhang

专题命中 推理评测 :planning(abstract)

AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02523 2026-07-07 cs.DC cs.NI 新提交 50%

Edge-Deployable LLM Fine-Tuning on a Single GPU for Telecom Network Troubleshooting

用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调

Chenhua Shi, Bhavika Jalli, John Zou, Gregor Macdonald, Wanlu Lei, Mridul Jain, Joji Philip

专题命中 推理评测 :reasoning(abstract)

AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。

Comments 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22956 2026-07-07 cs.SE 版本更新 50%

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

SWE-Manager:编码前选择并合成黄金方案

Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10730 2026-07-07 cs.CV 版本更新 50%

IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation

IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化

Yuan-Ming Li, Qize Yang, Nan Lei, Shenghao Fu, Ling-An Zeng, Jian-Fang Hu, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏