arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 249 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2608.22055 2026-08-25 cs.AI 新提交 57%

GenCoord: Skill-Path Commitments under Private Information

Peng He, Junning Zhu, Haohan Yuan, Jianpeng Liang

机构 * Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 25 pages, 10 figures, and 23 tables, including supplementary material. Peng He and Junning Zhu contributed equally. Paper source and compact evidence: https://github.com/JulianZJN/GenCoord

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10330 2026-08-25 cs.AI 版本更新 57%

Hierarchical Compositionality for An Assistive AI Agent

面向辅助AI智能体的分层组合性

Tianyi Fu, Mohan Sridharan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。

Comments 29 pages, 9 figures, 4 tables. Project page: https://tianyi-fu.github.io/HCAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23115 2026-08-25 cs.SE 新提交 50%

A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis

基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架

Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi, Qing Shan, Geerten M. Hengeveld, Ioannis N. Athanasiadis, Zhiming Zhao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。

Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23050 2026-08-25 cs.HC 新提交 50%

What Makes an Initial Reaction Ready for Discussion?: Multi-Persona AI Support for Stance Reflection and Writing

是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持

Sky Shih-Kai Hong, Mu-Tien Kuo, Wei-Ji Chen

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。

Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 (https://taichi2026.taiwanchi.org/program)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22151 2026-08-25 cs.SE cs.ET 新提交 50%

Towards Actionable Visualization: Ten Years Later, What Generative AI Changes and What It Cannot

面向可操作的可视化:十年之后,生成式AI带来了什么改变,又有什么是它做不到的

Leonel Merino, Mohammad Ghafari, Oscar Nierstrasz

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究回顾了十年前软件可视化领域的研究现状,探讨生成式AI对该领域的改变与局限,提出未来应聚焦于帮助人类理解复杂软件系统及AI生成内容,并指出可操作可视化已成为该领域可达成的标准。

Comments 2026 IEEE Working Conference on Software Visualization (VISSOFT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 50%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 69 篇

2605.03460 2026-08-25 cs.AI cs.LG 版本更新 90%

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

FinSTaR:面向时间序列推理模型的金融推理

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列推理模型在金融领域的失效问题,提出基于2x2能力分类法的FinSTaR模型,通过Compute-in-CoT和Scenario-Aware CoT策略在FinTSR-Bench基准上达到78.9%平均准确率。

Comments EMNLP Industry track 2026, KDD Workshop on SciSoc Agents & LLMs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-25 cs.CV 新提交 89%

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract)

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23458 2026-08-25 cs.CL 版本更新 87%

Two Regimes of Chain-of-Thought Unfaithfulness: Metric-Based Detection Fails Where Models Are Wrong

思维链不忠实的两种模式:模型错误时行为检测失效

Suramya R. Angdembay, Dikshant Aryal, Nick Rahimi

机构 * The University of Southern Mississippi(南密西西比大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 研究思维链不忠实检测,发现答案正确性影响检测效果,分正确与错误答案两种模式。仅答案不正确性表现优,跨模式无共享正向对齐方向,指示轨迹难转移,还解决了基准标签语义不匹配问题。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23497 2026-08-25 cs.AI cs.CL 新提交 84%

Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty

通过安全方向惩罚缓解推理诱导的不一致性

Yipeng Zhao, Qishun Yang, Shenzhe Zhu, Shu Yang, Di Wang

机构 * University of Toronto(多伦多大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对推理微调引发LLM安全退化的RIM问题,本文提出安全方向惩罚(SDP)方法,通过定位安全决策层并惩罚安全方向位移,在Qwen2.5系列模型上实现安全与推理性能的平衡。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23152 2026-08-25 cs.CL 新提交 83%

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

结合证据的回应!用于仇恨类别感知反仇恨言论生成的多智能体内存高效推理框架

Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对现有反仇恨言论生成未区分仇恨言论类别的问题,提出多智能体框架FIRE并构建数据集FactualCS,实验显示FIRE效果优于基线且毒性更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17448 2026-08-25 cs.CE cs.AI physics.chem-ph 版本更新 83%

RetroDFM-R: Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning

RetroDFM-R:基于强化学习的大语言模型驱动的推理型逆合成预测

Situo Zhang, Hanqi Li, Lu Chen, Zihan Zhao, Xuanze Lin, Zichen Zhu, Danyu Luo, Bo Chen, Xin Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science MoE Key Lab of Artificial Intelligence SJTU AI Institute(X-LANCE实验室,计算机科学学院,人工智能关键实验室,SJTU人工智能研究所) Suzhou Laboratory(苏州实验室) Jiangsu Key Lab of Language Computing(江苏语言计算重点实验室) School of Chemistry and Chemical Engineering(化学与化工学院)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出RetroDFM-R模型,结合强化学习与大语言模型实现推理型逆合成预测,在USPTO-50K基准上准确率优于现有方法,可重构复杂合成路线,提升了预测的可解释性与实用性。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17571 2026-08-25 cs.CL 版本更新 83%

Reasoning Meets Personalization: Unleashing the Potential of Large Reasoning Model for Personalized Generation

推理与个性化结合:释放大型推理模型在个性化生成中的潜力

Sichun Luo, Guanzhi Deng, Jian Xu, Zerui Yang, Xiaojie Zhang, Hanxu Hou, Linqi Song

机构 * Dongguan University of Technology(东莞理工大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Guangzhou University(广州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究针对大型推理模型在个性化任务中存在的局限,提出强化推理框架及相关机制,经实验验证其性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23154 2026-08-25 cs.IR 新提交 82%

The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness

更优描述性推理轨迹质量与推荐效果之间的脱节

Gustavo Penha, Juan Elenter, Claudia Hauff, Hugues Bouchard, Paul Bennett, Mounia Lalmas

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本研究通过2×2因子实验对比语义ID与自然语言标题的推理轨迹质量,发现提升描述性推理轨迹质量无法持续改善传统离线推荐效果。

Comments Accepted at the Recsys'26 Workshop on Agentic and Generative AI for E-Commerce

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20073 2026-08-25 cs.CL cs.AI cs.LG 版本更新 82%

A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs

整合时空模型与大语言模型(LLMs)的模块化多任务推理框架

Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院) School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出整合时空模型与LLMs的STReason框架,通过上下文学习分解查询生成解释,在时空推理任务中显著优于LLM基线,可抑制幻觉并减少专家工作量。

Journal ref The 34th ACM International Conference on Advances in Geographic Information Systems (SIGSPATIAL '26), November 03--06, 2026, Riverside, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-25 cs.AI 版本更新 81%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Yiyun Su, Zujun Peng, Yu Tian, Yuting Liu, Changruo Zhao, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22622 2026-08-25 cs.CL cs.AI 新提交 81%

Teaching LLMs How ICU Physicians Approach Clinical Reasoning Through OMOP-Aligned Retrieval Improves Reasoning Across Clinical Domains

通过OMOP对齐检索教导大型语言模型(LLM)采用ICU医师的临床推理方式可提升跨临床领域的推理能力

Miguel Contreras, Scott Siegel, Subhash Nerella, Jessica Sena, Jiaqing Zhang, Heng Sun, Hruday Tej Akkaladevi, Peiyu Lu, Jordan Rosen, Sumit Kapoor, Sasank Desaraju, Grace R. Thompson, Jacob Purcell, Michael Petrauskis, Philip KW. Hong, Meghan Brennan, Sarah Chrabaszcz, Tierra Smith, Ronnie Ren, Michel S. Kabbash, Ceyhun Haziroglu, Rushi Patel, Gabriel Gomez, Charlotte Chaiklin, Randy Leung, Kenneth N. John, Whitman Wiggins, Philip Kayser, Vincent Bird, Maria Bruzzone, Tyler J. Loftus, Azra Bihorac, Parisa Rashidi

机构 * University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究开发ICU-REACT推理数据集并微调Clin-REACT模型,使其学习ICU医师的临床推理方式,该模型在五个临床推理基准中表现优于多款模型,可提升跨领域临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21369 2026-08-25 cs.CL cs.AI 新提交 81%

Wazobia Eval: A Benchmark for Nigerian Pidgin Emotion Understanding, Sarcasm Detection, and Cultural Reasoning

Wazobia Eval:面向尼日利亚皮钦语情感理解、反讽检测与文化推理的基准测试

Stephanie Okoye

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Wazobia Eval基准测试,含550+样本与16类情感分类,用于评估尼日利亚皮钦语的情感理解、反讽检测与文化推理,填补相关基准缺失,为尼日利亚语言AI提供基础评估设施。

Comments GitHub: https://github.com/steffokoye/wazobia-eval Dataset: https://huggingface.co/WAZOBIALABS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08447 2026-08-25 cs.CL cs.AI 版本更新 81%

Hidden Language Consistency Phenomena in Reasoning LLMs

推理大语言模型中的隐藏语言一致性现象

Muhammad Ali Shafique, Kelly Marchisio

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究以PolyMath基准测试集探究推理模型的语言一致性,发现难度提升会导致多语言模型输出语言一致性骤降,量化对一致性的影响独立于准确率,多语言能力需结合准确率、一致性与难度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03536 2026-08-25 cs.CL cs.AI 版本更新 81%

GraphMed-LT: Patient-Specific Graph Memory with Latent Clinical Thought Refinement for Multi-Turn Medical Conversations

GraphMed-LT:面向多轮医疗对话的具有潜在临床思维优化的患者特定图记忆

Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis

机构 * School of Computing Science, University of Glasgow, UK(格拉斯哥大学计算机科学学院) School of Natural and Computing Science, University of Aberdeen, UK(阿伯丁大学自然与计算科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多轮医疗对话中临床证据分散的问题,提出GraphMed-LT方法,通过患者特定图记忆及潜在临床思维优化,在多轮医疗QA任务上较基线实现显著提升。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09421 2026-08-25 cs.CL cs.AI 版本更新 81%

ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model

ClinicalGPT-R1:利用大语言模型提升全科疾病诊断的推理能力

Wuyang Lan, Wenzheng Wang, Changwei Ji, Guoxing Yang, Yongbo Zhang, Xiaohong Liu, Luonan Chen, Shengge Li, Song Wu, Guangyu Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClinicalGPT-R1,经20000条临床记录训练,在MedBench-Hard基准测试中,其中文诊断性能优于GPT-4o、英文性能与GPT-4相当,提升了疾病诊断的推理能力。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-08-25 cs.AI 版本更新 80%

MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Wen-Huang Cheng, Jianlong Fu

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23061 2026-08-25 cs.AI 新提交 79%

Improving O-RADS Risk Stratification from Ultrasound Reports: A Comparative Evaluation of Hybrid versus End-to-End LLM Reasoning Strategies

改进超声报告的O-RADS风险分层:混合式与端到端大语言模型推理策略的对比评估

Xiaotong Tan, Chunli Qiu, Xin Liu, Qing Huang, Guangli Zhou, Bo Gao, Xiaoyan Song, Shuyan Wang, Xiuqin Wang, Wufeng Xue, Ruobing Huang, Dong Ni, Guowei Tao, Jun Cheng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究对比不同LLM推理策略,发现将特征提取与规则分类解耦的混合架构,使用Gemini 3.6 Flash时O-RADS分类准确率达99.2%,优于端到端策略及原始临床报告,可实现准确可靠的自动化临床决策。

Comments Main manuscript: 20 pages, 5 figures, and 2 tables; supplemental material: 11 pages, 1 figure, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22753 2026-08-25 cs.CL 新提交 79%

Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models

超越事实知识:大型语言模型中步骤级过程规则推理的基准测试与学习

Bohan Yu, Pengfei Cao, Chen Han, Chenxi Zhou, Zhiheng Zhang, Zhiyang Xie, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的过程规则推理不足,构建RuleWorld基准,提出DynaRule框架,在10K规则下将平均QA准确率提19个点,Recall@1超85%,大幅优于基线。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22566 2026-08-25 cs.CL 新提交 79%

From Diagnosis to Redesign: Using Quantitative Ethnography to Improve Multi-Agent LLM Reasoning

从诊断到重新设计:使用定量人种志改进多智能体大语言模型推理

Vedant Khatri, Anthony Cusimano, Zachari Swiecki, Zhen Xu, Xiner Liu, Renzhe Yu

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Monash University(莫纳什大学) Columbia University(哥伦比亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出定量人种志方法,以自动作文评分为例,通过分析五智能体辩论系统的交互模式诊断问题并修改提示词,使多智能体LLM的评分准确率从27.78%提升至40.28%。

Comments Accepted at ICQE 2026 (to appear in Springer CCIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-08-25 cs.AI 版本更新 79%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-08-25 cs.CV cs.AI 版本更新 79%

Beyond RGB: Benchmarking and Enhancing MLLMs for Hyperspectral Image Understanding via Training-Free Reasoning Framework

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Xiaoya Fan, Zjin Liao, Haoyuan Liang, Yibin Wen, Yuhang Chen, Chan Tsz Ho, Bi Tianyuan, Ruifeng Su, Zihao Qiang, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22143 2026-08-25 cs.AI 新提交 78%

Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems

小型视觉-语言模型在定性力学问题上的评估

Henry Fordjour Ansah, Shreya Banerjee, Pranish Ghimire

机构 * Louisiana State University of New Orleans(新奥尔良路易斯安那州立大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract,journal_ref);分类 cs.AI

AI总结 本研究评估Gemma-3和Qwen-VL两个多模态模型解读力学问题图像的能力,通过思维链评估其推理过程,对比答案测准确率,为小型视觉-语言模型在定性力学问题上的应用提供评估依据。

Comments 8 pages, 11 figures

Journal ref Proceedings of the IJCAI Workshop on 38th International Workshop on Qualitative Reasoning (QR 2025). 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23330 2026-08-25 cs.CV 新提交 78%

IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning

IntentQA:基于认知上下文推理的视频意图问答

Jiapeng Li, Ping Wei, Wenjuan Han, Song-Chun Zhu, Lifeng Fan

机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing Jiaotong University(北京交通大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。

Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 9, pp. 11044-11061, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏