arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 106 篇

2608.21860 2026-08-25 cs.LG cs.AI 新提交 79%

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

ChainPrune:评估与减少长思维链推理中的冗余

Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ChainPrune 是一种推理路径语义结构优化方法,通过整合推理路径为树结构、选择主导路径及结合 DPO 与监督损失,减少长思维链冗余,在保精度的同时降低了步骤长度与计算开销。

Comments 15 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22950 2026-08-25 cs.CV 新提交 78%

WADE: A Reasoning-Annotated Benchmark for Multi-Instance Floating-Waste Grounding with Compact Vision-Language Models

WADE:面向紧凑视觉-语言模型的多实例漂浮垃圾定位推理标注基准

Md. Asaduzzaman Shuvo, Ahsan Farabi, Md. Abdul Ahad Minhaz, Mahedi Hasan, Israt Khandaker, Ibrahim Khalil Shanto, Muhammad Nomani Kabir

机构 * United International University(联合国际大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 针对内陆漂浮垃圾监测需求,研究推出WADE基准并评估6种VLMs,微调Qwen3-VL-2B可提升性能但仍有大量实例未被检测,为紧凑VLMs的漂浮垃圾定位提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15395 2026-08-25 cs.RO 版本更新 78%

Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述

Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis, Panagiotis Sarigiannidis, Efstratios Gavves, Kostas Bekris, Arash Ajoudani, Georgios Th. Papadopoulos

机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。

Journal ref Transactions on Machine Learning Research (TMLR), 07/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23493 2026-08-25 cs.AI 新提交 77%

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

SRPO:用于长程推理的自反思策略优化

Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23181 2026-08-25 cs.CR cs.CL 新提交 77%

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

CyberFactory:利用真实场景实例扩展网络安全能力

Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Xianglong Liu, Tianyu Zheng, Bryan Dai, Chengran Yang

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出开源框架CyberFactory,将真实场景漏洞转化为任务实例以训练安全模型Aegis,该模型在CyberGym上的Pass@1较Qwen~3.5提升22.8个百分点,优于通用主干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23029 2026-08-25 cs.CL 新提交 77%

Meta-Moderator: Empowering Multi-Agent Debate with Meta-Cognition

元审核员:用元认知赋能多智能体辩论

Wentao Hu, Zhuoyue Wan, Jinhao Shen, Chen Jason Zhang, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究提出Meta-Moderator可学习框架,将多智能体辩论的审核视为元认知过程,经结果驱动策略优化训练,在五个基准测试中性能优于现有决策层,能动态调控辩论并减少错误聚合。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 77%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22332 2026-08-25 cs.CL 新提交 77%

Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching

通过顺序激活补丁的思维链推理的机制可解释性

Murat Dura, Serkan Öztürk, Selma Tekir

机构 * İzmir Institute of Technology(伊兹密尔理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出顺序激活补丁框架及顺序多头补丁,探究思维链推理的因果效应位置与相关注意力头,证实存在支持思维链的分布式推理子电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21614 2026-08-25 cs.AI cs.DC 新提交 77%

SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning

SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理

Yujie Zhang, Bin Gao, Tulika Mitra

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。

Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23242 2026-08-25 cs.MM 新提交 75%

Mind the Couch! Eliciting MLLM Reasoning in Interior Design via Weak-to-Strong Task Vector Injection

留意沙发!通过弱到强任务向量注入激发多模态大语言模型在室内设计中的推理能力

Yuxuan Yang, Jingyao Wang, Luntian Mou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对MLLMs在室内设计中因模态对齐问题产生的空间碰撞与审美不和谐,本文提出DART-I机制,通过弱到强任务向量注入引导MLLMs推理,无需微调即可实现精确推理,且经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22347 2026-08-25 cs.AI cs.CL cs.LG 新提交 75%

Where Cognition Lives: Dissecting Emergent from Computed Function in a Minimal Complete Cognitive Architecture

认知之所在:在极简完整认知架构中解析涌现性与计算功能

Francisco M. Arrabal-Campos, Francisco G. Montoya, Alfredo Alcayde, Ignacio Fernández

机构 * University of Almería(阿尔梅里亚大学) Research Centre CIAIMBITAL(CIAIMBITAL研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建含自适应停机等模块的极简完整认知架构,探究功能是涌现还是需计算,发现价值需计算实现,还验证了停机机制、自洽性等相关结论。

Comments 16 pages, 3 figures. Code, preregistrations and results: https://github.com/fmarrabal/miuracognitive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09887 2026-08-25 cs.LG cs.AI cs.CL 版本更新 75%

SocraticPO: Policy Optimization via Interactive Guidance

SocraticPO: 通过交互式指导进行策略优化

Zirui Liu, Tingyue Pan, Jie Ouyang, Qi Liu, Xianquan Wang, Jiayu Liu, Qingchuan Li, Jing Sha, Zhenya Huang, Shijin Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) iFLYTEK AI Research (Central China), iFLYTEK Co., Ltd(iFLYTEK中央中国AI研究院,iFLYTEK公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SocraticPO框架,在强化学习中使用自然语言指导辅助推理,并通过奖励衰减防止模型依赖教师帮助,提升科学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22143 2026-08-25 cs.AI 新提交 74%

Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems

小型视觉-语言模型在定性力学问题上的评估

Henry Fordjour Ansah, Shreya Banerjee, Pranish Ghimire

机构 * Louisiana State University of New Orleans(新奥尔良路易斯安那州立大学)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 本研究评估Gemma-3和Qwen-VL两个多模态模型解读力学问题图像的能力,通过思维链评估其推理过程,对比答案测准确率,为小型视觉-语言模型在定性力学问题上的应用提供评估依据。

Comments 8 pages, 11 figures

Journal ref Proceedings of the IJCAI Workshop on 38th International Workshop on Qualitative Reasoning (QR 2025). 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21863 2026-08-25 cs.CL cs.AI 新提交 73%

HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化

Yucan Guo, Xiaohan Wang, Miao Su, Saiping Guan, Zhongni Hou, Jiajun Chai, Wei Lin, Guojun Yin, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 HiDiffTIR是面向多轮工具集成推理的分层难度感知策略优化框架,通过在轨迹和轮次两级执行难度感知信用分配,无需额外监督即可提升工具集成推理性能。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03460 2026-08-25 cs.AI cs.LG 版本更新 73%

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

FinSTaR:面向时间序列推理模型的金融推理

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对时间序列推理模型在金融领域的失效问题,提出基于2x2能力分类法的FinSTaR模型,通过Compute-in-CoT和Scenario-Aware CoT策略在FinTSR-Bench基准上达到78.9%平均准确率。

Comments EMNLP Industry track 2026, KDD Workshop on SciSoc Agents & LLMs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-25 cs.CV cs.AI 新提交 70%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-25 cs.CL 新提交 70%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-08-25 cs.CL cs.CV 新提交 70%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22757 2026-08-25 cs.CV cs.AI 新提交 70%

Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation

Object-Uni:面向以物体为中心的空间理解与可控生成的统一模型

Mining Tan, Yinuo Wang, Ziqi Zhou, Weize Quan, Sifei Li, Jingdong Chen, DanDan Zheng, Libin Wang, Weiming Dong

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与 mobility学院) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Object-Uni统一模型,通过视角方向抽象与UniSpatial-80K基准,实现以物体为中心的空间理解与可控生成,提升位姿理解及可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 70%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21440 2026-08-25 cs.RO cs.AI 新提交 70%

Geo-VLA: Geometry-Aware Vision-Language-Action Planning via Internalization of Map Semantics

Geo-VLA:通过内化地图语义实现几何感知的视觉-语言-动作规划

Ran Chen, Jiaxing Ren, Zhikun Zhang, Yunhao Hou, Junbao Zhuo, Bochao Zou

专题命中 推理与问题求解 :foundation model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 该研究针对VLA模型在复杂驾驶场景中规划性能不足的问题,提出可即插即用的Geo-VLA框架,结合自研Geo-QA数据集,在NAVSIM v1上实现单目VLA规划器的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10330 2026-08-25 cs.AI 版本更新 70%

Hierarchical Compositionality for An Assistive AI Agent

面向辅助AI智能体的分层组合性

Tianyi Fu, Mohan Sridharan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。

Comments 29 pages, 9 figures, 4 tables. Project page: https://tianyi-fu.github.io/HCAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-08-25 cs.AI 版本更新 70%

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-08-25 cs.CV cs.AI 版本更新 70%

Beyond RGB: Benchmarking and Enhancing MLLMs for Hyperspectral Image Understanding via Training-Free Reasoning Framework

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Xiaoya Fan, Zjin Liao, Haoyuan Liang, Yibin Wen, Yuhang Chen, Chan Tsz Ho, Bi Tianyuan, Ruifeng Su, Zihao Qiang, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17571 2026-08-25 cs.CL 版本更新 70%

Reasoning Meets Personalization: Unleashing the Potential of Large Reasoning Model for Personalized Generation

推理与个性化结合:释放大型推理模型在个性化生成中的潜力

Sichun Luo, Guanzhi Deng, Jian Xu, Zerui Yang, Xiaojie Zhang, Hanxu Hou, Linqi Song

机构 * Dongguan University of Technology(东莞理工大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Guangzhou University(广州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对大型推理模型在个性化任务中存在的局限,提出强化推理框架及相关机制,经实验验证其性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10390 2026-08-25 cs.AI 版本更新 70%

Neural-Symbolic Reasoning over Knowledge Graphs: A Survey from a Query Perspective

面向知识图谱的神经符号推理:一种查询视角的综述

Lihui Liu, Zihao Wang, Hanghang Tong

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该综述从查询视角全面梳理知识图谱推理,涵盖神经符号推理分类及与大语言模型的融合,旨在为多领域研究者提供当前态势与未来方向的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23330 2026-08-25 cs.CV 新提交 67%

IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning

IntentQA:基于认知上下文推理的视频意图问答

Jiapeng Li, Ping Wei, Wenjuan Han, Song-Chun Zhu, Lifeng Fan

机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing Jiaotong University(北京交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。

Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 9, pp. 11044-11061, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21470 2026-08-25 cs.CR 新提交 67%

Structural Inference in Undocumented Mobile Databases: A Reproducible Benchmark for Evaluating Agentic Reasoning in Digital Forensics

无文档移动数据库中的结构推断:用于评估数字取证中智能体推理能力的可复现基准

Jeel Piyushkumar Khatiwala, Divyangkumar Patel, Weifeng Xu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究构建了可复现基准,评估智能体对无文档移动数据库的结构推断能力,发现其在规则模式下可靠,模式模糊时性能骤降,需额外验证以确保推断关系可作为可靠取证证据。

Comments 10 pages, 2 figures. Published in Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, July 2026

Journal ref Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 67%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-08-25 cs.GT 版本更新 67%

Auditing Game-Theoretic Measures of Strategic Reasoning in LLMs

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins, Jon Chun

专题命中 推理与问题求解 :LLM(title_cn)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments v2: substantive self-correction of v1 against raw transcripts; title changed. Corrects game specs to the implemented games; exact equilibrium solve (conditional bluff rate 2/3, not 0.340); response-validity audit: parser-substituted defaults retract Kimi K2's profile; prompt-framing result reversed. Appendix itemizes all changes. Data: https://doi.org/10.5281/zenodo.21943627. 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏