Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning
Malaika:通过三重基础的智能推理理解恶意软件
专题命中 视觉推理 :grounding(abstract)
AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
Malaika:通过三重基础的智能推理理解恶意软件
专题命中 视觉推理 :grounding(abstract)
AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。
UniClawBench:面向实际任务中主动智能体的通用基准测试
机构 * HKU MMLab(香港大学多媒体实验室) ; Meituan(美团)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。
Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench
基于推理的检索:用于能源改造推荐的语言模型成本控制基准
专题命中 视觉推理 :grounding(abstract)
AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。
EAGOR:全方位的具身推理
机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)
专题命中 视觉推理 :vision language model(abstract)
AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。
Comments 12 Pages, 7 Figures, 4 Tables
RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 视觉推理 :VLM(abstract)
AI总结 针对预训练视频生成模型用于机器人策略规划的局限,提出RoboTALES框架,通过基于分层语言模型的规划器和基于视觉语言模型的评论家两大创新,学习任务对齐的模拟未来以训练机器人策略,在多样操纵任务中表现优于现有方法。
Comments Accepted at ECCV 2026
Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ; ShiFang Technology Inc.(ShiFang科技公司)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。
Comments ECCV 2026
超越文本仓库探索:面向智能体问题解决的双模态结构推理
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。
从答案生成器到推理促进者:为高风险环境中的数学推理设计AI导师
专题命中 视觉推理 :grounding(abstract)
AI总结 本研究设计并部署了AITutor系统,通过分层工作示例、步骤链接视觉基础和元认知支架等功能,帮助初中生在高压考试中从被动获取答案转向主动修复推理过程,提出了以推理为中心的产品循环。
基于LVLM的机器人系统中的过度思考触发慢速攻击
专题命中 视觉推理 :vision-language model(abstract)
AI总结 研究利用LVLM的过度思考行为,通过嵌入场景文本触发推理延迟,提出三阶段框架发现可迁移触发词,实验显示最高6.96倍延迟放大。
Comments 17 pages, 10 figures
LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分
机构 * Harvard University(哈佛大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。
Comments 21 pages, 9 figures
长期对话的记忆快照
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出MemShot方法,通过将对话片段渲染为结构化视觉记忆单元,利用模型内部视觉推理能力关联关键情节,实现高效长期对话建模,在LoCoMo和LongMemEval上取得稳定性能并实现70倍加速。
BengaliMoralBench:一种用于审计大型语言模型道德推理的基准,针对孟加拉语和文化
机构 * North South University(北南大学) ; Computational Intelligence and Operations Laboratory(计算智能与运营实验室) ; Hanyang University(翰林大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出BengaliMoralBench,一个针对孟加拉语和文化背景的道德推理评估基准,涵盖五个道德领域,通过三种伦理框架进行标注,评估不同模型的性能差异及文化适应性问题。
Comments Accepted at ACM FAccT 2026
Journal ref ACM FAccT 2026
多语言推理级联需要更多上下文
专题命中 视觉推理 :grounding(abstract)
AI总结 提出上下文感知翻译级联方法,在最终翻译模块的上下文中保留原始问题、英文翻译问题和推理链,以改善多语言推理中的信息丢失,实验表明该方法在多种语言和模型上显著提升开放生成性能。
SSI-Policy: 学习用于视觉语言机器人操作的结构化场景接口
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng Laboratory(鹏城实验室) ; The University of Hong Kong(香港大学) ; LimX Dynamics
专题命中 视觉推理 :grounding(abstract)
AI总结 提出SSI-Policy框架,通过统一的结构化场景接口(SSI)联合编码单目深度、语言锚定的物体布局和指令条件化的2D运动轨迹,实现从少量演示中学习机器人操作,在LIBERO基准上仅用10个演示即提升15%性能。
Comments Accepted by 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
Cloak: 通过遮蔽末端执行器实现零样本跨本体操作
机构 * Stanford University(斯坦福大学)
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。
CulMind:中国文化遗产中的多模态理解与推理基准
机构 * University of International Relations(国际关系学院) ; Kedge Business School(凯致商学院) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Capital Normal University(首都师范大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。
LaViSA:语言与视觉结构歧义基准
机构 * Nara Institute of Science and Technology(奈良先端科学技术大学院大学) ; Guardian Robot Project RIKEN(RIKEN守护机器人项目) ; The University of Osaka(大阪大学)
专题命中 视觉推理 :VLM(abstract_cn)
AI总结 提出LaViSA基准,通过七类歧义句及对应图像评估视觉语言模型利用视觉场景解决结构歧义的能力,实验显示现有模型虽能部分利用视觉信息,但在特定歧义类型和细微语义区分上仍有局限。
进化与基础模型:AI共享创意控制
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。
使用大型语言模型通过计算物理论文分析计算思维中的参与度
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本研究利用多模态大型语言模型自动评估100篇学生计算物理论文中的计算思维参与度,在明确子任务上达到84%的准确率,但主观整体质量评估准确率仅71%。
Comments 13 pages, 3 figures, 3 tables. Submitted to Physical Review Physics Education Research
CoRA: 面向可靠思维链推理的置信度-理由对齐
机构 * Vanderbilt University(范德比尔特大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Intuit AI Research(Intuit AI研究)
专题命中 视觉推理 :grounding(abstract)
AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。
潜在推理何时有帮助?MeRa:空间预测的度量空间偏差
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出MeRa模块,通过在序列编码器和预测头之间引入度量空间偏差,证明潜在推理在空间预测中有效,否则会降低性能。
理解大语言模型在抽象摘要中的推理能力
机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)
专题命中 视觉推理 :grounding(abstract)
AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。
Comments 27 pages,15 figures
基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估
机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) ; Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。
CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; Tianjin University(天津大学)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。
Comments Submitted to EMNLP 2026
道德推理习得的语用推理:通过元语用链接实现泛化
机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; Nanyang Technological University(南洋理工大学) ; University of Mississippi(密苏里大学) ; Northeastern University(东北大学) ; Qualcomm(高通公司) ; Michigan State University(密歇根州立大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 针对大语言模型在道德推理中泛化能力不足的问题,提出基于元语用链接和道德基础理论的语用推理方法,使模型获取道德推理目标与社会变量间的元语用链接,在三个任务上验证了其适应性和泛化性。
FOUND-IT: 基于基础模型优先、按需粒度的任务驱动3D场景图
机构 * Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) ; Samsung Research America(三星美国研究院)
专题命中 视觉推理 :grounding(abstract)
AI总结 提出首个基于未标定单目相机实时构建任意室内外环境分层任务驱动3D场景图的方法,通过几何基础模型和可调整粒度支持动态任务,并在ASHiTA SG3D基准上提升79%准确率。
复杂视觉查询的符号与抽象推理
机构 * Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; Ant Group(蚂蚁集团)
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。
Comments Work in progress
必要时做梦:通过自适应多模态推理推进世界行动模型
机构 * Tsinghua University(清华大学) ; Manifold AI
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。
面向视觉原生多模态深度搜索智能体的在策略数据演化
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Edinburgh(爱丁堡大学)
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。
IA-RAG:基于区间代数的动态知识检索时间推理
机构 * East China Normal University(华东师范大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Shanghai for Science and Technology(上海科技大学) ; Harbin Engineering University(哈尔滨工程大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 提出IA-RAG框架,通过区间代数建模时间约束,实现层次化时间检索与推理,在复杂时间问答任务上表现优异。
Comments 22 pages, 10 figures, 13 tables. Code available at https://github.com/xiaoAugenstern/LogicalRAG_TemporalQA