EgoReID: Cross-view Self-Identification and Human Re-identification in Egocentric and Surveillance Videos
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
Comments 27 pages, 3 figures, position paper
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:1305.2254
机构 * City University of Hong Kong(香港城市大学) ; Hong Kong University of Science(香港科学大学) ; National University of Singapore(新加坡国立大学) ; Northwestern University(西北大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(comments)
Comments ICML 2025. Camera-ready version updated. Our code is publicly available at https://github.com/shiqichen17/VLM_Merging
神经符号PRM:通过结构化轨迹与符号验证增强科学推理
机构 * AI Institute of South Carolina(南卡罗来纳州人工智能研究所) ; HPE Labs(慧与实验室) ; Indian AI Research Organisation(印度人工智能研究组织)
专题命中 视觉推理 :grounding(abstract)
AI总结 该研究提出神经符号PRM框架,解耦推理为符号有效性与语义接地性,引入反事实符号扰动训练PRM,通过验证器优先搜索提升工具增强型LLM的科学推理可靠性。
ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架
机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) ; University of Aberdeen(阿伯丁大学) ; The University of Western Australia(西澳大学) ; Brown University(布朗大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。
Comments Accepted by ICONIP 2026
OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准
机构 * East China Normal University(华东师范大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。
Comments Accepted to Findings of EMNLP 2026
具身学习的可扩展任务生成:基于 affordance 的任务世界
专题命中 视觉推理 :vision-language model(abstract)
AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。
更优描述性推理轨迹质量与推荐效果之间的脱节
专题命中 视觉推理 :grounding(abstract)
AI总结 本研究通过2×2因子实验对比语义ID与自然语言标题的推理轨迹质量,发现提升描述性推理轨迹质量无法持续改善传统离线推荐效果。
Comments Accepted at the Recsys'26 Workshop on Agentic and Generative AI for E-Commerce
InstructMove:一种指令跟随操作的文本不可或缺基准
机构 * Horizon Robotics(地平线机器人) ; WuwenAI(悟文智能) ; Southeast University(东南大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 针对现有操作基准无法充分检验机器人指令跟随能力的问题,提出文本不可或缺的InstructMove基准,将指令跟随分解为多环节,实验表明其可诊断视觉捷径且模拟数据能提升现实操作性能。
Comments 22 pages
Ludi₀.₁:面向社交智能机器人的智能体系统
机构 * Ludo Robotics(乐动机器人)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 该研究提出Ludi₀.₁智能体系统,集成多技能与微调视觉语言模型,为社交智能机器人提供可行的人机协作方案,还可生成相关交互轨迹用于开发更融合的机器人基础模型。
AWARe:基于激活加权的自适应保留缓解灾难性遗忘
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) ; Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。
MoCA:隐式社会语境分析
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Wuhan University(武汉大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。
OneEmo:用于情感感知、理解与交互的统一多模态推理模型
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。
CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。
面向手写UML到PlantUML生成的形式化感知奖励循环
专题命中 视觉推理 :vision-language model(abstract)
AI总结 本研究提出形式化感知奖励循环,通过微调视觉-语言模型结合Group Relative Policy Optimisation生成PlantUML,提升了转换质量,为建模评估提供了新方向。
Comments Accepted for publication in the Proceedings of the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026). This is the accepted author manuscript
AfriEconQA:基于世界银行报告的非洲经济分析基准数据集
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 视觉推理 :grounding(abstract)
AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。
Comments Dataset Explorer: https://afrieconqa.pages.dev/
REFACT:用于紧凑且忠实的思维链推理的自适应事实重述
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。
HiEviDR-Bench:深度研究中分层证据聚合的基准测试
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。
Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io
超越事实准确性:使用逻辑得分评估RAG系统中的全球推理完整性
机构 * Shanxi University(山西大学) ; Nanjing University of Science and Technology(南京理工大学) ; University of Manchester(曼彻斯特大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; University of Edinburgh(爱丁堡大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出LogicScore,通过全局推理审查弥补RAG系统在长文本生成中逻辑完整性不足的问题,揭示模型在事实准确性高但全局推理质量差的缺陷。
从管道和仪表图到过程图:一种多模态语言模型方法
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。
当一个名字并非名字时:低资源语言模型中文化纠缠的孟加拉语同形异义词的基准数据集和提炼推理
机构 * United International University(联合国际大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 研究针对低资源语言模型中孟加拉语同形异义词文化纠缠问题,构建基准数据集。发现模型有主导意义偏差,特定模型失败。提出对比性思维链提示及提炼文化解释,能减少偏差,让小模型正确推理,提升系统性能。
PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应
专题命中 视觉推理 :grounding(abstract)
AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。
Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication
错误作为透镜:通过合成误解生成探究LLM推理
机构 * CUNY Graduate Center(纽约大学研究生中心) ; CUNY Queens College(纽约市立大学皇后学院)
专题命中 视觉推理 :grounding(abstract)
AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。
利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语
机构 * Tsinghua University(清华大学) ; Striding AI(驰行人工智能公司) ; Purdue University(普渡大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Infinigence AI(英飞智研人工智能公司) ; Zhongguancun Academy(中关村学院) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。
MET:基于理论和文化感知的多语言道德推理
机构 * University of Michigan(密歇根大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。
Comments Published as a conference paper at COLM 2026
RetroHolmes:当语义合理性失效时的回顾性物理过程推理
专题命中 视觉推理 :vision language model(abstract)
AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。