Learning to Compose Dynamic Tree Structures for Visual Contexts
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :visual question answering(abstract);分类 cs.LG
Comments NeurIPS 2018 Visually Grounded Interaction and Language (ViGIL) Workshop
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
Comments Accepted to International Journal of Computer Vision (IJCV), 2018 arXiv admin note: text overlap with arXiv:1504.02437
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG
Comments Modified abstract to fit arXiv character limit
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
Comments CVPR 2018
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
Comments Published as a conference paper at ICLR 2018
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV
Comments Accepted to AAAI 2018
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
Comments A group project paper for course CS348. arXiv admin note: text overlap with arXiv:1705.03633 by other authors
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG
Comments 14 pages
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :visual question answering(abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
Comments 27 pages, 3 figures, position paper
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:1305.2254
机构 * City University of Hong Kong(香港城市大学) ; Hong Kong University of Science(香港科学大学) ; National University of Singapore(新加坡国立大学) ; Northwestern University(西北大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(comments)
Comments ICML 2025. Camera-ready version updated. Our code is publicly available at https://github.com/shiqichen17/VLM_Merging
更优描述性推理轨迹质量与推荐效果之间的脱节
专题命中 视觉推理 :grounding(abstract)
AI总结 本研究通过2×2因子实验对比语义ID与自然语言标题的推理轨迹质量,发现提升描述性推理轨迹质量无法持续改善传统离线推荐效果。
Comments Accepted at the Recsys'26 Workshop on Agentic and Generative AI for E-Commerce
InstructMove:一种指令跟随操作的文本不可或缺基准
机构 * Horizon Robotics(地平线机器人) ; WuwenAI(悟文智能) ; Southeast University(东南大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 针对现有操作基准无法充分检验机器人指令跟随能力的问题,提出文本不可或缺的InstructMove基准,将指令跟随分解为多环节,实验表明其可诊断视觉捷径且模拟数据能提升现实操作性能。
Comments 22 pages
Ludi₀.₁:面向社交智能机器人的智能体系统
机构 * Ludo Robotics(乐动机器人)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 该研究提出Ludi₀.₁智能体系统,集成多技能与微调视觉语言模型,为社交智能机器人提供可行的人机协作方案,还可生成相关交互轨迹用于开发更融合的机器人基础模型。
AWARe:基于激活加权的自适应保留缓解灾难性遗忘
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) ; Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。
MoCA:隐式社会语境分析
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Wuhan University(武汉大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。
OneEmo:用于情感感知、理解与交互的统一多模态推理模型
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。
CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。
面向手写UML到PlantUML生成的形式化感知奖励循环
专题命中 视觉推理 :vision-language model(abstract)
AI总结 本研究提出形式化感知奖励循环,通过微调视觉-语言模型结合Group Relative Policy Optimisation生成PlantUML,提升了转换质量,为建模评估提供了新方向。
Comments Accepted for publication in the Proceedings of the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026). This is the accepted author manuscript
AfriEconQA:基于世界银行报告的非洲经济分析基准数据集
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 视觉推理 :grounding(abstract)
AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。
Comments Dataset Explorer: https://afrieconqa.pages.dev/
REFACT:用于紧凑且忠实的思维链推理的自适应事实重述
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :grounding(abstract)
AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。