Tracking and Understanding Object Transformations
跟踪和理解物体变换
机构 * Cornell University(康奈尔大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出TubeletGraph系统,用于跟踪和理解物体在变换中的状态变化,并引入新的基准数据集VOST-TAS,以提升复杂物体变换的跟踪与理解能力。
Comments NeurIPS 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
跟踪和理解物体变换
机构 * Cornell University(康奈尔大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出TubeletGraph系统,用于跟踪和理解物体在变换中的状态变化,并引入新的基准数据集VOST-TAS,以提升复杂物体变换的跟踪与理解能力。
Comments NeurIPS 2025
MedicalNarratives: 通过局部化叙述连接医学视觉与语言
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; Amazon(亚马逊)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 MedicalNarratives通过局部化鼠标轨迹连接医学视觉与语言,训练出的GenMedClip在12个医学领域均优于现有最佳模型。
可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱
机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。
Comments 46 pages, 2 figures
边缘优化的多模态学习用于无人机视频理解 via BLIP-2
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV
AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。
Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)
人工智能中的创造力作为领域受限生成模型的涌现
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。
OpenMic: 基于多智能体的站立喜剧生成系统
机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。
Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。
量子机器遗忘:基础、机制与分类
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出量子机器遗忘的统一框架,结合物理约束、算法机制与伦理治理,通过五轴分类体系和实用机制设计,推动QMU在可验证性和伦理对齐方面的应用发展。
VideoLoom:一种用于联合空间-时间理解的视频大语言模型
机构 * Fudan University(复旦大学) ; University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。
基于语义差异指导的多领域图像翻译
机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) ; Hyundai Mobis ; Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。
以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。
迈向稳定的半监督遥感分割:通过共引导与共混淆
机构 * School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院) ; Intelligent Computing and Application Laboratory of Qinghai Province, Qinghai University(青海省智能计算与应用实验室,青海大学) ; Key Lab of Big Data & Artificial Intelligence in Transportation (Ministry of Education), School of Computer Science & Technology, Beijing Jiaotong University(交通运输大数据与人工智能重点实验室(教育部),北京交通大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出Co2S框架,通过融合视觉-语言模型和自监督模型的先验知识,解决半监督遥感分割中的伪标签漂移问题,提升分割精度。
Comments 12 pages, 5 figures, 9 tables
L-RAG:基于熵的惰性加载平衡上下文与检索
机构 * Faculty of Computer Science and Cybernetics(计算机科学与自动化系) ; Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) ; ClickUp(ClickUp公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 L-RAG通过基于熵的惰性加载机制,在准确率与效率之间提供可调节的权衡,有效减少检索开销并提升RAG系统的部署效率。
3D CoCa v2:基于测试时间搜索的对比学习用于通用空间智能
机构 * School of Computer Science, Peking University(北京大学计算机学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 3D CoCa v2通过测试时间搜索提升3D场景描述的泛化能力,实现对比学习与描述生成的统一,提高鲁棒性。
Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划
机构 * Independent Researcher(独立研究者)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。
Comments 22 pages, 5 figures, 4 tables, 1 algorithm
TEAS: 可信教育AI标准:可验证、稳定、可审计和教学上可靠的系统框架
机构 * Abu Syed(阿布·赛德)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出TEAS框架,通过可验证性、稳定性、可审计性和教学合理性四个支柱,为教育AI系统提供可信度标准,强调系统架构而非模型能力的重要性。
Comments 19 pages, 6 tables, accepted at AAAI-26 (DAI Workshop) in Singapore
通过人工神经网络在图像中自发涌现语言统计规律
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 通过人工神经网络在图像中自发涌现语言统计规律,揭示图像处理能自动生成类似语言的统计特性。
Comments 10 figures
对人类图像伪造的总体方法
机构 * Michigan State University(密歇根州立大学)
专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV
AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。
Comments 6 figures, 5 tables
从数据集到现实世界:通过通用跨领域少样本学习实现通用3D目标检测
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出通用跨领域少样本学习方法,通过融合2D语义与3D空间推理,实现对现实世界中常见和新类目标的高效检测。
Comments The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition
DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距
机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) ; School of AI UCAS(UCAS人工智能学院) ; Meituan Inc.(美团公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。
Comments Ongoing work
LAG: 从笛卡尔视角出发的逻辑增强生成
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。
稀疏知识蒸馏:概率域温度缩放与多阶段压缩的数学框架
机构 * PhD. research(博士研究)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文提出概率域温度缩放与多阶段压缩的数学框架,通过算子层面分析揭示稀疏学生优于密集教师的条件,并提供收敛保证与等价类特征化,为知识蒸馏和模型压缩提供理论支持。
Comments Machine learning theory. Develops an axiomatic, operator-agnostic framework for probability-domain knowledge distillation, including bias--variance analysis of sparse students, homotopy-based multi-stage pruning, $O(1/n)$ convergence guarantees, and equivalence classes of probability-domain softening operators. Theoretical analysis only
SLGNet: 结合结构先验与语言引导调制的多模态目标检测
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) ; Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)
专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV
AI总结 SLGNet通过结合结构先验与语言引导调制,在冻结的ViT基础上实现高效多模态目标检测,提升环境适应性和检测性能。
低成本的跨语言检索增强生成用于低资源语言:孟加拉语农业咨询案例研究
机构 * Dept. of Computer Science and Engineering(计算机科学与工程系) ; East West University(东-西大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种低成本的跨语言检索增强生成框架,用于孟加拉语农业咨询,通过翻译和领域关键词注入提升生成质量,实现低资源语言下的高效农业知识访问。
Comments 5 pages, 3 figures, 1 table
理论追溯卡:基于理论的社认知评估方法
机构 * University of Southern California(南加州大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出理论追溯卡(TTC)以解决LLMs社会认知评估中理论基础缺失的问题,通过明确理论依据和能力组件,提升评估的可解释性和有效性。
ElecTwit:多智能体社交系统中说服研究的框架
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 ElecTwit通过模拟政治选举中的社交媒体互动,研究多智能体系统中说服现象的影响因素及不同模型架构对说服动态的作用。
Comments In proceedings of 2025 IEEE International Conference on Agentic AI (ICA)
弥合认知鸿沟:面向艺术图像美学评估的层次描述学习
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出RAD数据集和ArtQuant框架,通过联合描述生成和LLM解码器提升艺术图像美学评估的准确性和效率。
Comments AAAI2026,Project Page:https://github.com/Henglin-Liu/ArtQuant
视频侦探:通过反复寻找关键线索来回答长视频中的问题
机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) ; Renmin University of China(中国人民大学) ; AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) ; Tencent PCG(腾讯PCG)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。
上海交通大学:通过坐标检测实现多模态模型中的空间判断以实现统一分割
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 SJTU通过坐标检测实现多模态模型中的空间判断,提升图像分割的准确性和实用性。
Comments A flaw was discovered in the experimental setup. Therefore, we are retracting the paper
当小模型适用于错误的原因:信任代理的过程验证
机构 * Laksh Advani
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。
Comments Accepted to Trustagent workshop AAAI 2026