arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2603.02618 2026-04-21 cs.CV 57%

Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs

注意你选择负样本的方式:在使用VLMs进行OOD检测时追求距离一致性

Zhikang Xu, Qianqian Xu, Zitai Wang, Cong Hua, Sicong Li, Zhiyong Yang, Qingming Huang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出InterNeg框架,通过统一的跨模态距离增强提升OOD检测性能,实验显示在ImageNet和Near-OOD基准上取得显著改进。

Comments Accepted by the main track of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16004 2026-04-20 cs.CL cs.AI 57%

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15946 2026-04-20 cs.CV cs.RO 57%

SENSE: Stereo OpEN Vocabulary SEmantic Segmentation

SENSE:立体视图开放词汇语义分割

Thomas Campagnolo, Ezio Malis, Philippe Martinet, Gaétan Bahl

机构 * Centre Inria d’Universite Cote d’Azur, France(法国里莫纳大学信息科学研究中心) NXP Semiconductors, France(法国恩智科半导体公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SENSE,通过立体视觉与视觉语言模型提升开放词汇语义分割的精度,实验显示在PhraseStereo数据集上平均精度提升2.9%,并在Cityscapes和KITTI上取得更好的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05722 2026-04-20 cs.LG physics.chem-ph 57%

Teaching Language Models Mechanistic Explainability Through MechSMILES

通过MechSMILES教会语言模型机制性可解释性

Théo A. Neukomm, Zlatko Jončev, Philippe Schwaller

机构 * Laboratory of Artificial Chemical Intelligence (LIAC), Institut des Sciences et Ingénierie Chimiques, Ecole Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland(人工化学智能实验室(LIAC)、化学与工程学院、瑞士联邦理工学院(EPFL)、拉沃斯纳1015号)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出MechSMILES框架,通过箭头推导法教会语言模型预测化学反应机制,实现了反应路径验证、原子映射和催化剂识别等能力,展示了在复杂机制预测任务中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV 57%

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15134 2026-04-17 cs.CV 57%

How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos

如何正确犯错:一个用于构建和基准测试错误感知第一人称视频的框架

Olga Loginova, Frank Keller

机构 * University of Trento(特伦托大学) University of Edinburgh(爱丁堡大学) Italy(意大利) United Kingdom(大不列颠岛)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出PIE-V框架,通过引入可控的人类合理偏差来构建和评估错误感知的第一人称视频,结合心理学启发的错误计划、纠正计划、LLM作家和评委,提升视频的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14141 2026-04-17 cs.CV 57%

Geometric Context Transformer for Streaming 3D Reconstruction

流式3D重建的几何上下文变换器

Lin-Zhuo Chen, Jian Gao, Yihang Chen, Ka Leong Cheng, Yipengjing Sun, Liangxiao Hu, Nan Xue, Xing Zhu, Yujun Shen, Yao Yao, Yinghao Xu

机构 * technology.robbyant.com(robbyant技术公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出LingBot-Map,基于几何上下文变换器架构,通过精心设计的注意力机制实现流式3D重建,兼顾几何精度、时间一致性和计算效率,达到20FPS的稳定高效推理。

Comments Project page: https://technology.robbyant.com/lingbot-map Code: https://github.com/robbyant/lingbot-map

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14624 2026-04-17 cs.SE cs.AI 57%

Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks

询问何为关键:面向软件工程任务的奖励驱动澄清

Sanidhya Vijayvargiya, Vijay Viswanathan, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, USA(语言技术研究所,卡内基梅隆大学,匹兹堡,美国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究软件工程任务中有效澄清问题的方法,通过量化影响任务成功的信息类型和用户能提供的信息,提出基于Shapley属性和分布比较的多阶段强化学习奖励机制,训练出CLARITI模块,在未明确问题上表现优于GPT-5,生成更少问题。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14576 2026-04-17 cs.AI 57%

Enhancing Mental Health Counseling Support in Bangladesh using Culturally-Grounded Knowledge

在孟加拉国增强心理健康咨询支持:基于文化根基的知识

Md Arid Hasan, Azhagu Meena SP, Aditya Khan, Abu Md Akteruzzaman Bhuiyan, Helal Uddin Ahmed, Joysree Debi, Farig Sadeque, Annie En-Shiun Lee, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) mPower Social Enterprises Ltd(mPower社会企业有限公司) National Institute of Mental Health(心理健康国家研究所) Sajida Foundation(萨吉达基金会) BRAC University(BRAC大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨如何通过系统整合临床验证的知识提升LLM在心理健康咨询中的表现,比较了检索增强生成与知识图谱方法,证明结构化专业知识能提升咨询相关性与实用性。

Comments submitted to CLPsych 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14500 2026-04-17 cs.AI 57%

Geometric Metrics for MoE Specialization: From Fisher Information to Early Failure Detection

几何度量用于MoE专业化:从Fisher信息到早期故障检测

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Brain Investing Limited

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于信息几何的框架,通过Fisher信息度量分析MoE专业化动态,提出FSI和FHS指标,有效预测训练失败并提升模型性能。

Comments 6 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14386 2026-04-17 cs.GT cs.AI 57%

Coalition Formation in LLM Agent Networks: Stability Analysis and Convergence Guarantees

在LLM代理网络中的联盟形成:稳定性分析与收敛保证

Dongxin Guo, Jikun Wu, Siu-Ming Yiu

机构 * Department of Compute Science, The University of Hong Kong(香港大学计算机科学系) Brain Investing Limited(Brain Investing有限公司) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出首个基于享乐博弈理论的LLM联盟形成框架,分析了LLM代理的有限理性特性,并通过实验验证了CoalT协议在联盟稳定性上的优越性。

Comments 15 pages including supplementary material, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 57%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14222 2026-04-17 cs.IR cs.AI 57%

Adaptive Query Routing: A Tier-Based Framework for Hybrid Retrieval Across Financial, Legal, and Medical Documents

自适应查询路由:一种分层框架,用于金融、法律和医疗文档的混合检索

Afshan Hashmi

机构 * TRDC, Tuwaiq Academy(TRDC,图瓦伊克学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种分层框架,通过比较三种检索架构在金融、法律和医疗领域的表现,揭示了不同检索方法在不同复杂度层级上的性能差异,强调了树状推理和混合检索在跨参考和多段查询中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14069 2026-04-16 cs.CV 57%

Towards Unconstrained Human-Object Interaction

迈向无约束的人-物交互

Francesco Tonini, Alessandro Conti, Lorenzo Vaquero, Cigdem Beyan, Elisa Ricci

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Fondazione Bruno Kessler(布鲁诺·克塞勒基金会) Department of Computer Science, University of Verona(威尼斯大学计算机科学系)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过多模态大语言模型探索无约束人-物交互检测,提出无需预定义交互词汇的新任务,并展示MLLMs在该任务中的潜力。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14062 2026-04-16 cs.CV cs.MM 57%

OneHOI: Unifying Human-Object Interaction Generation and Editing

OneHOI:统一人类-物体交互生成与编辑

Jiun Tian Hoe, Weipeng Hu, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan

机构 * Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) Universiti Malaya(马来亚大学) VinUniversity(文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 OneHOI提出一种统一的扩散变换框架,整合人类-物体交互生成与编辑,通过共享的交互表示实现单条件去噪过程,支持多种控制模式,取得生成与编辑的最新成果。

Comments Accepted at CVPR2026. This paper moves toward unifying HOI generation and editing within a single model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13715 2026-04-16 cs.SD cs.AI 57%

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

迈向细粒度时间感知:通过音频侧时间提示进行后训练的大音频-语言模型

Yanfeng Shi, Pengfei Cai, Jun Liu, Qing Gu, Nan Jiang, Lirong Dai, Ian McLoughlin, Yan Song

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China, Hefei, China(语音与语言信息处理国家级工程研究中心,中国科学技术大学,合肥,中国) ICT Cluster, Singapore Institute of Technology, Singapore(新加坡理工学院ICT集群,新加坡)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Audio-Side Time Prompt方法,结合强化学习改进大音频-语言模型的时间感知能力,在音频定位、事件检测等任务中取得显著提升。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13598 2026-04-16 cs.LG stat.ME 57%

Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning

通过证据感知奖励和自校正偏好学习增强放射科报告生成

Qin Zhou, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao, Zhe Wang

机构 * Department of Computer Science and Engineering, ECUST(电子科技大学计算机科学与工程系) Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, P. R. China(教育部能源化工过程智能制造重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出ESC-RL方法,结合证据感知对齐奖励和自校正偏好学习,提升放射科报告生成的临床准确性与持续改进能力,实验表明其在胸部X光数据集上表现优异。

Comments 13 pages,4 figures, ACL2026-main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13100 2026-04-16 cs.SE cs.AI 57%

Contract-Coding: Towards Repo-Level Generation via Structured Symbolic Paradigm

合同编码:通过结构化符号范式实现仓库级生成

Yi Lin, Lujin Zhao, Yijie Shi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出合同编码,通过结构化符号范式解决仓库级生成中意图与代码之间的模糊性问题,实现意图驱动的架构合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01738 2026-04-16 cs.CV 57%

Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models

简单即正义:视觉基础模型中通用可推广AIGI检测的出现

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Bin Li

机构 * Shenzhen University(深圳大学) Nanchang University(南昌大学) University of North Texas(北得克萨斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出通过简单线性分类器在现代视觉基础模型冻结特征上训练,实现超越专门检测器的AIGI检测性能,尤其在真实世界数据集上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12551 2026-04-15 cs.CV 57%

Cross-Attentive Multiview Fusion of Vision-Language Embeddings

多视图交叉注意力的视觉-语言嵌入融合

Tomas Berriel Martins, Martin R. Oswald, Javier Civera

机构 * University of Zaragoza, Spain(阿拉贡大学,西班牙) University of Amsterdam, Netherlands(阿姆斯特丹大学,荷兰)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种多视图Transformer架构,通过跨视图视觉-语言描述符进行注意力融合,提升3D语义和实例分类性能,同时利用多视图一致性作为自监督信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 57%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08410 2026-04-15 cs.CV cs.RO 57%

BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields

BLaDA: 在3DGS场域中实现语言到功能灵巧动作的桥梁

Fan Yang, Wenrui Chen, Guorun Yan, Ruize Liao, Wanjun Jia, Dongsheng Luo, Jiacheng Lin, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Key Laboratory of Advanced Manufacturing Technology of the Ministry of Education, Guizhou University(教育部贵州大学先进制造技术重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 BLaDA提出一个可解释的零样本框架,通过解析自然语言为结构化的六元组操作约束,结合三角功能点定位模块和3D关键点抓取矩阵转换执行模块,实现功能灵巧操作的高精度和高成功率。

Comments Code will be publicly available at https://github.com/PopeyePxx/BLaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11786 2026-04-14 cs.AI cs.MA 57%

GenTac: Generative Modeling and Forecasting of Soccer Tactics

GenTac:生成式足球战术建模与预测

Jiayuan Rao, Tianlin Gui, Haoning Wu, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 GenTac通过生成式框架建模足球战术的随机过程,实现长周期轨迹预测,支持多因素条件模拟,展现高精度战术生成与未来战术预测能力。

Comments 40 pages, 5 figures; technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 57%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12038 2026-04-14 cs.AI 57%

Subargument Argumentation Frameworks: Separating Direct Conflict from Structural Dependency

子论点论证框架:区分直接冲突与结构依赖

Beishui Liao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出子论点论证框架(SAFs),通过将直接冲突与结构依赖分离,提升论证表示的表达能力,同时保持与Dung理论的语义兼容性。

Comments The original title, "Abstract Argumentation with Subargument Relations," has been replaced by "Subargument Argumentation Frameworks: Separating Direct Conflict from Structural Dependency"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17934 2026-04-14 cs.CL cs.AI 57%

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

AtlasKV:在20GB VRAM中通过十亿级知识图谱增强大语言模型

Haoyu Huang, Hong Ting Tsang, Jiaxin Bai, Xi Peng, Gong Zhang, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学) Theory Lab, Huawei(华为理论实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AtlasKV,一种通过十亿级知识图谱增强大语言模型的方法,利用子线性时间与内存复杂度实现高效知识整合,无需外部检索模块或长上下文先验。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11041 2026-04-14 cs.AI 57%

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

从拓扑到轨迹:LLM驱动的世界模型用于供应链韧性

Jia Luo

机构 * Huazhong University and Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ReflectiChain框架,通过生成世界模型和回顾代理强化学习,提升供应链韧性,实验显示在极端场景下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11005 2026-04-14 cs.AI 57%

Diffusion-CAM: Faithful Visual Explanations for dMLLMs

扩散-CAM:面向dMLLMs的可信视觉解释

Haomin Zuo, Yidi Li, Luoxiao Yang, Xiaofeng Zhang

机构 * Department of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知系) Sun Yat-sen University(中山大学) Northwestern University(西北大学) Technion - Israel Institute of Technology(以色列理工学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Diffusion-CAM,一种专为扩散多模态大语言模型设计的可解释性方法,通过可微探针获取中间表示,捕捉潜在特征及其类别梯度,解决空间模糊和图像内部混淆问题,提升定位准确性和视觉保真度。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10672 2026-04-14 stat.ML cs.LG 57%

One-Step Score-Based Density Ratio Estimation

一步式基于分数的密度比率估计

Wei Chen, Qibin Zhao, John Paisley, Junmei Yang, Delu Zeng

机构 * School of Mathematics, South China University of Technology(华南理工大学数学学院) Tensor Learning Team, RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心张量学习团队) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出OS-DRE,一种结合直接和基于分数方法优势的框架,通过分解时间分数为空间和时间成分,利用解析径向基函数框架,实现高效密度比率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10589 2026-04-14 cs.AI 57%

Working Paper: Towards Schema-based Learning from a Category-Theoretic Perspective

工作论文:从范畴论视角迈向基于模式的学习

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata I+D & Universidad Autonoma de Madrid(Cognodata I+D 与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种分层范畴框架,用于基于模式的学习,通过四个相互关联的层次结构,构建了模式、实现、语义和智能体等层面,实现了模式语义、认知、具身化和架构抽象的弱分层n-范畴结构。

Comments 43 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏