An Ubuntu-Guided Large Language Model Framework for Cognitive Behavioral Mental Health Dialogue
以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。
迈向稳定的半监督遥感分割:通过共引导与共混淆
机构 * School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院) ; Intelligent Computing and Application Laboratory of Qinghai Province, Qinghai University(青海省智能计算与应用实验室,青海大学) ; Key Lab of Big Data & Artificial Intelligence in Transportation (Ministry of Education), School of Computer Science & Technology, Beijing Jiaotong University(交通运输大数据与人工智能重点实验室(教育部),北京交通大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出Co2S框架,通过融合视觉-语言模型和自监督模型的先验知识,解决半监督遥感分割中的伪标签漂移问题,提升分割精度。
Comments 12 pages, 5 figures, 9 tables
L-RAG:基于熵的惰性加载平衡上下文与检索
机构 * Faculty of Computer Science and Cybernetics(计算机科学与自动化系) ; Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) ; ClickUp(ClickUp公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 L-RAG通过基于熵的惰性加载机制,在准确率与效率之间提供可调节的权衡,有效减少检索开销并提升RAG系统的部署效率。
3D CoCa v2:基于测试时间搜索的对比学习用于通用空间智能
机构 * School of Computer Science, Peking University(北京大学计算机学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 3D CoCa v2通过测试时间搜索提升3D场景描述的泛化能力,实现对比学习与描述生成的统一,提高鲁棒性。
Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划
机构 * Independent Researcher(独立研究者)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。
Comments 22 pages, 5 figures, 4 tables, 1 algorithm
TEAS: 可信教育AI标准:可验证、稳定、可审计和教学上可靠的系统框架
机构 * Abu Syed(阿布·赛德)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出TEAS框架,通过可验证性、稳定性、可审计性和教学合理性四个支柱,为教育AI系统提供可信度标准,强调系统架构而非模型能力的重要性。
Comments 19 pages, 6 tables, accepted at AAAI-26 (DAI Workshop) in Singapore
超越点击:通过文本拖动实现通用GUI定位的一步
机构 * The Ohio State University(俄亥俄州立大学) ; Microsoft Research, Redmond(微软研究院(红mond))
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI
AI总结 本文提出GUI-Drag数据集和ScreenDrag基准,通过文本拖动提升GUI定位能力,实现更通用的GUI交互模型。
Comments 29 pages
A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估
机构 * Nankai University(南开大学) ; vivo AI Lab(vivo 人工智能实验室) ; SJTU(上海交通大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。
通过不安全权重操作实现安全的视觉-语言模型
机构 * University of Trento(特伦托大学) ; NVIDIA(NVIDIA公司) ; Georgia Tech(佐治亚理工学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。
Comments WACV 2026
更多图像,更多问题?对VLV失败模式的受控分析
机构 * MPI for Informatics Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰信息学校区) ; Samsung AI Cambridge(三星人工智能(剑桥)) ; Technical University of Iași Romania(罗文扎大学(罗马尼亚)) ; Queen Mary University of London UK(伦敦女王大学(英国))
专题命中 幻觉与鲁棒性 :VLM(title);vision language model(abstract);分类 cs.CV
AI总结 MIMIC基准通过诊断实验揭示LVLM在多图像任务中的失败模式,并提出数据生成和注意力遮罩方案以提升跨图像信息聚合能力。
Comments 19 pages, 16 figures
MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估
机构 * University of Notre Dame(诺丁汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Montreal(蒙特利尔大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI
AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。
Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings
关于3D大视觉-语言模型的对抗鲁棒性
机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。
Comments Under Review
语气至关重要:语言语气对VLMs幻觉影响的研究
机构 * Department of Computer Science and Technology, Kean University(计算机科学与技术系,凯恩大学) ; Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了提示语气对VLMs幻觉的影响,通过Ghost-100数据集发现幻觉率与提示强度非线性相关,揭示模型在处理结构性强制时的局限性。
Comments 10 pages, 6 figures, WACV Workshop
OpenRT: 一种用于多模态大语言模型的开源红队框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。
OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The University of Hong Kong(香港大学) ; CUHK MMLab(香港中文大学MMLab) ; Xi’an Jiaotong University(西安交通大学) ; Nanjing University(南京大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。
Comments 31 pages, 11 figures, 12 tables
Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Oxford(牛津大学) ; Xi’an Jiaotong University(西安交通大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Northeastern University(东北大学) ; Beijing University of Technology(北京理工大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。
FlyCo:基于基础模型的无人机自主3D结构扫描系统
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) ; School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) ; Differential Robotics, Hangzhou, China(杭州差分机器人)
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 FlyCo通过整合基础模型实现无人机自主3D扫描,提升开放世界环境下的目标定位与预测效率。
Comments 34 pages, 24 figures, 9 tables. Video: https://www.youtube.com/playlist?list=PLqjZjnqsCyl40rw3y15Yzc7Mdo-z1y2j8
HiRes-LLaVA: 高分辨率大视觉-语言模型中碎片化输入的恢复
机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) ; Huawei(华为) ; The Hong Kong University of Science and Technology(香港科技大学) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(title,abstract);分类 cs.CV
AI总结 HiRes-LLaVA通过引入SliceRestore适配器和Self-Mining Sampler,有效恢复高分辨率输入的碎片化问题,提升模型在文档相关任务中的性能。
利用视觉-语言模型实现灵巧操作的支架
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
AI总结 利用视觉-语言模型生成任务相关轨迹,训练低层RL策略实现灵巧操作,无需人工演示或奖励。
单模语言代理能否为调整多模态视觉-语言模型提供偏好?
机构 * Georgia State University(佐治亚州立大学) ; Duke University(杜克大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)
AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。
Comments Accepted to IJCNLP-AACL 2025 Findings
COVR:视觉控制中视觉语言模型与强化学习代理的协同优化
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 COVR通过协同优化视觉语言模型与强化学习代理,利用RL生成数据提升VLM语义推理能力,并通过动作先验引导策略学习,实现视觉控制任务中的高效优化。
Comments The paper was accepted by the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)
看到正确却说错:在MLLMs中无需训练的跨层和内层细化
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 DualPD通过双视角解码细化策略,无需额外训练提升多模态大语言模型的视觉理解准确性。
RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调
机构 * Columbia University(哥伦比亚大学) ; Amazon(亚马逊) ; Princeton University(普林斯顿大学) ; Capital One
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG
AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。
迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。
EZBlender:基于计划与反应代理的高效3D编辑
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。
Cap2Sum: 通过生成描述来学习视频摘要
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 Cap2Sum通过生成视频描述来学习视频摘要,利用密集视频描述注释提升模型性能和泛化能力。
Comments 13 pages, 4 figures
释放原生推荐潜力:基于结构化术语标识符的LLM生成推荐
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出GRLM框架,通过结构化术语标识符提升生成推荐系统的性能和通用性。
边看边说:解锁多模态大语言模型的实时视频理解能力
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) ; Shanghai Jiao Tong University(上海交通大学) ; Ocean University of China(中国海洋大学)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。
VVTRec: 通过视觉和文本模态增强进行无线电干涉图重建
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 VVTRec通过融合视觉和文本模态增强,提升无线电干涉图重建的图像质量和准确性。
利用大型语言模型纠正社交媒体上的虚假信息
机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) ; Computer Science Department, Boise State University(计算机科学系,博伊西州立大学) ; Microsoft Corporation(微软公司)
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI
AI总结 MUSE通过结合视觉语言模型和网络检索,有效纠正社交媒体上的虚假信息,优于GPT-4和社交媒体用户回复。
Comments 52 pages