Bolo: Verified Model Hub for Next-Generation AI Databases
Bolo:面向下一代AI数据库的经验证的模型中心
专题命中 多模态生成 :multi-modal(abstract)
AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。
Comments 5 Pages
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Bolo:面向下一代AI数据库的经验证的模型中心
专题命中 多模态生成 :multi-modal(abstract)
AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。
Comments 5 Pages
SuppreSensing:面向多模态目标检测的专家引导特征重校准与差异增强
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对遥感多模态目标检测的语义异质性与模态噪声问题,本文提出SuppreSensing,通过EMFR模块、差异增强策略和ECFP模块实现最优性能,在多个数据集上达到SOTA并具备良好泛化性。
Comments 10 pages
EmotionDialogCN:面向普通话情感对话的自发多模态数据集
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 该研究推出EmotionDialogCN数据集,其规模大、情感分布贴合真实情况,采用新型采集框架减少设备干扰,可支撑多模态情感相关研究。
GeoExplain:基于街景图像视觉信息层次的多模态推理
机构 * The University of Queensland(昆士兰大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 针对现有多模态推理任务缺乏对不同粒度视觉线索推理的研究缺口,提出GeoExplain数据集与SightSense方法,实现街景图像的地理定位预测与可解释性说明,且方法在该数据集上表现优异。
Comments Updated version
面向自动驾驶的结合语义属性的多模态交通标志检测
机构 * Arriver System Software S.r.l.(Arriver系统软件有限责任公司) ; Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司) ; Qualcomm Auto Ltd.(高通汽车有限公司) ; Qualcomm Technologies, Inc(高通技术公司)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV
AI总结 针对自动驾驶中交通标志检测的跨区域泛化差、远距离小目标检测弱、跟踪易受透视畸变影响的问题,提出多模态框架,结合LiDAR与相机,引入强度感知可变形融合模块、双运动模型跟踪器及语义属性分类流水线,在多国数据集上取得低漏检率,实现全球可泛化的商用级交通标志感知。
基于线性判别树集成的可解释多模态分类
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究针对多模态分类器需平衡准确率与可解释性的需求,提出基于线性判别树集成的框架,在多模态情感行为分类任务中实现了优于基线模型的性能与更高的人类标注一致性。
CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。
Comments 11 pages, 3 figures, 5 tables
MigrationNarrate:用于检测YouTube视频中移民叙事的数据集
机构 * University of Sheffield(谢菲尔德大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。
Comments This work was accepted to the main conference of EMNLP 2026
OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准
机构 * Nankai University(南开大学) ; University of Waterloo(滑铁卢大学) ; Nanjing University(南京大学)
专题命中 多模态评测 :omni-modal(abstract);分类 cs.CV
AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。
Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)
BC-Bench:在ERP领域特定语言中评估智能体工程
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。
TRACE:基于多源证据锚定的智能体式商品目录丰富
机构 * DoorDash(多闸道科技(DoorDash))
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。
Comments 12 pages, 2 figures
基于文献先验环境上下文的脑电情感状态神经地理空间建模
机构 * The University of Melbourne(墨尔本大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本研究提出双塔式架构融合EEG-Conformer与图环境编码器,利用文献先验环境上下文提升EEG情感分类性能,在EAV基准上准确率达76.2%,为相关联合研究提供框架。
AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集
机构 * Xidian University(西安电子科技大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。
Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026
看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。
Comments Accepted by EMNLP 2026 Main
文本是什么颜色?:一个用于评估图像嵌入提示引发幻觉的基准
机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(软件学院、人工智能研究院、北航、北京、中国) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, Beijing, China(未来区块链与隐私计算先进创新中心、北航、北京、中国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出Embedded Stroop范式,构建WCIT基准评估MLLMs的图像嵌入提示幻觉,发现语义可读性可主导其视觉颜色感知。
超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架
专题命中 多模态评测 :multimodal(abstract)
AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。
Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment
多模态大语言模型时代的容积放射学人工智能
机构 * Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Southern Medical University(南方医科大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院) ; Westlake University(西湖大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 该综述梳理截至2026年7月的200余篇文献,探讨多模态大语言模型时代容积放射学AI的表征、智能体系统及临床评估,提出相关框架以明确原生容积建模的适用场景。
Comments 9 Figures, 6 tables
表征影响检索:多模态智能体框架中技能发现与路由的案例研究
机构 * Cloudglue USA(美国Cloudglue公司)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 该研究以多模态智能体框架Tinycloud为案例,发现提示内技能的部分暴露会产生词汇竞争,抑制正确技能选择,其为大规模技能路由提供了小规模视角。
Comments 5 pages, 1 figure, 3 tables. Accepted at AgentSearch '26 workshop at SIGIR 2026 (Melbourne, Australia, July 24, 2026)
多模态智能体框架的基础与前沿:技术及应用综述
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。
Comments Accepted at TMLR
面向基于视觉-语言-动作(VLA)的端到端自动驾驶的协同多模态交互
机构 * National University of Singapore (NUS)(新加坡国立大学) ; Hunan University(湖南大学) ; The University of Western Australia (UWA)(西澳大学)
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文针对现有VLA自动驾驶模型决策不可靠、多模态交互不足的问题,提出含三类核心组件的多模态交互与多轨迹规划系统,实验显示其在安全推理与场景感知上优于现有系统。
无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化
机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) ; CQSB, Sorbonne Université(索邦大学 CQSB)
专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。
AEGIS:防止MCP中的跨域资源滥用
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。
大规模AI手写物理评估评分:评分一致性与奥林匹克团队选拔结果
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本研究评估基于GPT-5.5的AI对三类物理手写评估的评分表现,其与官方评分相关性高且能准确选拔奥林匹克团队,第二轮评分优化了一致性,AI评分可作为考官控制下的辅助评分工具。
你的工具不安全:评测命令行界面智能体的现实威胁
专题命中 多模态Agent :multimodal(abstract)
AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。
Comments Accepted by EMNLP 2026 (Findings)
ReFrame:多模态大语言模型中基于证据的测试时安全对齐
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) ; State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) ; School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.AI
AI总结 该研究针对现有多模态安全对齐方法不适用于闭源模型的问题,提出无需训练的ReFrame框架,通过两个智能体协作实现测试时安全对齐,在提升安全性能的同时保留多模态效用。
Comments Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables
VT-MUSE:面向操作任务的多模态统一时序视觉-触觉表示学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xense Robotics(Xense机器人公司) ; BUPT(北京邮电大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本研究提出VT-MUSE视觉-触觉多模态统一时序表示学习框架,通过两阶段学习解决现有方法的跨模态依赖捕获与时序接触演化忽略问题,在仿真和真实操作任务中性能优于基线
潜在有序证据与未对齐输出:多模态大语言模型的推理时有序视角对齐
机构 * Monash University(莫纳什大学) ; Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型有序输出未对齐问题,本文提出推理时的Ordinal Lens Alignment方法,提升有序回归任务性能且优于现有基线。
Comments EMNLP 2026 (Main Conference)
A2DINOv3:通过社会化协作重新思考多模态目标检测
专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出A2DINOv3框架,通过社会化协作协议让RGB与红外分支以异构专家模式选择性交互,结合零初始化策略,在四个多模态基准上实现了多模态目标检测的SOTA性能。
TLive-Omni:面向电商直播的全模态理解模型
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)
专题命中 多模态训练与对齐 :omni-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出专为电商直播设计的全模态理解模型TLive-Omni,通过引入Per-vGrid等技术,结合多阶段训练流程,在电商直播基准任务上表现强劲且泛化能力出色。
用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。