When More Cores Hurts: The Vector Database Scaling Paradox in HPC
当更多核心有害:HPC中的向量数据库扩展悖论
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文评估了三种向量数据库在HPC系统上的扩展性能,发现工作负载特性限制延迟降低,增加核心可降低查询吞吐量达30.67%,扩展16倍仅提升5.46倍,揭示了云导向设计与HPC系统的不匹配。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
当更多核心有害:HPC中的向量数据库扩展悖论
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文评估了三种向量数据库在HPC系统上的扩展性能,发现工作负载特性限制延迟降低,增加核心可降低查询吞吐量达30.67%,扩展16倍仅提升5.46倍,揭示了云导向设计与HPC系统的不匹配。
语言作为传感器:从自然语言在3D场景中进行校准的空间信念估计
机构 * MIT Laboratory for Information & Decision Systems(麻省理工学院信息与决策系统实验室) ; MIT Computer Science & Artificial Intelligence Laboratory(麻省理工学院计算机科学与人工智能实验室)
专题命中 多模态评测 :multimodal(abstract)
AI总结 提出语言传感器模型(LSM)将自然语言描述转化为校准的空间分布,并融合到VL-Map概率框架中,实现更准确的目标定位。
Comments 18 pages, 7 figures, 3 tables
一种双系统癫痫诊断方法:融合Mamba-Bi-LSTM架构与基于SHAP的验证
专题命中 多模态评测 :cross-modal(abstract)
AI总结 提出双系统智能诊断框架,主判别系统结合Mamba与Bi-LSTM实现高精度,验证系统通过SHAP提供可解释性,准确率从92.6%提升至98.7%。
Comments 18 pages, 11 figures, 16 tables
Journal ref Biomedical Engineering Advances 11 (2026) 100218
约束感知优化用于鲁棒蛋白质稳定性预测
机构 * Birla Institute of Technology and Science Pilani, Hyderabad Campus(比拉理工学院海得拉巴校区)
专题命中 多模态评测 :multimodal(abstract)
AI总结 提出约束感知优化框架,结合平衡均方误差、孪生反对称正则化器和OOD边缘一致性损失,在不改变SPURS架构下提升蛋白质稳定性预测的鲁棒性,在多个基准上取得显著改进。
选择正确的MCMC采样器:无梯度方法的系统基准测试
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文通过一系列指标和方法,系统比较了多种现代无梯度马尔可夫链蒙特卡洛(MCMC)采样器与常用Metropolis-Hastings算法的性能,发现差分进化算法在遍历性、鲁棒性和似然性能方面表现最佳。
Comments Submitted to MNRAS; 30 pages, 29 figures; resubmitted to fix bibliography
通过温度切换的集体退火:一种玻尔兹曼型描述
专题命中 多模态评测 :multimodal(abstract)
AI总结 提出一种基于粒子交换温度的集体退火算法(CAST),通过随机二元相互作用实现自适应冷却调度,数值实验表明在多模态问题上收敛速度优于经典模拟退火。
多传感器复用的单链背散射标签
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出MATRIX标签,通过电压分量复用实现多传感器同时工作,采用PWM波形编码和隐藏马尔可夫模型实现可靠解复用,验证了其在植物传感、健康监测和麦克风方向定位中的有效性。
Comments 14 pages, 23 figures
Journal ref Proceedings of the 2026 ACM/IEEE International Conference on Embedded Artificial Intelligence and Sensing Systems
ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。
Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3
Visual Para-Thinker++:用于视觉推理的单策略多智能体框架
机构 * Zhejiang University(浙江大学) ; Hunan University(湖南大学) ; Tianjin University(天津大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学) ; Jilin University(吉林大学)
专题命中 多模态Agent :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 提出Visual Para-Thinker++框架,通过共享MLLM策略实例化为多个角色智能体并行推理,结合多智能体能力注入和角色解耦优化,有效缓解视觉推理中的早期感知承诺和幻觉问题。
对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例
机构 * National Taiwan University(国立台湾大学) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Radboud University(拉德堡德大学) ; Institut Jean Nicod(让·尼科研究所)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。
桥接传统可解释性方法与多模态多语言模型:基于XAI的分析
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。
Comments Bachelor's thesis
HDRAgent: 一种用于多曝光HDR成像的智能体框架
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) ; Zhejiang University(浙江大学) ; Camera Group, DJI(大疆相机部门)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。
PathoSage:通过经验感知的代理工作流实现病理学多源证据裁决
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Department of Pathology and Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科/临床病理研究所) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) ; School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出PathoSage框架,通过结构化证据审议和Beta-Bernoulli经验系统,独立评估工具证据并解决冲突,减少幻觉和分类器分歧,提升病理学推理鲁棒性。
EvoIR-Agent: 通过经验驱动学习实现自进化图像修复智能体
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出EvoIR-Agent,通过经验驱动学习解决图像修复中经验不足导致的规划失败问题,通过构建分层经验池和自进化机制提升修复性能和效率,实验表明其在全参考指标上表现优异,且在性能与效率之间取得显著平衡。
Comments Temporarily withdrawn for institutional clearance and compliance review. A revised version will be uploaded once the process is finalized
AlloSpatial:基础模型中空间推理的智能体框架
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; University of Science and Technology Beijing(北京科技大学)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 提出AlloSpatial框架,通过World2Mind认知映射沙箱将自我中心观察转化为异中心空间先验,并利用空间推理工具实现几何语义仲裁,在VSI-Bench和MindCube上提升模型5%-18%的空间推理性能。
PhysAgent: 通过轨迹驱动的多智能体反馈实现基于物理的4D合成自动化
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 提出PhysAgent,首个模拟器在环的多智能体框架,通过解耦材料与外力、利用视觉基础模型提取轨迹并借助LLM常识推理,实现自动化、物理可信的4D运动合成,显著提升生成多样性与物理准确性。
SKILL.nb:用于持久代理工作流的选择性形式化与门控执行
机构 * ServiceNow Research ; Mila ; Polytechnique Montréal(蒙特利尔综合理工学院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出SKILL.nb框架,通过选择性形式化和门控执行管理代理工作流的生命周期可靠性,在WebArena-Verified上单轮成功率达53.7%,重执行保留率91.7%。
Syll: 开源个人自动化与跨界面执行
机构 * Adobe Systems Inc.(Adobe系统公司) ; Stardew Valley(《星露谷物语》) ; macOS ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出开源多模态智能体框架Syll,通过统一API、CLI和GUI控制,支持用户演示教学和可审计执行,实现跨界面个人自动化。
Comments Code: https://github.com/THU-SAGE/syll
面向智能信息-物理-社会系统的区块链基础设施:具身AI时代的后量子安全、互操作性与可信数据经济
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Sun Yat-sen University(中山大学) ; Amazon Web Services(亚马逊网络服务) ; Duke Kunshan University(杜克昆山大学)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本教程探讨区块链作为协调层,融合后量子密码学与具身AI,实现可扩展、可信的数据经济与跨组织治理。
LUNA-AD: 面向自动驾驶的轻量级不确定性感知语言模型与终身学习
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多模态Agent :multimodal(abstract)
AI总结 提出LUNA-AD,一种结合三系统架构、多智能体分析、双头轻量模型和反思驱动终身学习的轻量级不确定性感知语言模型,在nuPlan上实现高成功率与低推理延迟。
Comments 16 pages,9 figures
状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击
机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) ; National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) ; College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 多模态Agent :multimodal(abstract)
AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。
DifferSeg: 通过差分感知与频率引导实现多样化的多模态二值分割
机构 * School of Artificial Intelligence, Jiangxi Normal University(江西师范大学人工智能学院) ; Institute of AI Education, East China Normal University(华东师范大学人工智能教育研究所) ; Yale School of Medicine, Yale University(耶鲁大学医学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出DifferSeg框架,通过差分感知融合模块自适应对齐多模态特征,并设计频率引导解码器平衡高低频表示,在29个公开数据集上超越67种方法。
DyCo-RL: 用于视觉推理的动态跨模态协调
机构 * University of Trento(特伦托大学) ; BAAI(北京智源人工智能研究院) ; Singapore Management University(新加坡管理大学) ; IQuest Research
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。
MVCL-DAF++: 通过原型感知对比对齐和由粗到细动态注意力融合增强多模态意图识别
机构 * University of Shanghai for Science and TechnologyChina(上海科学技术大学中国) ; Shenzhen Institute of Advanced Technology, Chinese Academy of SciencesChina(深圳先进技术研究院,中国科学院中国) ; University of Minnesota-Twin Cities, USA(明尼苏达大学双城分校,美国) ; University of LeedsUK(利兹大学,英国)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出MVCL-DAF++,通过原型感知对比对齐和由粗到细注意力融合,在MIntRec和MIntRec2.0上提升多模态意图识别,尤其改善稀有类识别。
Comments Accepted by Interspeech 2026
晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由
机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。
Comments 18 pages, 4 figures. Submitted to Pattern Recognition
教多模态推荐模型通过个性化视觉提取和自适应学习来观察
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)
AI总结 提出REVEAL框架,通过反馈引导的视觉提取和自适应视觉学习,增强视觉特征利用和跨模态优化,提升多模态序列推荐性能。
基于标签的跨模态融合用于成人到儿童ECG转移 via 课程门控对比对齐
机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) ; Nanjing Medical University(南京医科大学) ; Zhengzhou University(郑州大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)
AI总结 本文提出PEACE框架,通过预训练和适应性融合提升儿童ECG诊断,采用对比学习和课程适应策略,在有限标注下实现高准确率。
NeuroAlign: 用于MCI分析的动态与结构性神经影像的分层多模态融合
机构 * Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)人工智能学院智能科学与工程学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Guangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学部生物医学工程学院广东省生物医学测量与超声成像重点实验室) ; Department of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences(广西壮族自治区人民医院放射科,广西医学科学院) ; Shenzhen Sixth People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital(华中科技大学协和深圳医院(深圳市第六人民医院)) ; School of Basic Medical Sciences, Shenzhen University(深圳大学基础医学院) ; Egypt-Japan University of Science and Technology (E-JUST)(埃及日本科技大学) ; School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical Measurements and Ultrasound Imaging, Shenzhen University Medical School(深圳大学医学部生物医学工程学院,国家地方联合医学超声关键技术工程实验室,广东省生物医学测量与超声成像重点实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出NeuroAlign框架,通过双模态分层对齐和双域分层交互融合fMRI与DTI特征,实现MCI/SCD检测,并设计无梯度归因方法SAM进行特征分析。
VFEM: 视觉特征赋能的多变量时间序列预测与跨模态融合
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Pengcheng Laboratory(鹏城实验室) ; Ant Group(蚂蚁集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出VFEM模型,利用预训练大视觉模型通过跨模态注意力融合视觉与时间特征,仅训练7.45%参数即可捕捉跨变量依赖,提升多变量时间序列预测性能。
显式表示对齐用于多模态情感分析
机构 * AgentAlpha
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。
Comments 10 pages, 5 figures