Factorized Transport Alignment for Multimodal and Multiview E-commerce Representation Learning
因子化运输对多模态和多视角电商表示学习
专题命中 效率与部署 :language model(abstract);pretraining(abstract)
AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。
Comments Accepted by WSDM'26
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
因子化运输对多模态和多视角电商表示学习
专题命中 效率与部署 :language model(abstract);pretraining(abstract)
AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。
Comments Accepted by WSDM'26
CodeGEMM: 一种以代码本为中心的高效GEMM方法用于量化LLM
机构 * NAVER Cloud(NAVER云)
专题命中 效率与部署 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 CodeGEMM通过预计算内积替代去量化,提高量化LLM的推理效率和内存利用率
Comments NeurIPS 2025
独立密度估计
机构 * Orcava Inc.(Orcava公司)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 本研究提出独立密度估计(IDE)方法,通过学习句子中单个词与图像特征之间的联系,提升模型在组合泛化任务上的性能。
Comments 10 pages, 1 table, 4 figures
迈向引导下降:大规模训练神经网络的优化算法
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 效率与部署 :foundation model(abstract);分类 cs.LG
AI总结 本文探讨了大规模神经网络训练中优化算法的改进,通过分析传统方法的局限性,提出基于曲率信息的先进技术,以提升训练效率和可解释性。
Comments Master's Thesis at the University of Pennsylvania
谁能穿透你?基于VLM的属性推断攻击的对抗防护
机构 * East China Normal University(东华大学) ; Zhongguancun Academy(中关村学院) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI
AI总结 本文提出了一种基于视觉一致性约束的隐私保护方法,通过VPI-COCO基准验证,有效降低隐私泄露风险并保持视觉一致性。
cVLA:迈向高效的相机空间VLA
机构 * University of Freiburg(弗赖堡大学)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 cVLA通过利用视觉语言模型在2D图像上的性能,提出了一种高效预测机器人轨迹的VLA方法,具备良好的仿真到现实迁移能力。
Comments 20 pages, 10 figures; CoRL 2025 Workshop on Generalizable Priors for Robot Manipulation
X-Talk:模块化语音到语音对话系统的被低估潜力
机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能基础理论重点实验室,X-LANCE实验室,上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Audio, Speech and Language Processing Group, Northwestern Polytechnical University(语音与语言处理组,西北工业大学) ; Fudan University(复旦大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中 效率与部署 :LLM(abstract)
AI总结 X-Talk通过模块化设计和流水线优化,提升语音到语音对话系统的性能与灵活性,展示其在复杂语音任务中的潜力。
Comments 14 pages
MeanVC: 一种轻量级和流式零样本语音转换方法
专题命中 效率与部署 :post-training(abstract)
AI总结 MeanVC通过引入均值流和扩散对抗后训练,实现轻量级、高效的零样本语音转换,提升语音质量和效率。
使强纠错码在AI推理中的HBM中有效工作
专题命中 效率与部署 :LLM(abstract)
AI总结 REACH通过控制器管理的强纠错码在HBM中实现高错误容忍度,减少ECC面积和功耗,提升AI推理效率。
粗到细的开放式图节点分类与大语言模型
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CFC框架,利用大语言模型实现图节点的粗到细开放式分类,提升OOD检测和分类性能。
Comments Accepted to AAAI 2026
政策推荐用的Instructor-Worker大语言模型系统:以2025年1月洛杉矶野火空气质量分析为例
机构 * Department of Systems Design Engineering(系统设计工程系) ; College of Land Engineering(土地工程学院) ; School of Computer Science(计算机科学学院) ; Department of Geography and Environmental Management(地理与环境管理系) ; Department of Geomatics Engineering(测绘工程系)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Instructor-Worker大语言模型系统,用于基于2025年1月洛杉矶野火期间空气质量数据的政策推荐研究。
Journal ref International Journal of Applied Earth Observation and Geoinformation 143 (2025) 104774
一种使用本地大语言模型的隐私保护推荐器,用于填写网页表单
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出了一种基于本地大语言模型的隐私保护推荐器,用于自动填写网页表单,以提高测试效率并保护数据安全。
利用大语言模型生成文档伪造检测的程序规则
机构 * Stuttgart Media University(斯图加特媒体大学) ; Ruhr-University Bochum(鲁尔大学波恩)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文利用大语言模型生成文档伪造检测的规则,通过微调策略在受限硬件上实现高效验证程序。
Comments Accepted at ICMLA 2025, the first two authors contributed equally
清晰地看见正义:结合OCR和视觉-语言模型的 handwritten 法律文件翻译
专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出利用视觉大语言模型统一OCR与机器翻译流程,以提升低资源环境下手写法律文件的翻译效率和准确性。
Comments Accepted in AILaw @ AAAI 2026 Conference
通过对齐蒸馏增强医学大视觉-语言模型
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 本文提出MEDALIGN方法,通过蒸馏CLIP模型的知识提升医学大视觉-语言模型的视觉对齐和生成质量。
Comments Accepted to AAAI'2026 (Main track)
AmPLe: 通过自适应去偏集成多提示学习支持视觉-语言模型
机构 * National Key Laboratory of Space Integrated Information System, Institute of Software, Chinese Academy of Sciences(中国科学院空间信息集成系统国家重点实验室,软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 AmPLe通过自适应去偏集成多提示学习方法,解决模型-提示匹配偏差和样本-提示匹配偏差,提升视觉-语言模型在下游任务中的性能。
Comments Accepted by IJCV2025
评估LLMs在真实医疗随访中的挑战:一项比较研究及优化框架
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种模块化框架,通过任务分解、语义聚类和流程管理提升医疗随访中LLM的对话稳定性和准确性,同时减少对话轮次和token消耗。
Comments 10 pages,3 figures,conference ICCBB2025
面向提示的自适应弹性权重固化用于医学视觉-语言模型的持续学习
机构 * University College London(伦敦大学学院)
专题命中 领域大模型 :language model(title,abstract)
AI总结 PA-EWC通过提示引导的参数专门化,有效缓解医疗视觉-语言模型在持续学习中的灾难性遗忘问题,提升多模态医学任务的性能。
Comments Accepted by 32nd International Conference on MultiMedia Modeling (MMM 2026)
SAMSA 2.0:基于光谱角度的提示分割任意事物用于超光谱交互医学图像分割
机构 * The Hamlyn Centre for Robotic Surgery, Department of Surgery and Cancer Imperial College London(哈姆林机器人手术中心、外科与癌症系帝国理工学院伦敦)
专题命中 领域大模型 :prompting(title,abstract)
AI总结 SAMSA 2.0通过引入光谱角度提示,提升超光谱医学图像分割的准确性和鲁棒性,实现比RGB-only模型和先前光谱融合方法更高的Dice分数。
DACE用于铁路缩写消歧
机构 * Nantes University(南特大学) ; CIRAD(国际热带农业研究中心) ; Groupe SII(SII集团) ; Univ. Lille(里尔大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 DACE通过动态提示和集合聚合方法,有效提升铁路文档中缩写消歧的准确率,取得竞赛第一名。
NEURO-GUARD:神经符号泛化与无偏自适应路由用于诊断——可解释的医疗AI
机构 * Arizona State University(亚利桑那州立大学)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 NEURO-GUARD通过整合视觉变换器与语言驱动推理,提升医疗图像诊断的准确性、透明性和泛化能力。
Comments Accepted at Asilomar Conference
一种用于培训全科医学生技能的代理AI框架
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种代理AI框架,用于培训全科医学生技能,通过统一病例生成、角色驱动对话和基于标准的评估,提升医学教育中虚拟模拟患者的效果。
微软学术图信息检索用于研究推荐与协助
机构 * Microsoft(微软)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出基于注意力的子图检索器,利用图神经网络和大语言模型进行高效信息检索与知识推理。
Comments 5 pages, 3 figures
容错多智能体系统在医疗中的应用:基于 gossip 协议的安全医疗信息传播方法
机构 * Nihir Chadderwala(独立研究者)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种基于 gossip 协议的拜占庭容错多智能体系统,用于医疗领域,通过加密验证和共识协议保障信息安全与系统容错性。
TermGPT:面向法律和金融领域术语适应的多级对比微调
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 TermGPT通过多级对比微调提升法律和金融领域术语区分能力,构建首个金融术语数据集并优于现有基线。
Comments 13 pages, 4 figures, AAAI'26
向揭示医疗大语言模型中的细微偏见迈进
机构 * University of Delaware(特拉华大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。
即使GPT也可以拒绝我:概念化突然拒绝二次伤害(ARSH)并重新想象以同理心为核心的AI安全(CCS)
专题命中 领域大模型 :large language model(abstract);language model(abstract)
AI总结 本文提出ARSH概念,通过CCS设计框架减少AI拒绝带来的心理伤害,提升人机交互的心理安全。
在文档中发现不一致之处
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 本文提出FIND基准测试,评估语言模型在发现文档中不一致性的能力,发现gpt-5能识别64%的人工插入不一致性,并发现原始文档中的未被发现的不一致性,但仍然存在大量未检测到的不一致性。
基于本体的知识图谱框架:通过层次化和命题化结构构建工业标准文档
专题命中 领域大模型 :LLM(abstract);分类 cs.CL
AI总结 本文提出一种基于本体的知识图谱框架,通过层次化和命题化结构构建工业标准文档,提升问答性能和领域知识表示能力。
Comments The authors have identified significant technical errors in the paper that invalidate the current findings
语言学和人工智能研究51年告诉我们关于它们相关性的内容:一项科学计量分析
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 本研究通过科学计量分析揭示语言学与人工智能51年的相关性,发现出版量显著增长,涉及新兴问题与热点,推动深度学习语言模型发展。
Comments 26 pages, 15 figures
Journal ref Artificial Intelligence Review, 2025