Fashion Matrix: Editing Photos by Just Talking
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Comments 13 pages, 5 figures, 2 tables
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Comments 13 pages, 5 figures, 2 tables
专题命中 领域大模型 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACM RecSys 2022. The arXiv version is more comprehensive
专题命中 领域大模型 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 领域大模型 :foundation model(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments Accepted by NeurIPS'24 Workshop on AIM-FM: Advancements In Medical Foundation Models: Explainability, Robustness, Security, and Beyond
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments Published at ICLR 2024 Workshop on Reliable and Responsible Foundation Models
专题命中 领域大模型 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments 8 pages (4 in appendix), 22 tables/figures (16 in appendix). Accepted to LLM-IGS@WSDM2024 workshop, now sharing this slightly updated revision version with workshop
面向条件化CMR合成的生成式基础模型的元数据感知适配
机构 * Facultat de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与信息学院) ; NIHR Barts Biomedical Research Centre(英国国立卫生研究院巴特生物医学研究中心) ; St Bartholomew’s Hospital(圣巴塞洛缪医院) ; Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI
AI总结 本研究提出整合无元数据CFG等策略的元数据感知适配方法,基于预训练潜在扩散模型实现仅用患者元数据的CMR合成,在UK Biobank数据集上显著提升FID,验证了生成式基础模型用于临床CMR合成的潜力。
Comments 5 pages, 3 figures
结合约束大语言模型重排序的多模态语义扩展用于对话式音乐推荐
机构 * National Institute of Technology Kurukshetra(库鲁克谢特拉国家技术学院) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI
AI总结 该研究针对ACM RecSys 2026挑战赛提出三阶段多模态对话音乐推荐系统,经优化后在Blind B获0.3213综合分,发现约束大语言模型注入的会话数量对Blind A的nDCG有显著影响。
时间序列基础模型对工业监测是否有效?一项感知成本的实证研究
机构 * National Taiwan University of Science and Technology(台湾科技大学)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG
AI总结 本研究通过三类工业监测场景对比评估时间序列基础模型与轻量基线的性能及成本,发现TSFMs并非拟合轻量模型的默认替代,而是任务依赖的部署选项。
Comments Accepted for poster presentation at CIF26 (2026), Poster P01013. 7 pages, 2 figures
当AI撰写时,谁会被引用?语言模型间的引用单一文化证据
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 该研究发现,即使引用真实,当前语言模型仍会产生引用单一文化,需改变其共享偏好图而非仅均衡检索或混合厂商。
校准的分诊,而非自主:医学视觉-语言模型的置信度估计
机构 * Michigan State University(密歇根州立大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL
AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。
基于模拟的科学预训练:喷注基础模型训练目标研究
机构 * Department of Physics, University of Toronto and Vector Institute(物理系,多伦多大学和向量研究所) ; NERSC, Lawrence Berkeley National Laboratory(NERSC,伯克利国家实验室) ; Institut für Experimentalphysik, Universität Hamburg(实验物理研究所,汉堡大学) ; Nagoya University, Kobayashi-Maskawa Institute(名古屋大学,小林昭夫研究所) ; Department of Particle Physics and Astrophysics, Stanford University(粒子物理与天体物理系,斯坦福大学) ; Fundamental Physics Directorate, SLAC National Accelerator Laboratory(基础物理局,SLAC国家加速器实验室)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG
AI总结 本文系统比较了高能物理中基础模型的预训练方法,发现纯分类预训练在标签充足时最优,结合自监督掩码粒子建模在低标签场景下表现突出,而流匹配生成预训练对下游分类无益,但必须包含在预训练目标中才能提升生成任务。
CoM³eT:通过联邦多维上下文集成实现医学图像分析的基础模型
机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学MEVIS研究所) ; RWTH Aachen University(亚琛工业大学) ; Medizinische Hochschule Hannover(汉诺威医学院) ; Massachusetts General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院) ; Charité – Universitätsmedizin Berlin(柏林夏里特医学院) ; Freie Universität Berlin(柏林自由大学) ; Humboldt-Universität zu Berlin(柏林洪堡大学)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG
AI总结 CoM³eT是统一多专科、多预测类型及多维度输入的医学视觉基础模型,在公开竞赛中表现优于同类模型,仅微调少量参数即可适配多临床任务,联邦学习场景下性能接近聚合数据训练。
基于大语言模型智能体的列间约束发现的约束感知合成表格数据生成
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 领域大模型 :LLM(title);prompting(abstract);分类 cs.AI
AI总结 该研究针对合成表格数据易违反领域约束的问题,提出基于大语言模型智能体的列间约束发现的统一工作流,结合后处理器修复输出,提升了约束合规性与下游效用。
FZ-VLM:用于肺结节特征表征与临床决策的两阶段Florence-Zephyr视觉语言模型框架
机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) ; Holland Bloorview Kids Rehabilitation Hospital(霍兰德布鲁尔维尤儿童康复医院) ; Guelph General Hospital(圭尔夫综合医院) ; Ontario Veterinary College, University of Guelph(圭尔夫大学安大略兽医学院)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 本研究提出首个两阶段视觉语言模型框架FZ-VLM,通过微调Florence-2与Zephyr-7B模型,实现肺CT中肺结节的结构化特征表征与临床决策,性能优于GPT-4基线及人类基线。
用于高频微超声前列腺分割的医学视觉基础模型的零样本适配
机构 * Newcastle University(纽卡斯尔大学)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG
AI总结 本研究提出首个针对高频微超声前列腺分割的零样本流程,基于预训练的MedSAM模型,结合CLAHE、二值膨胀与傅里叶平滑优化,在测试集上显著降低边界误差,分割效果接近非专家水平且无需额外数据。
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI
Comments 43 pages, 7 main Figures, 8 Extended Data Figures
Journal ref npj Precision Oncology 10, 109 (2026)
波兰医学视觉问答:视觉语言模型未充分利用视觉证据
机构 * ARAAI Poland(波兰ARAAI) ; NASK National Research Institute(NASK国家研究院) ; Poznań University of Medical Sciences(波兹南医科大学) ; T. Marciniak Lower Silesian Specialist Hospital(T.马尔奇尼亚克下西里西亚专科医院) ; Adam Mickiewicz University(亚当·密茨凯维奇大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 该研究构建了波兰医学VQA基准,评估多类视觉语言模型,发现模型未充分利用视觉证据,仅从文本或答案选项即可达到高于随机水平的准确率,仅GPT-5.6在部分子集上超人类表现。
预测熵连接校准与改写敏感性在医疗视觉-语言模型中
机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)
专题命中 领域大模型 :language model(title,abstract);分类 cs.LG
AI总结 本文研究医疗视觉语言模型在部署中的校准和改写敏感性问题,通过预测熵方法发现决策边界接近性是共同原因,并展示单一熵阈值能有效识别不可靠和改写敏感的预测。
TemMed-Bench:评估视觉语言模型的时序医学图像推理能力
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL
AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。
GeoPhysAdapter:用于基于视觉基础模型的跨域滑坡制图的尺度匹配地球物理适配方法
机构 * Institute of Space and Earth Information Science, The Chinese University of Hong Kong(香港中文大学太空与地球信息科学研究所) ; Department of Geography and Resource Management, The Chinese University of Hong Kong(香港中文大学地理与资源管理学系) ; Urban Governance and Design Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计学域) ; Department of Geography, National University of Singapore(新加坡国立大学地理学系)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI
AI总结 针对跨域滑坡制图中视觉基础模型的误报问题,提出GeoPhysAdapter方法,在像素和候选滑坡体决策单元结合地球物理约束适配,在PILD数据集上大幅降低了假阳性误差。
胸部X光医学视觉语言模型审计:估算跨机构参考一致性
机构 * University College Dublin(都柏林大学学院) ; School of Computer Science, University College Dublin(都柏林大学学院计算机科学学院) ; The Third Affiliated Hospital of Southern Medical University(南方医科大学第三附属医院) ; Dublin City University(都柏林城市大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.LG
AI总结 该研究通过评估三个生成式视觉语言模型在胸部X光数据上的表现,估算跨机构参考一致性,发现无法推荐默认估算器,且参考一致性需按站点和接口重新评估。
Comments 10 pages, 3 figures, 3 tables
具备知识意识的视觉-语言基础模型用于胎儿超声解读
机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)
专题命中 领域大模型 :foundation model(title);language model(abstract);分类 cs.AI
AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。
Comments KDD 2026
CENTILE:一种由其驱动的决策评估的遥测基础模型
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG
AI总结 提出的\textbf{\textsc{Centile}}是首个经重放评估可改善HPC调度与网络配置决策的预训练遥测基础模型,可降低HPC回填平均有界减速约77%、违规率减半。
基于语言模型的高风险决策:来自急诊分诊的见解
机构 * Microsoft(微软) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 本研究以急诊分诊为案例,将语言模型的高风险决策置于概率决策框架内,发现语言模型可根据效用调整建议,强调高风险场景下需将其作为概率决策系统评估。
Comments 29 pages
Gaokerena:一个小型波斯语医疗语言模型家族
机构 * University of Isfahan(伊斯法罕大学) ; University of Tehran(德黑兰大学) ; University of Windsor(温莎大学) ; Alzahra University(阿勒扎哈拉大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL
AI总结 针对波斯语医疗语言模型研究不足的问题,该研究推出Gaokerena家族,包含Gaokerena-V和Gaokerena-R两款模型,在医疗问答基准上取得性能提升,还配备不确定性头,为本地化数字医疗提供基础但仍需完善。
Comments 29 pages, 9 figures
3D CT 基础模型与无监督适应用于头颈癌复发预测的实证研究
机构 * University of Lille(里尔大学) ; Academic Department of Radiation Oncology, Centre Oscar Lambret(奥斯卡·兰布雷特中心放射肿瘤学学术部) ; Junia(朱尼亚学院) ; Centrale Lille(里尔中央理工学院) ; IMT Nord Europe, Institut Mines-Télécom(北欧电信学院、矿业电信学院)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI
AI总结 该研究通过两个含 3644 名患者的公开数据集,实证评估 3D CT 基础模型用于头颈癌复发预测的泛化能力,发现其跨场景泛化困难,影像与临床数据结合的预后方法最准确。
Comments Accepted at AIiH 2026
视觉-语言模型在医学影像疾病分类中的交叉公平性
机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据分析与可视化实验室,计算机科学学院) ; Sydney School of Public Health(悉尼公共卫生学院) ; School of Computing(计算学院)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 本文提出CMAC-MMD框架,通过标准化交叉亚组的诊断确定性,减少医学影像疾病分类中的交叉偏见,提升诊断准确性和公平性。
专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI
Comments Response to Renault, Bergeaud, and Bosquet
缓解临床分布偏移下医学视觉-语言模型的类别尾部覆盖不足问题
机构 * Indian Institute of Technology Indore(印度理工学院印多雷分校)
专题命中 领域大模型 :language model(title,abstract);分类 cs.LG
AI总结 本文针对临床分布偏移下医学VLMs的类别尾部覆盖不足问题,提出CALCoDe方法,在多个偏移场景和骨干网络上实现了所有设置下边际和最差类别覆盖度均达0.95的最优表现。
Comments 26 pages; supplementary material included