Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
Metis-HOME: 面向多模态推理的混合优化专家混合模型
机构 * Meituan(美团)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 Metis-HOME通过混合优化专家混合模型,提升多模态推理的复杂推理能力和通用能力,解决推理与泛化之间的矛盾。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Metis-HOME: 面向多模态推理的混合优化专家混合模型
机构 * Meituan(美团)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 Metis-HOME通过混合优化专家混合模型,提升多模态推理的复杂推理能力和通用能力,解决推理与泛化之间的矛盾。
Click2Graph: 从单次点击生成交互式全景视频场景图
机构 * UC Santa Barbara(加州大学圣芭芭拉分校)
专题命中 推理与问题求解 :prompting(abstract)
AI总结 Click2Graph通过单次点击实现交互式全景视频场景图生成,结合视觉提示与语义推理,提升视频场景理解的可控性和可解释性。
大型语言模型在论证挖掘中的应用:综述
机构 * University of Manchester(曼彻斯特大学) ; Imperial College London(伦敦帝国学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。
Comments Work draft
基于大语言模型的项目-标准对齐扩展:准确性、限制与解决方案
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究探讨了大语言模型在提升项目-标准对齐效率方面的应用,通过实验发现LLMs在识别不一致项目和筛选候选技能方面表现优异,结合过滤策略可显著减少人工工作量。
基于价值的大型语言模型代理模拟用于信任和人际亲密的相互评估
机构 * The University of Osaka, Graduate School of Engineering Science(大阪大学工学科学研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本研究通过模拟LLM代理,探讨价值相似性对信任和人际亲密的影响,验证了人工社会中价值观对关系建立的作用。
Journal ref Scientific Reports volume 15, Article number: 41653 (2025)
利用大语言模型进行视频理解:综述
机构 * University of Rochester(罗切斯特大学) ; The University of Hong Kong(香港大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。
Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)
向大型语言模型扩展主动测试
机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) ; Department of Statistics, University of Oxford(统计系,牛津大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 本文提出通过上下文学习低成本构建替代模型,实现对大型语言模型的高效主动测试,提升评估准确性并引入误差估计器。
Comments Published at NeurIPS 2025
保障大语言模型:应对偏见、虚假信息和提示攻击
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文探讨了大语言模型在偏见、虚假信息和提示攻击方面的安全问题,分析了偏见缓解策略、内容检测机制及防御措施,强调了对LLM安全领域进一步研究的重要性。
Comments 17 pages, 1 figure
TurnBench-MS: 一个评估大语言模型多轮多步推理能力的基准
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 TurnBench-MS通过互动破码任务评估大语言模型的多轮多步推理能力,揭示当前模型在复杂推理任务中的显著不足。
Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025
Journal ref Findings of the ACL: EMNLP 2025, pp. 19892-19924, 2025
基于多模态检索增强生成的大型语言模型辅助Birt-Hogg-Dube综合征诊断
机构 * School of Computer Science and Technology(计算机科学与技术学院) ; Department of Pulmonary and Critical Care Medicine(呼吸与危重症医学科) ; Center for Diagnosis and Management of Rare Diseases(罕见病诊断与管理中心) ; the First Affiliated Hospital of USTC(USTC第一附属医院) ; Division of Life Sciences and Medicine(生命科学与医学系) ; USTC ; WanNan Medical College(皖南医学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本研究提出BHD-RAG框架,通过整合多模态检索增强生成与领域专业知识,提升Birt-Hogg-Dube综合征的CT影像诊断准确性。
超越关系:基于语义的多模态分析与LLM原生查询优化
机构 * Zhejiang University(浙江大学) ; Aalborg University(奥胡斯大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。
通过评估LLM作为裁判来评估LLM对齐
机构 * Yale University(耶鲁大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。
Comments NeurIPS 2025 Camera Ready
CodeFuse-CommitEval: 向基于提交信息和代码变更不一致检测的LLM能力基准测试迈进
机构 * Ant Group(蚂蚁集团) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; The University of New South Wales(新南威尔士大学)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 CodeFuse-CommitEval是首个用于评估LLM检测提交信息与代码变更不一致能力的基准,通过生成七类不一致消息并验证样本,评估六种开源LLM在不同增强策略下的表现,揭示了不同增强方法对模型性能的影响及不同类型不一致的检测差异。
文本失语量表(TAB):一种针对语言模型中失语样缺陷的临床基准
机构 * Stanford University(斯坦福大学) ; University of California, San Francisco(加州大学旧金山分校) ; Temple University(特拉华大学) ; San Diego State University(圣地亚哥州立大学) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TAB,一种针对语言模型中失语样缺陷的临床基准,通过四个子测试评估语言能力,并采用自动化协议提高评估效率。
Profile-LLM: 动态配置优化以实现LLM中的真实人格表达
机构 * Academia Sinica(中国科学院)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 Profile-LLM通过动态配置优化提升LLM中真实人格表达,通过迭代增强提示和情境评估工具,优化人格表现并探索模型大小与人格建模的关系。
MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准
机构 * ETH Zürich(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; HUG
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。
Comments Accepted to NeurIPS 2025
人工智能代理供应链中行为后门检测的跨LLM泛化
机构 * Arun Chowdary Sanna(独立研究者)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究首次系统探讨了跨LLM行为后门检测的泛化问题,发现模型特定特征导致泛化差距,并提出模型感知检测方法提升检测准确率。
Comments 10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces
大语言模型生成任务中解释的反事实可模拟性
机构 * Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种评估大语言模型生成任务中解释反事实可模拟性的通用框架,发现其在新闻摘要任务中表现良好,但在医疗建议任务中仍有改进空间。
Comments INLG25
利用基础模型进行皮肤鳞状细胞癌组织学分级的PathFMTools
机构 * Dana-Farber Cancer Institute(达纳-法伯癌症研究所) ; Brigham and Women’s Hospital(布里奇沃特医院) ; Harvard Medical School(哈佛医学院)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI
AI总结 本文提出PathFMTools工具,利用基础模型进行皮肤鳞状细胞癌组织学分级,验证了基础模型嵌入训练小型模型的潜力,为临床应用提供高效分析手段。
Comments Proceedings of the 5th Machine Learning for Health (ML4H) Symposium (2025)
HoliSafe: 视觉-语言模型的综合安全性评估与建模
机构 * ETRI ; KAIST AI(韩国科学技术院人工智能研究所) ; University of Seoul(首尔大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 HoliSafe提出了一种模块化框架和视觉守护模块,通过综合安全性数据集提升视觉-语言模型的安全性,展现其在多个基准中的优越表现。
Comments Project page: https://youngwanlee.github.io/holisafe
富文本的范畴大小
机构 * SandboxAQ, Palo Alto, CA 94301, USA(SandboxAQ) ; Department of Mathematics, The Master's University, Santa Clarita, CA 91321, USA(数学系) ; Department of Mathematics, California Institute of Technology, Pasadena, CA 91125, USA(数学系) ; Department of Linguistics, Northwestern University, Evanston, IL 60208, USA(语言学系)
专题命中 评测与基准 :language model(title,abstract);分类 cs.CL
AI总结 本文通过语言模型的概率分布定义文本范畴,并计算其大小函数及同调群,将大小视为分部函数。
Comments 26 pages
Journal ref Theory and Applications of Categories, Vol. 44, 2025, No. 37, pp 1256-1281
构建具有韧性的信息生态系统:大规模的大语言模型生成的说服攻击数据集
机构 * Aptima, Inc.(Aptima公司)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出了一种大规模的大语言模型生成的说服攻击数据集,用于研究和防御机构沟通中的说服策略,以提升信息生态系统的韧性。
LaajMeter:一种用于LaaJ评估的框架
机构 * IBM Research, Israel(IBM以色列研究院)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LaaJMeter是一种用于LaaJ评估的模拟框架,通过生成合成数据来系统分析评估度量标准,帮助验证特定任务的LaaJ质量。
多领域泛化用于全球光伏评估的多模态大语言模型
机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) ; Arizona State University(亚利桑那州立大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。
Comments 5 pages, 7 figures
用于自动化3D PET/CT报告生成的视觉-语言模型
机构 * Institute of Medical Technology and National Biomedical Imaging Center, Peking University(北京大学医学技术研究院和国家生物医学成像中心) ; Peking University People’s Hospital(北京大学人民医院) ; Peking University Third Hospital(北京大学第三医院) ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) ; The Affiliated Hospital of Qingdao University(青岛大学附属医院) ; The First Affiliated Hospital of Henan Medical University(河南医科大学第一附属医院) ; Jiujiang City Key Laboratory of Cell Therapy, Jiu Jiang NO.1 People’s Hospital(九江市细胞治疗重点实验室,九江市第一人民医院)
专题命中 评测与基准 :language model(title);prompting(abstract)
AI总结 本文提出PETRG-3D模型,通过3D双分支框架和风格适应提示,提升PET/CT报告生成的自动化水平,实验显示其在自然语言和临床指标上均优于现有方法。
基于知识图谱构建衡量语义相似度的基准
机构 * University of Cambridge(剑桥大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用知识图谱构建语义相似度基准,通过生成不同领域的语义相似和不相似陈述对,评估多种语义相似度方法的性能,揭示领域和语义变化类型对方法效果的影响。
ShortageSim: 在信息不对称下模拟药品短缺
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 ShortageSim通过模拟信息不对称下的药品短缺情况,提供了一个评估监管干预效果的框架,减少了生产中断的解决延迟,推动了供应链政策研究的发展。
Comments Accepted by AAAI 2026. Oral presentation. 25 pages
基于意图的查询重写案例
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出INQURE系统,通过大型语言模型实现基于意图的查询重写,以解决数据访问限制问题。
Comments Published in the 2nd International Workshop on Data-driven AI (DATAI) 2025
HiCoGen: 通过强化学习在扩散模型中实现层次化组合文本到图像生成
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) ; Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研发有限公司)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 HiCoGen通过强化学习和层次化合成框架提升文本到图像生成的组合性和准确性。
Comments 9 pages
OceanGym: 一个用于水下具身智能体的基准环境
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。
Comments Work in progress