arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-25 至 2025-12-25 共收录 113 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 16 篇

2512.20647 2025-12-25 cs.AI 90%

Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning

推理中继:评估大型语言模型在数学推理中的稳定性与可替换性

Leo Lu, Jonathan Zhang, Sean Chua, Spencer Kim, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Binghamton University(宾夕法尼亚州立大学布林茅尔分校) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Algoverse

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究探讨大型语言模型在数学推理中的稳定性与可替换性,通过评估不同模型间推理链的延续性,揭示推理过程的可靠性和一致性。

Comments NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21120 2025-12-25 cs.CL cs.IR 89%

ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models

ClarifyMT-Bench: 会话大语言模型多轮澄清的基准测试与改进

Sichun Luo, Yi Huang, Mukai Li, Shichang Meng, Fengyuan Liu, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(中移动巨泰研宄院) CityUHK(城市大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 ClarifyMT-Bench通过多轮对话基准测试和ClarifyAgent代理方法,解决LLM在多轮对话中澄清不足的问题,提升在模糊情境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 89%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21238 2025-12-25 cs.SE cs.CR cs.LG 88%

Assessing the Software Security Comprehension of Large Language Models

评估大语言模型的软件安全理解能力

Mohammed Latif Siddiq, Natalie Sekerak, Antonio Karam, Maria Leal, Arvin Islam-Gomes, Joanna C. S. Santos

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究评估了五种大语言模型在软件安全方面的认知能力,发现其在低阶任务表现良好,但在高阶任务如推理和系统设计上存在显著不足,并识别出51种常见误解模式。

Comments Submitted to Empirical Software Engineering (EMSE) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20954 2025-12-25 cs.CL cs.AI 88%

Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models

反射预训练使生物序列模型实现token级自我修正

Xiang Zhang, Jiaqi Wei, Yuejin Yang, Zijie Qiu, Yuhan Chen, Zhiqiang Gao, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Wanli Ouyang, Chenyu You, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Stony Brook University(石溪大学)

专题命中 推理与问题求解 :pretraining(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00617 2025-12-25 cs.CL cs.AI 86%

ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization

ART:自适应响应调节框架——基于多智能体竞赛的LLM响应优化方法

Omer Jauhar Khan

机构 * Department of Computer Science(计算机科学系) National University of Computer and Emerging Sciences (FAST-NUCES)(计算机与新兴科学国立大学(FAST-NUCES))

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ART通过多智能体竞赛机制优化LLM响应,提升准确性和一致性,实现8.4%的质量提升和R²超过0.96的收敛效果。

Comments 14 pages, 11 figures, 5 tables. IEEE conference-style paper with appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20789 2025-12-25 eess.SY cs.AI cs.SY 85%

X-GridAgent: An LLM-Powered Agentic AI System for Assisting Power Grid Analysis

X-GridAgent: 一种基于大语言模型的代理AI系统,用于协助电力 grid 分析

Yihan, Wen, Xin Chen

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 X-GridAgent是一种基于大语言模型的代理AI系统,通过自然语言查询实现电力系统分析的自动化,结合提示优化和混合检索增强生成算法,提升电网分析的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20664 2025-12-25 cs.AI cs.LO 85%

Eidoku: A Neuro-Symbolic Verification Gate for LLM Reasoning via Structural Constraint Satisfaction

Eidoku:一种通过结构约束满足的神经符号验证门用于LLM推理

Shinobu Miya

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Eidoku通过结构约束满足方法有效检测LLM推理中的结构不一致幻觉,提供神经符号验证机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21250 2025-12-25 cs.CR cs.MA 78%

CoTDeceptor:Adversarial Code Obfuscation Against CoT-Enhanced LLM Code Agents

CoTDeceptor:对抗增强CoT的LLM代码代理的对抗性代码混淆

Haoyang Li, Mingjin Li, Jinxin Zuo, Siqi Li, Xiao Li, Hao Wu, Yueming Lu, Xiaochuan He

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 CoTDeceptor通过构建多阶段混淆策略链,有效对抗增强CoT的LLM检测器,实现对14个漏洞类别的绕过。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14582 2025-12-25 cs.CL 77%

Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning

剪枝能否提升推理?基于能力对齐的Long-Cot压缩以获得更好的推理

Shangziqi Zhao, Jiahao Yuan, Jinyang Wu, Zhenglin Wang, Guisong Yang, Usman Naseem

机构 * XJTU(西安交通大学) ECNU(华东师范大学) THU(清华大学) SEU(上海师范大学) USST(上海师范大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.CL

AI总结 本文提出Prune-on-Logic框架,通过结构感知剪枝提升Long-CoT推理效率,发现验证剪枝在保持准确性的同时减少令牌使用,揭示剪枝与模型容量对齐的重要性。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20812 2025-12-25 cs.CL 70%

Semantic Deception: When Reasoning Models Can't Compute an Addition

语义欺骗:当推理模型无法计算加法时

Nathaniël de Leeuw, Marceau Nahon, Mathis Reymond, Raja Chatila, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) CNRS(法国国家科学研究中心) Sorbonne University(索邦大学) Paris Cité University(巴黎城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现LLMs在面对语义欺骗时表现不佳,揭示其在符号操作上的局限性及对表面语义的依赖。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 70%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20934 2025-12-25 cs.CV cs.AI cs.CL cs.MA 62%

Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning

归纳式视觉编程:从经验中演化工具库以进行空间推理

Shengguang Wu, Xiaohan Wang, Yuhui Zhang, Hao Zhu, Serena Yeung-Levy

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过从经验中归纳学习工具库,TVP在空间推理任务中实现了更高效的工具发现和重用,优于现有方法。

Comments Project Website: https://transductive-visualprogram.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20135 2025-12-25 cs.AI 57%

MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization

MolAct:一种用于分子编辑和性质优化的代理强化学习框架

Zhuo Yang, Yeyun Chen, Jiaqing Xie, Ben Gao, Shuaike Shen, Wanhao Liu, Liujia Yang, Beilun Wang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 MolAct框架通过代理强化学习方法,实现了分子编辑和性质优化的多步骤、工具增强过程,提升了分子设计的可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 50%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02622 2025-12-25 cs.CV 50%

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 19 篇

2507.01020 2025-12-25 cs.CR cs.LG 92%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:多轮对抗性提示生成用于大型语言模型的多轮 Jailbreaking 攻击

Aashray Reddy, Andrew Zagula, Nicholas Saban

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

AI总结 AutoAdv 提出了一种自动化多轮对抗性提示生成方法,通过策略性重写和优化配置,实现对大型语言模型的安全机制的高效攻击,揭示了其在有害内容生成上的高成功率。

Comments We encountered issues with the paper being hosted under my personal account, so we republished it under a different account associated with a university email, which makes updates and management easier. As a result, this version is a duplicate of arXiv:2511.02376

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21010 2025-12-25 cs.LG cs.AI cs.PF 86%

LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics

LLM瑞士轮:通过竞争瑞士系统动态聚合多基准性能

Jiashuo Liu, Jiayun Wu, Chunjie Wu, Jingkai Liu, Zaiyuan Wang, Huan Zhou, Wenhao Huang, Hongseok Namkoong

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CSD框架,通过竞争瑞士系统动态聚合多基准性能,提升LLM评估的准确性和风险意识。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21236 2025-12-25 cs.CR cs.AI cs.SE 85%

Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking

为LLM突破限制而探索句子配对:恶意代码生成的测试框架

Yifan Huang, Xiaojun Jia, Wenbo Guo, Yuqiang Sun, Yihao Huang, Chong Wang, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21127 2025-12-25 cs.AI 85%

A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care

对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估

Oliver Normand, Esther Borsi, Mitch Fruin, Lauren E Walker, Jamie Heagerty, Chris C. Holmes, Anthony J Avery, Iain E Buchan, Harry Coppock

机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) Downing Street(唐宁街10号) Department of Statistics, University of Oxford(统计系,牛津大学) Ellison Institute of Technology(埃利森技术研究所) Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) The UK AI Security Institute(英国人工智能安全研究所) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11822 2025-12-25 cs.AI 85%

Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations

超越共识:在LLM评估中缓解顺从偏差

Suryaansh Jain, Umair Z. Ahmed, Shubham Sahai, Ben Leong

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于回归的框架,通过少量人工标注数据建模验证者偏差,有效缓解LLM评估中的顺从偏差问题,并在代码反馈任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20630 2025-12-25 cs.AI 83%

MicroProbe: Efficient Reliability Assessment for Foundation Models with Minimal Data

MicroProbe: 用极少数据高效评估基础模型的可靠性

Aayam Bansal, Ishaan Gangwani

机构 * Aayam Bansal(未知) Ishaan Gangwani(未知)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 MicroProbe通过仅使用100个精心选择的示例,高效评估基础模型可靠性,比随机采样方法提升23.5%的综合分数,显著降低评估成本并保持高覆盖率。

Comments ICML NewInML

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21126 2025-12-25 cs.CV cs.DB 82%

MarineEval: Assessing the Marine Intelligence of Vision-Language Models

MarineEval: 评估视觉-语言模型的海洋智能

YuK-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 MarineEval首次构建大规模海洋VLM数据集和基准,评估现有VLM在回答海洋领域问题上的能力与局限性。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20948 2025-12-25 cs.CL cs.SD 79%

Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study

基于基础模型的神经精神障碍评估:一项涵盖全生命周期、多模态和多语言的研究

Zhongren Dong, Haotian Guo, Weixiang Xu, Huan Zhao, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) Ministry of Education Key Laboratory of Fusion Computing of Supercomputing and Artificial Intelligence, Hunan University(湖南大学教育部长春计算机与人工智能融合计算重点实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 FEND提出一种多模态框架,利用多语言数据集评估神经精神障碍,揭示多模态融合在不同障碍检测中的性能差异及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21337 2025-12-25 cs.CV 78%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20735 2025-12-25 cs.CV 78%

VL4Gaze: Unleashing Vision-Language Models for Gaze Following

VL4Gaze:释放视觉-语言模型用于追随目光

Shijing Wang, Chaoqun Cui, Yaping Huang, Hyung Jin Chang, Yihua Cheng

机构 * Beijing Jiaotong University(北京交通大学) MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 VL4Gaze通过四个互补任务统一目光理解为VQA问题,系统评估VLMs在目光解读上的表现,揭示了针对性多任务监督对提升VLMs目光理解能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19027 2025-12-25 cs.SE 75%

SESR-Eval: Dataset for Evaluating LLMs in the Title-Abstract Screening of Systematic Reviews

SESR-Eval:用于评估LLM在系统综述标题-摘要筛选中的基准数据集

Aleksi Huotala, Miikka Kuutila, Mika Mäntylä

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SESR-Eval数据集用于评估LLM在系统综述标题-摘要筛选中的性能,结果显示LLM在不同二次研究间表现差异大,目前不推荐自动化筛选。

Comments An updated post-print on the paper published in the Proceedings of the 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM '25). 12 pages (10 + 2 pages for references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18748 2025-12-25 cs.SE cs.AI cs.CL 73%

Code2Doc: A Quality-First Curated Dataset for Code Documentation

Code2Doc: 一种以质量为导向的代码文档定制数据集

Recep Kaan Karaman, Meftun Akarsu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Code2Doc是一个高质量的代码文档生成数据集,通过四阶段定制流程筛选出13,358对高质量函数-文档对,显著提升了代码文档生成模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20938 2025-12-25 cs.HC 67%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20781 2025-12-25 cs.IR 67%

Soft Filtering: Guiding Zero-shot Composed Image Retrieval with Prescriptive and Proscriptive Constraints

软过滤:通过规劝性与禁止性约束指导零样本复合图像检索

Youjin Jung, Seongwoo Cho, Hyun-seok Min, Sungchul Choi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出SoFT方法,通过规劝性和禁止性约束提升零样本复合图像检索的准确性与鲁棒性。

Comments Accepted to AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏