arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.20707 2026-08-24 cs.IR 新提交 67%

Towards Faithful Simulation of Human Shopping Behavior

面向人类购物行为的忠实模拟

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20697 2026-08-24 cs.DL 新提交 67%

From citation intent to knowledge contribution: Classifying what cited papers actually contribute

从引用意图到知识贡献:对被引论文实际贡献的分类

Zhibang Quan, Zhentao Liang, Ming Ma, Jinyu Wei, Gang Li, Jin Mao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出知识贡献分类体系KCT及双路径融合模型,实现被引论文知识贡献分类,其准确率达85.5%,且在研究评估、学术传播预测中表现优于传统引用意图分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19263 2026-08-21 cs.SE cs.MA 新提交 67%

The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation

评估上下文协议(ECP):一种用于AI智能体评估的便携式契约

Aniket Wattamwar, Manav Anandani, Mrunal Kakirwar

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。

Comments 14 pages, 4 tables, 4 figures, Code available at https://github.com/evaluation-context-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 67%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 67%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19192 2026-08-20 astro-ph.SR 新提交 67%

JW-SSD: A Multimodal Benchmark Dataset for Fine-Grained Sunspot Classification

JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集

Hui Wang, Mingfu Shao, Luyang Li, Jiaben Lin, Liyue Tong, Chen Yang, Zhanji Wei

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17852 2026-08-19 cs.SD cs.MM 新提交 67%

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

UniVerse:针对文化包容性低资源音乐理解的基准测试与增强

Ziya Zhou, Shangda Wu, Shenyang Xu, Yutong Zheng, Dafang Liang, Suin Chung, Danbinaerin Han, Junyan Jiang, Yongyi Zang, Ruibin Yuan, Rongxiu Zhong, Shilei Zhang, Junlan Feng, Jinglei Liu, Haotian Zhou, Zijin Li, Dasaem Jeong, Wei Xue, Yike Guo

机构 * Sogang University(西江大学) KAIST(韩国科学技术院) NYU Shanghai(上海纽约大学) JIUTIAN Research, China Mobile(中国移动九天研究院) The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Central Conservatory of Music(中央音乐学院)

专题命中 评测与基准 :language model(abstract,abstract_cn)

AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。

Comments 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17700 2026-08-19 cs.CV 新提交 67%

Environment-Invariant Subspace Learning for Generalizable Deepfake Detection

面向通用深度伪造检测的环境不变子空间学习

Shenghao Chen, Hao Jia, Chen Li, Chunjie Ma, Zan Gao, Shengyong Chen

机构 * Tianjin University of Technology(天津理工大学) Shandong Artificial Intelligence Institute(山东人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 评测与基准 :foundation model(abstract,abstract_cn)

AI总结 该研究针对深度伪造检测中跨分布泛化瓶颈,提出EISL框架,通过低秩投影解耦特征并设计环境干预模块,在多设置实验中提升了对未见伪造类型和环境变化的鲁棒性。

Comments 12 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 67%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 67%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14757 2026-08-18 eess.IV cs.CV q-bio.QM 新提交 67%

KHiM-Mamba: Injecting Pathology Knowledge into Mamba via Hidden-State Modulation for Whole Slide Image Analysis

KHiM-Mamba:通过隐藏状态调制将病理知识注入Mamba以用于 whole slide image(WSI)分析

Qixiang Zhang, Yi Li, Tianqi Xiang, Haonan Wang, Mengjiao Wei, Bo Xu, Xiaomeng Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究提出KHiM-Mamba架构,通过将病理知识注入Mamba的选择性状态空间机制,解决纯视觉驱动的WSI分析问题,在4类任务的11个公共基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16690 2026-08-18 cs.CV 新提交 67%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 37 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16574 2026-08-18 cs.HC cs.CY 新提交 67%

The User Side of AI Model Lifecycles: Evidence from the Keep4o Movement

AI模型生命周期的用户侧:来自Keep4o运动的证据

Yiwen Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究以Keep4o运动为案例,通过分析X平台6万余条帖子,发现AI模型技术更迭未必是用户侧的有效替换,用户体验应纳入AI模型生命周期管理。

Comments 32 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15595 2026-08-18 cs.SE 新提交 67%

AutoSQL: Extracting SQL Templates from Imperative ORM Code in Large-Scale Repositories

AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板

Junsong Pu, Yichen Li, Zhuangbin Chen, Zhihan Jiang, Zibin Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。

Comments Accepted to ASE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 67%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 67%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14418 2026-08-17 cs.CR 新提交 67%

STINER: Automated Extraction of Strategic Cyber Threat Intelligence from X

STINER:从X平台自动提取战略网络威胁情报

Yasir Ech-Chammakhy, Oussama Azrara, Jaafar Chbili, Anas Motii

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。

Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14315 2026-08-17 cs.SE 新提交 67%

Breaking Models to Test the Judge: A Mutation Testing Approach for Semantic Evaluators of Domain Class Diagrams

破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法

Kevin Delcourt, Meriem Ben Chaaben, Abdelhamid Rouatbi, Luciano Marchezan, Houari Sahraoui

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。

Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14131 2026-08-17 cs.SE 新提交 67%

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows

LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估

Thilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。

Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13783 2026-08-17 cs.CV 新提交 67%

Doomed to Re-Annotate, Forever: The ImageNet Story

注定要反复标注:ImageNet的故事

Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。

Comments 25 pages, 16 figures, 8 tables. Project page: https://vrg.fel.cvut.cz/reimagenet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13583 2026-08-17 cs.HC cs.MA 新提交 67%

Beyond Simplification: DFT-GEN for Fidelity-Preserving Visual Accessibility in Dyslexia-Friendly Educational Texts

超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN

Jiaqian Yu, Chen Jason Zhang, Haoyang Li, Guoqiong Ivanka Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。

Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 67%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 67%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12569 2026-08-14 cs.IR 新提交 67%

Test-Time Optimization of Query Embeddings with Ranking Aware Reward Maximization

基于排名感知奖励最大化的查询嵌入测试时优化

Tianyu Chen, Jiaxing Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出TTT-Embed框架,将排名奖励提炼为轻量学习向量,无需访问模型权重即可优化,在多嵌入模型和MTEB任务上显著提升测试时检索效果,且具备良好泛化性,解决了灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12549 2026-08-14 cs.CV 新提交 67%

StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

StrAD:面向长视频音频描述生成的流式方法与基准

Julian Spravil, Sebastian Houben, Sven Behnke

机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics, University of Bonn(波恩大学机器人中心)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12216 2026-08-13 cs.HC 新提交 67%

"Pharos Night: Crown Pursuit": An AI-Native Deck-Building and Tactical Arena Game Design Based on Multi-Agent Systems

《Pharos Night:皇冠追逐》:一款基于多智能体系统的原生AI卡组构建与战术竞技场游戏设计

Ting-Chen Hsu, Jueyao Liu, Yanzi Zhou, Jiangxu Lin, Haoyu Xu, Yuwen Liu, Yanjia Liu, Bangjing Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究设计了基于多智能体系统的原生AI卡组构建与战术竞技场游戏《Pharos Night:皇冠追逐》,利用大语言模型实现核心功能,小规模试玩显示其能提供有策略性的游戏体验,也暴露出相关挑战,展现了多智能体生成式AI在游戏设计中的潜力。

Comments Accepted to 2026 Annual Symposium on Computer-Human Interaction in Play (CHI Play)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交 67%

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11200 2026-08-12 cs.CL cs.AI cs.LG 新提交 67%

ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls

ConVAWG:面向针对妇女和女孩的暴力场景下可控合成对话生成的检索驱动框架

Chen Lyu, Xingwei Tan, Simon Cullen, Shelley Wilson, Lois Arthurs, Arshad Jhumka, Gabriele Pergola

机构 * University of Sheffield(谢菲尔德大学) Forensic Capability Network(法医能力网络) University of Leeds(利兹大学) University of Warwick(华威大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对VAWG场景建模的空白,提出检索驱动框架ConVAWG,生成符合CPS标准的合成VAWG多轮对话,发布6000余个对话事件,经多类评估验证其质量与领域保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 67%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏