arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2512.06660 2026-02-27 cs.CR cs.AI 91%

Towards Small Language Models for Security Query Generation in SOC Workflows

面向SOC工作流中安全查询生成的小语言模型

Saleha Muzammil, Rahul Reddy, Vishal Kamalakrishnan, Hadi Ahmadi, Wajih Ul Hassan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 本文提出一个三调节框架,利用小型语言模型实现高效、低成本的安全查询生成,实验表明其在语法和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17287 2026-02-27 cs.AI 89%

LLM4AD: A Platform for Algorithm Design with Large Language Model

LLM4AD:基于大语言模型的算法设计平台

Fei Liu, Rui Zhang, Zhuoliang Xie, Rui Sun, Kai Li, Qinglong Hu, Ping Guo, Xi Lin, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LLM4AD是一个基于大语言模型的统一平台,旨在通过模块化框架支持多领域算法设计,并提供全面的资源和评估工具促进相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22500 2026-02-27 cs.AI 89%

Mapping the Landscape of Artificial Intelligence in Life Cycle Assessment Using Large Language Models

利用大语言模型映射人工智能在生命周期评估中的景观

Anastasija Mensikova, Donna M. Rizzo, Kathryn Hinkelman

机构 * University of Vermont(佛蒙特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究利用大语言模型对人工智能在生命周期评估中的应用进行综合分析,揭示了AI技术在LCA中的发展趋势和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06939 2026-02-27 cs.SE 89%

FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks

FeedbackEval: 一个用于评估大型语言模型在反馈驱动的代码修复任务中的基准

Dekun Dai, MingWei Liu, Anji Li, Jialun Cao, Yanlin Wang, Chong Wang, Xin Peng, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 FeedbackEval通过系统性基准评估LLMs在反馈驱动的代码修复任务中的表现,揭示了不同反馈类型和提示结构对修复效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22790 2026-02-27 cs.CL cs.AI 88%

Natural Language Declarative Prompting (NLD-P): A Modular Governance Method for Prompt Design Under Model Drift

自然语言声明式提示(NLD-P):一种模块化治理方法,用于在模型漂移下的提示设计

Hyunwoo Kim, Hanau Yi, Jaehee Bae, Yumin Kim

机构 * ddai Inc.(ddai公司)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出NLD-P作为模块化治理方法,通过自然语言声明式提示解决模型漂移下的提示设计问题,提供可解释的控制框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22523 2026-02-27 cs.AI cs.CL q-bio.NC 88%

Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents

认知模型和AI算法为设计语言代理提供模板

Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Zuckerman Mind Brain Behavior Institute(祖克曼心智大脑行为研究所) Department of Psychiatry, Columbia University(哥伦比亚大学精神医学系) Neuroscience Institute(神经科学研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) Department of Psychology, Princeton University(普林斯顿大学心理学系)

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用认知模型和AI算法设计语言代理的模板,旨在开发更有效且可解释的语言代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 85%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08254 2026-02-27 cs.SE cs.AI 85%

Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy

迈向利用语义熵自动验证语言模型合成测试用例

Hamed Taherkhani, Jiho Shin, Muhammad Ammar Tahir, Md Rakib Hossain Misu, Vineet Sunil Gattani, Hadi Hemmati

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出VALTEST框架,利用语义熵自动验证LLM生成的测试用例,提升测试有效性与代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22299 2026-02-27 cs.MM cs.AI cs.CL cs.LG 85%

Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads

解码钩子:一种多模态大语言模型框架用于分析视频广告的钩子阶段

Kunpeng Zhang, Poppy Zhang, Shawndra Hill, Amel Awadelkarim

机构 * University of Marland, College Park(马里兰大学 College Park分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出一种多模态大语言模型框架,用于分析视频广告的钩子阶段,通过多策略采样和主题提炼提升广告初期效果分析的准确性与实用性。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08491 2026-02-27 cs.CL 83%

A Third Paradigm for LLM Evaluation: Dialogue Game-Based Evaluation using clembench

大语言模型评估的第三种范式:基于对话游戏的评估方法clembench

David Schlangen, Sherzod Hakimov, Chalamalasetti Kranti, Jonathan Jordan, Philipp Sadler

机构 * Computational Linguistics, University of Potsdam(计算语言学,波恩大学) DFKI (German Research Center for AI)(德意志人工智能研究中心)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 clembench提出了一种基于对话游戏的评估方法,结合了传统评估方法的优点,提供可控、可重复的多轮交互测试,用于大语言模型的评估。

Comments All code required to run the benchmark, as well as extensive documentation, is available at https://github.com/clembench/clembench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22661 2026-02-27 cs.CL cs.AI cs.LG 82%

dLLM: Simple Diffusion Language Modeling

dLLM:简单的扩散语言建模

Zhanhui Zhou, Lingjie Chen, Hanghang Tong, Dawn Song

机构 * UC Berkeley(伯克利大学) UIUC(伊利诺伊大学香槟分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 dLLM提供了一个统一的开源框架,用于标准化和灵活扩展扩散语言建模的核心组件,同时提供可重现的食谱以加速小型DLMs的研究与开发。

Comments Code available at: https://github.com/ZHZisZZ/dllm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25726 2026-02-27 cs.CL cs.AI 81%

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

工具十项全能:评估语言代理在多样化、真实和长周期任务执行中的基准测试

Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 工具十项全能提出了一种新的语言代理基准测试,通过多样化的真实任务和工具评估代理在复杂长周期任务中的表现。

Comments ICLR 2026, Website: https://toolathlon.xyz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22678 2026-02-27 cs.CV cs.AI 79%

ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport

ViCLIP-OT:首个面向越南语图像-文本检索的视觉-语言基础模型,结合最优传输

Quoc-Khang Tran, Minh-Thien Nguyen, Nguyen-Khang Pham

机构 * Can Tho University(金兰大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ViCLIP-OT通过整合CLIP对比学习与SIGROT损失,提升越南语图像-文本检索性能,实现域内和零样本设置下的显著改进。

Comments Preprint submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22246 2026-02-27 cs.CR cs.LG 79%

Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models

自净化缓解多模态扩散语言模型中的后门

Guangnian Wan, Qi Li, Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 DiSP通过在推理过程中选择性屏蔽视觉标记,有效去除多模态扩散语言模型中的后门,无需额外模型或干净数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19680 2026-02-27 cs.HC cs.AI 79%

PolicyPad: Collaborative Prototyping of LLM Policies

PolicyPad: LLM策略协同原型设计

K. J. Kevin Feng, Tzu-Sheng Kuo, Quan Ze Chen, Inyoung Cheong, Kenneth Holstein, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 PolicyPad通过结合用户体验原型设计方法,为LLM策略协作设计提供交互式支持,提升政策制定的协作效率与反馈质量。

Comments CHI 2026 paper. Supplementary materials: https://docs.google.com/document/d/1jBmKXusoWmCHfwpmNhSTJtbwZ5fwVWLNppKeqqd_-pY/edit?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08781 2026-02-27 cs.AI cs.CL 79%

Evaluating the Evaluator: Measuring LLMs' Adherence to Task Evaluation Instructions

评估评估者:衡量LLMs对任务评估指令的遵守情况

Bhuvanashree Murugadoss, Christian Poelitz, Ian Drosos, Vu Le, Nick McKenna, Carina Suzana Negreanu, Chris Parnin, Advait Sarkar

专题命中 评测与基准 :LLM(abstract);RLHF(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在任务评估中的表现,发现提示对评估结果影响有限,困惑度有时比提示更符合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16800 2026-02-27 cs.CR cs.AI cs.LG 79%

Large-scale online deanonymization with LLMs

大规模在线去匿名化与LLMs

Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini, Florian Tramèr

机构 * MATS ETH Zurich(苏黎世联邦理工学院) Anthropic

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 利用LLMs实现大规模在线去匿名化,通过提取身份特征、语义嵌入搜索和推理验证,显著提升召回率和精度,挑战现有隐私保护机制。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22764 2026-02-27 cs.SE 78%

Evaluating and Improving Automated Repository-Level Rust Issue Resolution with LLM-based Agents

评估和改进基于LLM代理的仓库级Rust问题解决

Jiahong Xiang, Wenxiao He, Xihua Wang, Hongliang Tian, Yuqun Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本研究提出RUSTFORGER,通过集成自动化测试环境与动态跟踪策略,有效提升Rust问题解决效率,解决率达28.6%。

Comments Accepted to the 48th International Conference on Software Engineering (ICSE 2026)

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE '26), April 12--18, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23199 2026-02-27 cs.AI 77%

SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation

SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准

Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang

机构 * Software College, Northeastern University(东北大学软件学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) University of California, Irvine(加州大学 Irvine 分校) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 SC-Arena通过知识增强评估框架,为单细胞生物学中的LLM提供统一且可解释的评估方法,提升生物正确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23062 2026-02-27 cs.CL 77%

Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department

迈向自动填写病例报告表:一项关于意大利急诊科数据的案例研究

Gabriela Anna Kaczmarek, Pietro Ferrazzi, Lorenzo Porta, Vicky Rubini, Bernardo Magnini

机构 * Italian Emergency Department(意大利急诊部门)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一项基于意大利急诊科数据的案例研究,展示如何利用大型语言模型自动填写病例报告表,并揭示了模型偏见问题。

Journal ref Published at 11th Language & Technology Conference: Human Language Technologies as a Challenge for Computer Science, Linguistics and Low Resourced Languages, 2025, Poznań, Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03772 2026-02-27 cs.LG stat.ML 77%

Skewed Score: A statistical framework to assess autograders

偏斜评分:一个评估自动评分器的统计框架

Magda Dubois, Harry Coppock, Mario Giulianelli, Timo Flesch, Lennart Luettgau, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于贝叶斯广义线性模型的统计框架,用于评估自动评分器的可靠性与偏见,提升LLM评估的稳健性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12150 2026-02-27 cs.AI cs.CL cs.LG 76%

GPT-4o Lacks Core Features of Theory of Mind

GPT-4o 缺乏理论思维的核心特征

John Muchovej, Amanda Royka, Shane Lee, Julian Jara-Ettinger

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 研究发现,尽管LLMs在简单ToM任务中表现良好,但其在逻辑等价任务中表现不佳,表明其缺乏一致的理论思维能力。

Comments Submitted to CogSci 2025; see more at https://jmuchovej.com/projects/llm-tom. Note: "abstractness" is the second feature we test for, but due to arXiv's abstract requirements, the text has been altered

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22374 2026-02-27 cs.HC 75%

VoiceAlign: A Shimming Layer for Enhancing the Usability of Legacy Voice User Interface Systems

VoiceAlign:一种增强传统语音用户界面系统可用性的 shim 层

Md Ehtesham-Ul-Haque, Syed Masum Billah

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract)

AI总结 VoiceAlign 通过适应性 shim 层提升传统语音用户界面系统的可用性,减少命令失败并降低用户认知负担。

Comments Accepted at IUI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22697 2026-02-27 cs.CL cs.AI 73%

Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue

强化现实服务代理:在任务导向对话中平衡效用与成本

Ning Gao, Wei Zhang, Yuqin Dai, Ling Shi, Ziyin Wang, Yujie Wang, Wei He, Jinpeng Wang, Chaozheng Wang

机构 * Ning Gao Wei Zhang Yuqin Dai Ling Shi Ziyin Wang Yujie Wang Wei He Jinpeng Wang Chaozheng Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 InteractCS-RL通过多粒度强化学习框架,在任务导向对话中平衡效用与成本,通过用户驱动策略和成本感知优化提升代理性能。

Comments 35 pages, 8 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00564 2026-02-27 cs.AI cs.CL 73%

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

揭示推理过程:一种评估大语言模型结构性数学推理的过程感知基准

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReasoningMath-Plus基准,通过过程感知评估方法揭示大语言模型在结构性数学推理中的不足,引入HCRS评分函数和过程奖励模型,发现仅答案指标可能高估推理能力。

Comments 8 pages, and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19060 2026-02-27 cs.CV cs.AI cs.CL 73%

PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions

PoSh:利用场景图引导LLM-as-a-Judge进行详细图像描述

Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina Elster Pantalony, Mohit Bansal, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The National Gallery of Art(国家艺术馆) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PoSh通过利用场景图引导LLM-as-a-Judge,提供了一种更准确的详细图像描述评估方法,并展示了其在新数据集DOCENT中的优越表现。

Comments Accepted at ICLR 2026. 26 pages, 9 figures. Metric/benchmark available at https://github.com/amith-ananthram/posh

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22219 2026-02-27 cs.IR cs.AI cs.CL 73%

Comparative Analysis of Neural Retriever-Reranker Pipelines for Retrieval-Augmented Generation over Knowledge Graphs in E-commerce Applications

电商应用场景下知识图谱检索增强生成中神经检索-排序流水线的比较分析

Teri Rumble, Zbyněk Gazdík, Javad Zarrin, Jagdeep Ahluwalia

机构 * Abertay University(阿伯泰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究电商场景下知识图谱检索增强生成中神经检索-排序流水线的设计与比较,通过实验验证了优化配置在提升检索性能上的有效性。

Comments This manuscript is under review at the Springer journal Knowledge and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24796 2026-02-27 cs.LO cs.AI cs.FL cs.LG math.CT 73%

LeanCat: A Benchmark Suite for Formal Category Theory in Lean (Part I: 1-Categories)

LeanCat:Lean中的形式范畴论基准测试套件(第一部分:1-范畴)

Rongge Xu, Hui Dai, Yiming Fu, Jiedong Jiang, Tianjiao Nie, Junkai Wang, Holiverse Yang, Zhi-Hao Zhang

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学尤洋数学科学中心) Iluvatar CoreX Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖研究学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications (BIMSA)(燕琦湖北京应用数学研究所(BIMSA))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LeanCat通过100个形式化范畴论任务测试模型的抽象能力,揭示了现有模型在组合泛化上的不足,提出LeanBridge通过迭代优化提升性能至24%。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23300 2026-02-27 cs.CL eess.AS 70%

A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations

一种用于对话中多模态情绪识别的专家混合模型

Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

机构 * LEAP Lab, Department of Electrical Engineering(LEAP实验室,电气工程系) Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MiSTER-E通过专家混合框架提升对话中多模态情绪识别的准确率,实现跨模态一致性与融合。

Comments Accepted to Elsevier Computer Speech and Language. 30 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23184 2026-02-27 cs.CL 70%

MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG Conversations

MTRAG-UN:多轮检索增强生成对话中开放挑战的基准

Sara Rosenthal, Yannis Katsis, Vraj Shah, Lihong He, Lucian Popa, Marina Danilevsky

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MTRAG-UN是一个用于评估多轮检索增强生成对话中开放挑战的基准,包含666个任务和2800多轮对话,揭示了检索和生成模型在处理无答案、无描述等问题时的不足。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏