arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8649 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1226 篇

2603.11277 2026-03-16 cs.AI 70%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 70%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 70%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04663 2026-03-10 cs.LG cs.AI cs.CE 70%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06604 2026-03-10 cs.LG cs.CL 70%

Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

知何时错误:将置信度与正确性对齐以用于LLM错误检测

Xie Xiaohu, Liu Xiaohu, Yao Benjamin

机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06424 2026-03-09 cs.CL 70%

From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring

从提示到偏好优化:基于LLM的自动作文评分方法比较研究

Minh Hoang Nguyen, Vu Hoang Pham, Xuan Thanh Huynh, Phuc Hong Mai, Vinh The Nguyen, Quang Nhut Huynh, Huy Tien Nguyen, Tung Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文比较了基于LLM的自动作文评分方法,发现结合k-SFT和RAG的配置在F1分数上表现最佳,为英语作为第二语言的自动评分提供了新的研究方向。

Comments 19 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04756 2026-03-09 cs.AI cs.CE cs.SE 70%

MOOSEnger -- a Domain-Specific AI Agent for the MOOSE Ecosystem

MOOSEnger -- 一个针对MOOSE生态系统的领域特定AI代理

Mengnan Li, Jason Miller, Zachary Prince, Alexander Lindsay, Cody Permann

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 MOOSEnger 是一个专为MOOSE生态系统的AI代理,通过检索增强生成和领域特定工具提升多物理场仿真效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04417 2026-03-06 cs.CL 70%

Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge

相同输入,不同评分:多模型研究LLM裁判的一致性

Fiona Lau

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究探讨了LLM在不同模型、温度设置下对相同输入评分的一致性问题,发现模型间评分差异显著,温度影响稳定性,需引入混合评估策略以确保可靠应用。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01554 2026-03-03 cs.AI 70%

S5-HES Agent: Society 5.0-driven Agentic Framework to Democratize Smart Home Environment Simulation

S5-HES代理:面向社会5.0的代理框架,以民主化智能家庭环境模拟

Akila Siriweera, Janani Rangila, Keitaro Naruse, Incheon Paik, Isuru Jayanada

机构 * The University of Aizu(立命馆大学) The KD University(KD大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 S5-HES代理通过自主AI编排,实现无需编程的智能家庭模拟,满足社会5.0的多样化研究需求。

Comments 12 pages, 9 figures, and Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00958 2026-03-03 cs.CL 70%

S-VoCAL: A Dataset and Evaluation Framework for Inferring Speaking Voice Character Attributes in Literature

S-VoCAL:用于推断文学作品中说话声音特征属性的数据集和评估框架

Abigail Berthe-Pardo, Gaspard Michel, Elena V. Epure, Christophe Cerisara

机构 * LORIA Deezer Research Idiap Research Institute

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 S-VoCAL通过引入首个专门评估声音相关虚构角色属性推断的数据集和框架,展示了RAG流程在推断年龄和性别等属性上的有效性,但在出身和身体健康等属性上存在挑战。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14433 2026-03-03 cs.CY cs.AI cs.CR cs.HC 70%

PRISM: A Personalized, Rapid, and Immersive Skill Mastery framework for personalizing experiential learning through Generative AI

PRISM:一种个性化、快速且沉浸式的技能掌握框架,通过生成式AI实现体验式学习个性化

Yu-Zheng Lin, Karan Patel, Ahmed Hussain J Alhamadah, Bono Po-Jen Shih, Matthew William Redondo, David Rafael Vidal Corona, Banafsheh Saber Latibari, Jesus Pacheco, Soheil Salehi, Pratik Satam

机构 * Department of Electrical and Computer Engineering, University of Arizona(电气与计算机工程系,亚利桑那大学) Department of Systems and Industrial Engineering, University of Arizona(系统与工业工程系,亚利桑那大学) Department of Industrial Engineering, University of Sonora(工业工程系,索诺拉大学) Leonhard Center for Enhancement of Engineering Education, The Pennsylvania State University(工程教育增强中心,宾夕法尼亚州立大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 PRISM框架利用生成式AI和数字孪生技术,通过情感分析和RAG实现个性化、快速且沉浸式的技能学习,提升教育效率和适应性。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 70%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.AI

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15860 2026-02-19 cs.CL 70%

Reranker Optimization via Geodesic Distances on k-NN Manifolds

通过k-NN流形上的测地距离实现重排序优化

Wen G. Gong

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Maniscope通过k-NN流形上的测地距离优化重排序,实现比基线方法更高的精度和更低的延迟,适用于实时RAG部署。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13868 2026-02-17 cs.NI cs.IR 70%

Agentic Assistant for 6G: Turn-based Conversations for AI-RAN Hierarchical Co-Management

6G代理助手:基于回合的对话用于AI-RAN分层协同管理

Udhaya Srinivasan, Weisi Guo

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

AI总结 本文提出了一种基于回合的对话助手,用于AI-RAN的分层协同管理,通过三层架构实现高效网络管理和降低运营成本。

Comments submitted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10017 2026-02-11 cs.CL 70%

SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation

SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估

Homaira Huda Shomee, Rochana Chaturvedi, Yangxinyu Xie, Tanwi Mallick

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04982 2026-02-10 cs.CL 70%

BioACE: An Automated Framework for Biomedical Answer and Citation Evaluations

BioACE: 一种用于生物医学答案和引用评估的自动化框架

Deepak Gupta, Davis Bartels, Dina Demner-Fushman

机构 * Division of Intramural Research(院内研究部) National Library of Medicine(国家医学图书馆)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BioACE提出了一种自动化框架,用于评估生物医学答案和引用的质量,通过多方面指标和实验分析,提供最佳的评估方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04693 2026-02-05 cs.CL cs.CY 70%

LinGO: A Linguistic Graph Optimization Framework with LLMs for Interpreting Intents of Online Uncivil Discourse

LinGO:一种结合大语言模型的语言图优化框架,用于解释在线不文明言论的意图

Yuan Zhang, Thales Bertaglia

机构 * University of Zurich(苏黎世大学) Utrecht University(乌特雷赫大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 LinGO通过多步骤语言组件优化,提升大语言模型对在线不文明言论意图的识别与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 70%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 70%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16033 2026-01-29 cs.HC cs.AI 70%

Helping Johnny Make Sense of Privacy Policies with LLMs

帮助约翰尼理解隐私政策的LLMs

Vincent Freiberger, Arthur Fleig, Erik Buchmann

机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Leipzig University(可扩展数据分析与人工智能中心(ScaDS.AI)德累斯顿/莱比锡,莱比锡大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 PRISMe通过结合LLM的政策评估与交互式界面,帮助用户更有效地理解和参与隐私政策,同时揭示了设计和技术上的挑战。

Comments 21 pages, 3 figures, 3 tables, ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19899 2026-01-28 cs.CL 70%

Evaluation of Oncotimia: An LLM based system for supporting tumour boards

对Oncotimia的评估:一种基于LLM的系统,用于支持肿瘤板

Luis Lorenzo, Marcos Montana-Mendez, Sergio Figueiras, Miguel Boubeta, Cristobal Bernardo-Castineira

机构 * Innovation Department, Bahía Software SLU(Bahía Software SLU创新部)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Oncotimia通过LLM自动完成肺癌肿瘤板表单,提高了效率并减少了文档负担。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01509 2026-01-28 cs.CL 70%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18880 2026-01-27 cs.AI 70%

Challenges for Generative AI in Legal Reasoning

生成AI在法律推理中的挑战

Eljas Linna, Tuula Linna

机构 * Tampere University(塔尔库大学) University of Helsinki(赫尔辛基大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文探讨了生成AI在法律推理中的关键挑战,分析了现有AI技术在处理法律问题中的局限性,并提出分阶段采用技术以提升法律推理的严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15153 2026-01-22 cs.AI 70%

How to Build AI Agents by Augmenting LLMs with Codified Human Expert Domain Knowledge? A Software Engineering Framework

如何通过将编码化的人类专家领域知识与大语言模型结合来构建AI代理?一种软件工程框架

Choro Ulan uulu, Mikhail Kulyabin, Iris Fuhrmann, Jan Joosten, Nuno Miguel Martins Pacheco, Filippos Petridis, Rebecca Johnson, Jan Bosch, Helena Holmström Olsson

机构 * Department of Computer Science and Engineering, Chalmers University of Technology(计算机科学与工程系,查尔姆斯理工大学) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Department of Computer Science and Media Technology, Malmö University(计算机科学与媒体技术系,马尔默大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出一种软件工程框架,通过增强大语言模型与编码化专家知识,构建能自主生成可视化内容的AI代理,实现非专家在专业领域内达到专家水平的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12276 2026-01-22 cs.HC cs.AI 70%

Predictive Prototyping: Evaluating Design Concepts with ChatGPT

预测性原型:通过ChatGPT评估设计概念

Hilsann Yong, Bradley A. Camburn

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文通过GPT-RAG方法评估设计概念,证明其在预测成本、性能和可用性方面优于人类估计,并展示了由该方法指导的原型在性能上的优势。

Comments 22 pages, 15 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 70%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12921 2026-01-21 cs.CL 70%

Injecting Knowledge from Social Science Journals to Improve Indonesian Cultural Understanding by LLMs

通过社会科学期刊注入知识以提升LLMs对印度尼西亚文化的理解

Adimulya Kartiyasa, Bao Gia Cao, Boyang Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究通过构建IndoSoSci数据集,利用检索增强生成方法将印度尼西亚文化知识注入LLMs,提升其对印度尼西亚文化的理解能力,并在基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11286 2026-01-19 cs.AI 70%

XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making

XChoice: 用于基于LLM的受限选择决策中的可解释性AI-人类对齐评估

Weihong Qi, Fan Huang, Rasika Muralidharan, Jisun An, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 XChoice是一种用于评估基于LLM的受限选择决策中AI-人类对齐的可解释框架,通过机制模型恢复可解释参数以诊断不一致并支持改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07790 2026-01-13 cs.AI 70%

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

在系统日志严重性分类上评估小型语言模型和小型推理语言模型

Yahya Masri, Emily Ma, Zifu Wang, Joseph Rogers, Chaowei Yang

机构 * George Mason University(乔治·马歇尔大学) Harvard University(哈佛大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本研究评估了小型语言模型和小型推理语言模型在系统日志严重性分类上的性能,发现架构设计、训练目标和上下文整合能力共同影响模型表现。

Comments 28 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 70%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏