arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2508.04295 2026-01-14 cs.SE cs.AI 57%

EvoC2Rust: A Skeleton-guided Framework for Project-Level C-to-Rust Translation

EvoC2Rust:一个指导骨架的项目级C到Rust翻译框架

Chaofan Wang, Tingrui Yu, Beijun Shen, Jie Wang, Dong Chen, Wenrui Zhang, Yuling Shi, Chen Xie, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 EvoC2Rust通过结合规则和LLM方法,提升项目级C到Rust翻译的准确性和安全性

Comments Accepted by ICSE 2026 SEIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07329 2026-01-13 cs.CL 57%

BayesRAG: Probabilistic Mutual Evidence Corroboration for Multimodal Retrieval-Augmented Generation

BayesRAG: 基于概率互证的多模态检索增强生成

Xuan Li, Yining Wang, Haocai Luo, Shengping Liu, Jerry Liang, Ying Fu, Weihuang, Jun Yu, Junnan Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co.Ltd(Unisound AI技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 BayesRAG通过概率互证机制提升多模态检索增强生成的性能,有效解决异构模态的隔离问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07274 2026-01-13 cs.CL 57%

Towards Comprehensive Semantic Speech Embeddings for Chinese Dialects

面向中文方言的全面语义语音嵌入

Kalvin Chang, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Tencent AI Labs(腾讯AI实验室) Tencent(腾讯)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过仅使用ASR数据训练语音编码器,实现中文方言与普通话的跨方言语义对齐,并在新基准测试中展示了语音到语音检索和ASR性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07004 2026-01-13 cs.CR cs.AI 57%

MemTrust: A Zero-Trust Architecture for Unified AI Memory System

MemTrust:面向统一AI内存系统的零信任架构

Xing Zhou, Dmitrii Ustiugov, Haoxin Shang, Kisson Lin

机构 * Independent Researcher(独立研究者) Supermem AI Inc.(Supermem AI公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 MemTrust提出了一种五层零信任架构,旨在实现AI内存系统的本地等效安全性和高效协作能力,通过TEE保护和跨应用共享协议提升系统可信度。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 57%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14317 2026-01-13 cs.LG 57%

Intervention Efficiency and Perturbation Validation Framework: Capacity-Aware and Robust Clinical Model Selection under the Rashomon Effect

干预效率与扰动验证框架:在拉索莫恩效应下考虑容量的临床模型选择

Yuwen Zhang, Viet Tran, Paul Weng

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出干预效率与扰动验证框架,用于在资源约束下稳健选择临床模型,解决拉索莫恩效应下的模型选择问题。

Comments Accepted to the Workshop on Navigating Model Uncertainty and the Rashomon Effect: From Theory and Tools to Applications and Impact (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08728 2026-01-13 cs.CR cs.AI cs.IR 57%

Securing RAG: A Risk Assessment and Mitigation Framework

保障RAG:风险评估与缓解框架

Lukas Ammann, Sara Ott, Christoph R. Landolt, Marco P. Lehmann

机构 * Eastern Switzerland University of Applied Sciences (OST)(东瑞士应用科学大学(OST)) Cyber-Defence Campus, armasuisse Science and Technology(网络安全校园,armasuisse科技)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种结合RAG特定安全考虑与通用安全指南的框架,以保障RAG系统的安全性和可信度。

Comments 8 pages, 3 figures, Sara Ott and Lukas Ammann contributed equally. This work has been submitted to the IEEE for possible publication

Journal ref 2025 IEEE Swiss Conference on Data Science (SDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06845 2026-01-13 cs.AI 57%

Code Evolution for Control: Synthesizing Policies via LLM-Driven Evolutionary Search

代码进化用于控制:通过LLM驱动的进化搜索合成策略

Ping Guo, Chao Li, Yinglan Feng, Chaoning Zhang

机构 * Shenzhen Yuyi Tech. Co. Ltd.(深圳优衣科技有限公司) City University of Hong Kong(香港城市大学) Shenzhen University(深圳大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出利用LLM驱动的进化搜索生成可解释的控制策略,通过代码进化方法合成可执行代码,提升自主系统控制策略的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06516 2026-01-13 cs.HC cs.LG eess.SP 57%

Pareto-Optimal Model Selection for Low-Cost, Single-Lead EMG Control in Embedded Systems

低成本单通道EMG控制的帕累托最优模型选择

Carl Vincent Ladres Kho

机构 * Minerva University(明维大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种低成本单通道EMG控制的帕累托最优模型选择方法,通过评估多种模型架构,确定随机森林在嵌入式控制中的最优性能。

Comments 15 pages main text, 51 pages total including appendices. 18 figures. Code and dataset available at: https://github.com/CarlKho-Minerva/v2-emg-muscle

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06141 2026-01-13 cs.CY 57%

An LLM -Powered Assessment Retrieval-Augmented Generation (RAG) For Higher Education

基于大语言模型的评估检索增强生成(RAG)系统用于高等教育

Reza Vatankhah Barenji, Nazila Salimi, Sina Khoshgoftar

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本研究提出基于RAG架构的大语言模型驱动评估系统,通过整合评分标准和范文生成高质量反馈,实现大规模、一致的评估反馈,提升学生自主学习能力。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05774 2026-01-13 cs.AI 57%

ConstraintLLM: A Neuro-Symbolic Framework for Industrial-Level Constraint Programming

ConstraintLLM: 一种用于工业级约束编程的神经符号框架

Weichun Shi, Minghao Liu, Wanting Zhang, Langchen Shi, Fuqi Jia, Feifei Ma, Jian Zhang

机构 * Hangzhou Institute for Advanced Study, UCAS, Hangzhou, China(杭州高等研究院,UCAS,杭州,中国) University of Oxford, Oxford, UK(牛津大学,牛津,英国) University of Science and Technology Beijing, Beijing, China(北京科技大学,北京,中国) SKLCS and Key Laboratory of System Software, ISCAS, Beijing, China(SKLCS和系统软件重点实验室,ISCAS,北京,中国) Laboratory of Parallel Software and Computational Science, ISCAS, Beijing, China(并行软件与计算科学实验室,ISCAS,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 ConstraintLLM是一种专为约束编程设计的神经符号框架,通过引入Constraint-Aware Retrieval Module和Tree-of-Thoughts框架,实现了在工业级约束编程基准上的高性能求解。

Comments Accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 15999-16019

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11890 2026-01-13 cs.RO cs.AI 57%

Integrating Symbolic RL Planning into a BDI-based Autonomous UAV Framework: System Integration and SIL Validation

将符号RL规划整合到基于BDI的自主无人机框架中:系统集成与SIL验证

Sangwoo Jeon, Juchul Shin, YeonJe Cho, Gyeong-Tae Kim, Seongwoo Kim

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出AMAD-SRL框架,整合符号RL与BDI方法,通过SIL验证提升无人机任务效率75%。

Comments This submission has been withdrawn by the authors due to institutional and contractual requirements related to security and export-control review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19432 2026-01-12 cs.LG 57%

Advanced Long-term Earth System Forecasting

先进长期地球系统预测

Hao Wu, Yuan Gao, Ruijian Gou, Xian Wu, Chuhan Wu, Huahui Yi, Johannes Brandstetter, Fan Xu, Kun Wang, Penghao Zhao, Hao Jia, Qi Song, Xinliang Liu, Juncai He, Shuhao Cao, Huanshuo Dong, Yanfei Xiang, Fan Zhang, Haixin Wang, Xingjian Shi, Qiufeng Wang, Shuaipeng Li, Ruobing Xie, Feng Tao, Yuxu Lu, Yu Guo, Yuntian Chen, Yuxuan Liang, Qingsong Wen, Wanli Ouyang, Deliang Chen, Niklas Boers, Xiaomeng Huang

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 TritonCast通过专用潜在动态核心和嵌套网格结构,实现长期稳定的地球系统预测,提升大气和海洋预测的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07248 2026-01-12 cs.CL 57%

MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings

MedRiskEval: 医疗风险评估基准,语言模型在医疗领域中的重要性:用户视角的重要性

Jean-Philippe Corbeil, Minseon Kim, Maxime Griot, Sheela Agarwal, Alessandro Sordoni, Francois Beaulieu, Paul Vozila

机构 * Microsoft Healthcare & Life Sciences(微软医疗与生命科学) Microsoft Research Montréal, Canada(微软研究蒙特利尔分校) Université catholique de Louvain, Belgium(列日大学) Mila, Université de Montréal, Canada(蒙特利尔大学Mila)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 MedRiskEval通过引入患者导向的数据集,评估了医疗领域中语言模型的风险,强调用户视角在医疗应用中的重要性。

Comments EACL2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 57%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03986 2026-01-08 cs.CL 57%

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00224 2026-01-08 cs.CL cs.SE 57%

Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback

少说多查:通过语义检查和执行反馈改进LLM助手

Yan Sun, Ming Cai, Stanley Kok

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出Q*和Feedback+两种验证技术,通过语义检查和执行反馈提升LLM助手的输出准确性与可靠性。

Comments WITS 2025 (Workshop on Information Technologies and Systems 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12302 2026-01-08 cs.CV cs.CL cs.RO 57%

From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving

从人类意图到动作预测:意图驱动的端到端自动驾驶

Huan Zheng, Yucheng Zhou, Tianyi Yan, Jiayi Su, Hongjun Chen, Dubing Chen, Xingtai Gui, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研究院有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出意图驱动的端到端自动驾驶框架,通过引入新的评估协议和两种解决方案范式,提升自动驾驶对高层次人类意图的理解和实现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL 57%

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17118 2026-01-08 cs.CL 57%

After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation

检索后,生成前:增强检索增强生成中大型语言模型的可信度

Xinbang Dai, Huikang Hu, Yuncheng Hua, Jiaqi Li, Yongrui Chen, Rihui Jin, Nan Hu, Guilin Qi

机构 * Southeast University(东南大学) University of New South Wales(新南威尔士大学) Noah’s Ark Lab(诺亚实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 BRIDGE框架通过动态确定响应策略,提升检索增强生成中大型语言模型的可信度,实验显示其在准确性上优于基线方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI 57%

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03120 2026-01-07 cs.AI 57%

A framework for assuring the accuracy and fidelity of an AI-enabled Digital Twin of en route UK airspace

一种确保基于AI的英国空域数字孪生准确性和保真的框架

Adam Keane, Nick Pepper, Chris Burr, Amy Hodgkin, Dewi Gould, John Korna, Marc Thomas

机构 * The Alan Turing Institute(阿尔法·图灵研究院) NATS(国家空中交通服务) Queen Mary University London(伦敦女王学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的数字孪生准确性和保真度保证框架,结合可信和伦理保证方法,为研究人员和监管机构提供评估和讨论数字孪生的结构化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09146 2026-01-07 cs.CL 57%

DoPE: Denoising Rotary Position Embedding

DoPE: 去噪旋转位置嵌入

Jing Xiong, Liyang Fan, Hui Shen, Zunhai Su, Min Yang, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安阿伯分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DoPE通过去噪旋转位置嵌入提升大型语言模型在长上下文外推和鲁棒性方面的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02814 2026-01-07 cs.AI 57%

Causal-Enhanced AI Agents for Medical Research Screening

因果增强的医疗研究筛查AI代理

Duc Ngo, Arya Rahgoza

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种因果图增强的AI代理,用于医疗研究筛选,通过显式因果推理和双层知识图谱提升系统综述的准确性和可解释性。

Comments for submission to The 39th Canadian Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02398 2026-01-07 cs.NI cs.AI 57%

AI-Native Integrated Sensing and Communications for Self-Organizing Wireless Networks: Architectures, Learning Paradigms, and System-Level Design

面向自组织无线网络的AI原生集成感知与通信:架构、学习范式与系统级设计

S. Zhang, M. Feizarefi, A. F. Mirzaei

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了AI原生集成感知与通信在自组织无线网络中的架构、学习范式及系统设计,探讨了深度强化学习等方法在动态环境中的应用及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18499 2026-01-06 stat.ML cs.LG 57%

Training More Robust Classification Model via Discriminative Loss and Gaussian Noise Injection

通过判别损失和高斯噪声注入训练更鲁棒的分类模型

Hai-Vy Nguyen, Fabrice Gamboa, Sixin Zhang, Reda Chhaibi, Serge Gratton, Thierry Giaccone

机构 * Ampere Software Technology(Ampere软件技术公司) Institut de mathématiques de Toulouse(图卢兹数学研究所) Institut de Recherche en Informatique de Toulouse(图卢兹计算机研究所) Laboratoire Jean Alexandre Dieudonné, Université Côte d’Azur(坎特伯雷大学Dieudonné实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过判别损失和高斯噪声注入提升模型鲁棒性,增强特征判别性和类别分离性,同时减少损失曲率以提升鲁棒性。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01743 2026-01-06 cs.AI 57%

AI Agent Systems: Architectures, Applications, and Evaluation

AI代理系统:架构、应用与评估

Bin Xu

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01341 2026-01-06 cs.CL 57%

Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems

基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性

Md Abdullah Al Kafi, Raka Moni, Sumit Kumar Banshal

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏