arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-12 至 2026-01-12 共收录 159 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2601.05593 2026-01-12 cs.LG 57%

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning

PaCoRe: 通过并行协调推理学习扩展测试时间计算

Jingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Daxin Jiang, Xiangyu Zhang, Heung-Yeung Shum

机构 * StepFun Tsinghua University(清华大学) Peking University(北京大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05356 2026-01-12 cs.RO cs.AI cs.MA q-bio.QM 57%

PRISM: Protocol Refinement through Intelligent Simulation Modeling

通过智能仿真建模实现协议优化:PRISM

Brian Hsu, Priyanka V Setty, Rory M Butler, Ryan Lewis, Casey Stone, Rebecca Weinberg, Thomas Brettin, Rick Stevens, Ian Foster, Arvind Ramanathan

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 PRISM通过智能仿真建模实现实验协议的自动化设计、验证和执行,结合语言模型代理、数字孪生验证和机器人执行,提供端到端的实验流程解决方案。

Comments 43 pages, 8 figures, submitted to RSC Digital Discovery. Equal contribution: B. Hsu, P.V. Setty, R.M. Butler. Corresponding author: A. Ramanathan

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21329 2026-01-12 cs.CL 57%

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks

你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈

Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 33 篇

2601.05582 2026-01-12 cs.CL 90%

Can large language models interpret unstructured chat data on dynamic group decision-making processes? Evidence on joint destination choice

大型语言模型能否在动态群体决策过程中解释非结构化聊天数据?关于共同目的地选择的证据

Sung-Yoo Lim, Koki Sato, Kiyoshi Takami, Giancarlos Parady, Eui-Jin Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型在解释动态群体决策过程中非结构化聊天数据的能力,通过日本共同用餐活动的数据,评估了LLM在自动标注和捕捉显性与隐性决策因素方面的潜力与局限。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 90%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05570 2026-01-12 cs.AI cs.MA 89%

Crisis-Bench: Benchmarking Strategic Ambiguity and Reputation Management in Large Language Models

Crisis-Bench: 大型语言模型中战略模糊与声誉管理的基准测试

Cooper Lin, Maohao Ran, Yanting Zhang, Zhenglin Wan, Hongwei Fan, Yibo Xu, Yike Guo, Wei Xue, Jun Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港 Baptist 大学) National University of Singapore(新加坡国立大学) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Crisis-Bench通过多智能体POMDP评估LLM在高风险企业危机中的战略模糊与声誉管理能力,揭示模型在信息隐瞒与道德约束间的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05473 2026-01-12 cs.CL cs.HC 89%

Towards Valid Student Simulation with Large Language Models

迈向基于大语言模型的可信学生模拟

Zhihao Yuan, Yunze Xiao, Ming Li, Weihao Xuan, Richard Tong, Mona Diab, Tom Mitchell

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) The University of Tokyo(东京大学) NEOLAF

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于大语言模型的学生模拟框架,通过知识状态规范解决能力悖论问题,强调知识忠实度对教育应用的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05466 2026-01-12 cs.CR cs.AI 89%

Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning

通过强化学习的迭代工具伪装攻击对大型语言模型进行劫持

Zhaoqi Wang, Zijian Zhang, Daqing He, Pengtao Kou, Xin Li, Jiamou Liu, Jincheng An, Yong Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息科学与技术学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science, University of Auckland(计算机科学学院,奥克兰大学) QAX Security Center, Qi-AnXin Technology Group Inc.(QAX安全中心,启安新科技集团) Qi-AnXin Technology Group Inc.(启安新科技集团) Zhongguancun Laboratory(中关村实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出iMIST方法,通过伪装工具调用和强化学习优化,提高对大型语言模型的攻击效果,揭示现有安全机制的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08637 2026-01-12 cs.CL cs.AI cs.LG 89%

An Evaluation on Large Language Model Outputs: Discourse and Memorization

对大型语言模型输出的评估:论述与记忆

Adrian de Wynter, Xun Wang, Alex Sokolov, Qilong Gu, Si-Qing Chen

机构 * Microsoft Corporation(微软公司) University of York(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估了大型语言模型输出的质量,发现记忆内容与输出质量相关,并探讨了减少记忆输出的缓解策略。

Comments Final version at Natural Language Processing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05648 2026-01-12 q-bio.GN cs.AI cs.CL cs.LG 88%

Open World Knowledge Aided Single-Cell Foundation Model with Robust Cross-Modal Cell-Language Pre-training

开放世界知识辅助的单细胞基础模型与鲁棒跨模态细胞-语言预训练

Haoran Wang, Xuanyi Zhang, Shuangsang Fang, Longke Ran, Ziqing Deng, Yong Zhang, Yuxiang Li, Shaoshuai Li

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 OKR-CELL通过开放世界知识和鲁棒跨模态预训练,提升单细胞基础模型在细胞-语言跨模态任务中的表现。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05578 2026-01-12 cs.AI cs.CE 88%

Reinforcement Learning of Large Language Models for Interpretable Credit Card Fraud Detection

基于大语言模型的强化学习在可解释性信用卡欺诈检测中的应用

Cooper Lin, Yanting Zhang, Maohao Ran, Wei Xue, Hongwei Fan, Yibo Xu, Zhenglin Wan, Sirui Han, Yike Guo, Jun Song

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Baptist University(香港 Baptist 大学) Imperial College London(伦敦帝国理工学院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用强化学习后训练轻量级语言模型,以提高信用卡欺诈检测的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05545 2026-01-12 cs.CL 88%

Can Large Language Models Differentiate Harmful from Argumentative Essays? Steps Toward Ethical Essay Scoring

大型语言模型能否区分有害与论辩性文章?迈向道德文章评分的步骤

Hongjin Kim, Jeonghyun Kang, Harksoo Kim

机构 * Konkuk University(韩国康 kuk 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出HED基准,揭示LLMs在识别有害文章方面的能力不足,并强调需开发更注重伦理因素的AES系统。

Comments COLING 2025 accepted paper (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05420 2026-01-12 cs.LG stat.AP stat.ME 85%

Efficient Inference for Noisy LLM-as-a-Judge Evaluation

高效噪声LLM-as-a-Judge评估

Yiqun T Chen, Sizhu Lu, Sijia Li, Moran Guo, Shengyi Li

机构 * Departments of Biostatistics and Computer Science, Johns Hopkins University(生物统计学与计算机科学系,约翰霍普金斯大学) Department of Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校) Department of Biostatistics, University of California, Los Angeles(生物统计学系,加州大学洛杉矶分校) Department of Biostatistics, Johns Hopkins University(生物统计学系,约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种高效方法,通过半参数效率理论统一了测量误差校正和预测驱动推断,以提高LLM-as-a-judge评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17749 2026-01-12 cs.AI 85%

Detection of LLM-Paraphrased Code and Identification of the Responsible LLM Using Coding Style Features

检测 LLM 生成的代码并识别负责的 LLM 使用编码风格特征

Shinwoo Park, Hyundong Jin, Jeong-won Cha, Yo-Sub Han

机构 * Yonsei University(延世大学) Changwon National University(昌原国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过编码风格特征检测 LLM 生成的代码并识别负责的 LLM,改进了检测性能和效率。

Comments In Engineering Applications of Artificial Intelligence, Vol. 162, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05742 2026-01-12 cs.CR cs.AI 83%

The Echo Chamber Multi-Turn LLM Jailbreak

回声室多轮LLM劫持

Ahmad Alobaid, Martí Jordà Roca, Carlos Castillo, Joan Vendrell

机构 * NeuralTrust ICREA and UPF(ICREA和UPF)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Echo Chamber是一种利用逐步升级方法的多轮攻击,旨在绕过聊天机器人的安全防护,通过精心设计的交互链对LLM进行劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07248 2026-01-12 cs.CL 83%

MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings

MedRiskEval: 医疗风险评估基准,语言模型在医疗领域中的重要性:用户视角的重要性

Jean-Philippe Corbeil, Minseon Kim, Maxime Griot, Sheela Agarwal, Alessandro Sordoni, Francois Beaulieu, Paul Vozila

机构 * Microsoft Healthcare & Life Sciences(微软医疗与生命科学) Microsoft Research Montréal, Canada(微软研究蒙特利尔分校) Université catholique de Louvain, Belgium(列日大学) Mila, Université de Montréal, Canada(蒙特利尔大学Mila)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 MedRiskEval通过引入患者导向的数据集,评估了医疗领域中语言模型的风险,强调用户视角在医疗应用中的重要性。

Comments EACL2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05739 2026-01-12 cs.AI cs.CL cs.CR cs.CV 81%

PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility

PII-VisBench: 在可见性连续体上评估视觉语言模型中个人可识别信息安全性

G M Shahariar, Zabir Al Nazi, Md Olid Hasan Bhuiyan, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 PII-VisBench 评估视觉语言模型在可见性连续体上对个人可识别信息安全性的保护,通过4000个探测器分析不同可见性水平下的隐私泄露情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05267 2026-01-12 cs.IR cs.CL cs.LG 81%

Transforming User Defined Criteria into Explainable Indicators with an Integrated LLM AHP System

将用户自定义标准转化为可解释指标的集成LLM AHP系统

Geonwoo Bang, Dongho Kim, Moohong Min

机构 * Sungkyunkwan University(首尔大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种结合LLM与AHP的可解释性评估系统,通过生成特定标准评分和统计权重,提升跨领域文本评估的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05794 2026-01-12 cs.CL cs.LG 79%

Simplify-This: A Comparative Analysis of Prompt-Based and Fine-Tuned LLMs

简化-此:提示基于和微调LLM的比较分析

Eilam Cohen, Itamar Bul, Danielle Inbar, Omri Loewenbach

机构 * Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 Simplify-This通过对比提示法和微调LLM在文本简化任务中的表现,发现微调模型在结构简化上更优,而提示法在语义相似度上表现较好但易复制输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05475 2026-01-12 cs.LG cs.CL 79%

MaxCode: A Max-Reward Reinforcement Learning Framework for Automated Code Optimization

MaxCode: 一种用于自动代码优化的max-奖励强化学习框架

Jiefu Ou, Sapana Chaudhary, Kaj Bostrom, Nathaniel Weir, Shuai Zhang, Huzefa Rangwala, George Karypis

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MaxCode通过max-reward强化学习框架提升代码优化性能,实现20.3%的绝对速度提升和10.1%的相对排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21272 2026-01-12 cs.CV 78%

Co-Training Vision Language Models for Remote Sensing Multi-task Learning

联合训练遥感多任务学习的视觉语言模型

Qingyun Li, Shuran Ma, Junwei Luo, Yi Yu, Yue Zhou, Fengxiang Wang, Xudong Lu, Xiaoxing Wang, Xin He, Yushi Chen, Xue Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) East China Normal University(东华大学) Wuhan University(武汉大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19153 2026-01-12 cs.CR cs.AI cs.SE 77%

LLMs as verification oracles for Solidity

LLMs作为Solidity的验证或者

Massimo Bartoletti, Enrico Lipparini, Livio Pompianu

机构 * University of Cagliari, Italy(卡利亚里大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了使用LLMs评估Solidity合同属性有效性的潜力,通过实证研究展示其在智能合约验证中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05827 2026-01-12 cs.SE 75%

SSR: Safeguarding Staking Rewards by Defining and Detecting Logical Defects in DeFi Staking

SSR: 通过定义和检测DeFi质押中的逻辑缺陷来保障质押奖励

Zewei Lin, Jiachi Chen, Jingwen Zhang, Zexu Wang, Yuming Feng, Weizhe Zhang, Zibin Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SSR通过定义和检测DeFi质押中的逻辑缺陷,提高质押奖励的安全性,检测出22.24%的合同存在缺陷

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05260 2026-01-12 cs.IR cs.AI cs.CL cs.LG 75%

Quantifying Document Impact in RAG-LLMs

量化RAG-LLM中的文档影响

Armin Gerami, Kazem Faghih, Ramani Duraiswami

机构 * Department of Computer Science(计算机科学系) Umiacs University of Maryland(马里兰大学) College Park MD

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出影响评分(IS)用于量化RAG-LLM中单个文档对输出的影响,通过实验验证其有效性,提升系统透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05879 2026-01-12 cs.CL cs.AI cs.CY 73%

Gender Bias in LLMs: Preliminary Evidence from Shared Parenting Scenario in Czech Family Law

LLMs中的性别偏见:来自捷克家庭法共同育儿情境的初步证据

Jakub Harasta, Matej Vasina, Martin Kornel, Tomas Foltynek

机构 * Faculty of Law, Masaryk University(法律学院,马萨里克大学) Faculty of Informatics, Masaryk University(信息学院,马萨里克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过捷克家庭法中的共同育儿情境,初步探讨了LLMs在回应家庭法律问题时的性别偏见现象。

Comments Accepted at AI for Access to Justice, Dispute Resolution, and Data Access (AIDA2J) at Jurix 2025, Torino, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04160 2026-01-12 cs.CL cs.CE q-fin.CP 70%

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准

Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。

Comments 48 pages; 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23385 2026-01-12 cs.SE cs.AI cs.CR cs.HC 70%

Securing the AI Supply Chain: What Can We Learn From Developer-Reported Security Issues and Solutions of AI Projects?

保障人工智能供应链:我们能从AI项目开发人员报告的安全问题和解决方案中获得什么启示?

The Anh Nguyen, Triet Huynh Minh Le, M. Ali Babar

机构 * School of Computer Science Information Technology,\ University Adelaide Australia Information Technology,\ University \&\ Systems Adelaide Australia Information Technology,\ University Information Technology,\ University \&\ Systems

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析开发者报告的安全问题和解决方案,揭示AI供应链中安全问题的细粒度分类及解决挑战,为开发者和研究人员提供实证指导。

Comments Accepted at the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026) - Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05268 2026-01-12 cs.IR 67%

Separating Semantic Expansion from Linear Geometry for PubMed-Scale Vector Search

分离语义扩展与线性几何用于PubMed级向量搜索

Rob Koopman

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出了一种PubMed级向量搜索框架,通过分离语义扩展与线性几何,实现对生物医学文献的高效检索与聚类分析。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05851 2026-01-12 cs.CL cs.AI cs.CV 62%

Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs

Router-Suggest: 动态路由用于视觉 grounded 对话中的多模态自动补全

Sandeep Mishra, Devichand Budagam, Anubhab Mandal, Bishal Santra, Pawan Goyal, Manish Gupta

机构 * IIT Kharagpur(印度IIT卡拉格浦大学) Microsoft(微软公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 Router-Suggest 通过动态路由选择文本模型和 VLMs,提升多模态对话中的自动补全效率和用户满意度。

Comments Accepted to EACL 2026 Industry Track, 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04183 2026-01-12 cs.CL cs.AI 62%

MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions

MAGneT: 协调多智能体生成合成多轮心理健康咨询会话

Aishik Mandal, Tanmoy Chakraborty, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德累斯顿技术大学计算机科学系、普遍知识处理实验室(UKP Lab)、黑森人工智能中心(hessian.AI)) National Research Center for Applied Cybersecurity ATHENE, Germany(应用网络安全国家研究中心ATHENE,德国) Department of Electrical Engineering, Indian Institute of Technology Delhi, India(印度德里印度理工学院电气工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi, India(印度德里印度理工学院人工智能学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 MAGneT通过协调多智能体生成合成多轮心理健康咨询会话,提升咨询质量和评估一致性。

Comments 38 pages, 32 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏