arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-08 至 2025-12-08 共收录 139 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 28 篇

2512.05318 2025-12-08 cs.CL cs.AI cs.LG 80%

To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples

思考还是不思考:过度使用Co-T示例的元训练隐藏成本

Vignesh Kothapalli, Ata Fatahibaarzi, Hamed Firooz, Maziar Sanjabi

机构 * Stanford University(斯坦福大学) LinkedIn AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoT-Recipe方法,通过调节元训练序列中CoT和非CoT示例的比例,提升大型语言模型在新任务上的推理准确性,实验显示在无CoT示例时准确率可提升300%。

Comments 26 pages, 45 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05580 2025-12-08 cs.CL 77%

Structured Reasoning with Tree-of-Thoughts for Bengali Math Word Problems

基于树状思维的结构化推理用于孟加拉语数学应用题

Aurprita Mahmood, Sabrin alam, Neloy kumer Sagor, Md. Abdul Hadi, Md. Sehab Al Islam, Minhajul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Ahsanullah University of Science and Technology(阿沙努尔大学科学与技术学院) Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出基于树状思维的结构化推理方法,用于提升孟加拉语数学应用题的解决效果,通过实验验证ToT在中等至大规模模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15718 2025-12-08 cs.AI 77%

ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset

ToolMind技术报告:一个大规模、推理增强的工具使用数据集

Chen Yang, Ran Le, Yun Xing, Zhenwei An, Zongchao Chen, Wayne Xin Zhao, Yang Song, Tao Zhang

机构 * Nanbeige Lab, BOSS Zhipin(纳米白实验室,BOSS智聘) Gaoling School of Artificial Intelligence, Renmin University of China(甘露人工智能学院,中国人民大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ToolMind是一个大规模、高质量的工具使用数据集,通过合成和增强数据提升LLM代理的推理能力和工具使用性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05760 2025-12-08 cs.AI 70%

Evolutionary System 2 Reasoning: An Empirical Proof

进化系统2推理:一个实证证明

Zeyuan Ma, Wenqi Huang, Guo-Huan Song, Hongshu Guo, Sijie Ma, Zhiguang Cao, Yue-Jiao Gong

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出进化推理优化框架,通过进化策略提升LLM的推理能力,实验证实即使弱模型也能通过简单进化获得强大推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05365 2025-12-08 cs.AI q-bio.QM 70%

MCP-AI: Protocol-Driven Intelligence Framework for Autonomous Reasoning in Healthcare

MCP-AI:面向医疗领域自主推理的协议驱动智能框架

Zag ElSayed, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 俄亥俄州立大学 奥哈伊俄州) Adolescent Psychiatry Cincinnati Children’s Hospital Medical Center Ohio, USA(青少年精神病学 奥克兰儿童医院医疗中心 奥哈伊俄州)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP-AI是一种基于模型上下文协议的医疗自主推理框架,通过整合临床逻辑和安全协作,提升医疗决策的可解释性和适应性。

Comments 6 pages, 4 figures

Journal ref IEEE ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04563 2025-12-08 cs.CV 67%

COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence

COOPER:一种用于空间智能中协作感知与推理的统一模型

Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang, Zhenyu Zhang, Jiawei Sheng, Xiaodong Li, Zhenyang Li, Li Gao, Daiting Shi, Dawei Yin, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 COOPER是一种统一的多模态大语言模型,通过整合深度和分割等辅助模态,提升空间感知与推理能力,实现空间智能的增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18200 2025-12-08 cs.CV 67%

InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity

InfiniBench:用于可定制场景复杂度的无限基准测试

Haoming Wang, Qiyao Xue, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 InfiniBench通过可定制的3D场景生成方法,提升视觉语言模型在复杂空间推理任务中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05542 2025-12-08 cs.LG cs.AI 66%

RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs

RoBoN: 基于路由的在线最佳-n方法用于多LLM测试时间扩展

Jonathan Geuter, Gregor Kornhardt

机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG;language model(comments)

AI总结 RoBoN通过在线路由多LLM生成过程,提高测试时间扩展性能,无需额外训练,有效提升准确率。

Comments 20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05908 2025-12-08 cs.SE cs.AI cs.CL cs.IR 62%

Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures

自然语言摘要通过LLM在微服务架构中多仓库Bug定位

Amirkia Rafiei Oskooei, S. Selcan Yukcu, Mehmet Cevheri Bozoglan, Mehmet S. Aktas

机构 * Yildiz Technical University, Dept. of Computer Eng.(Yildiz技术大学,计算机工程系) Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学,计算机工程系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 利用自然语言摘要和LLM技术,通过多仓库微服务架构实现更高效的Bug定位,显著提升定位准确率和透明度。

Comments Accepted at LLM4Code Workshop, ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05824 2025-12-08 cs.AI cs.CV 57%

Multimodal Oncology Agent for IDH1 Mutation Prediction in Low-Grade Glioma

多模态肿瘤代理用于低级别胶质瘤IDH1突变预测

Hafsa Akebli, Adam Shephard, Vincenzo Della Mea, Nasir Rajpoot

机构 * Department of Mathematics, Computer Science and Physics, University of Udine(乌迪大学数学、计算机科学与物理系) Tissue Image Analytics Centre, Department of Computer Science, University of Warwick(沃里克大学计算机科学系组织图像分析中心) Histofy Ltd(Histofy有限公司)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出多模态肿瘤代理,结合组织学工具和外部生物医学资源,实现低级别胶质瘤IDH1突变的高精度预测。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05809 2025-12-08 cs.CV cs.AI 57%

Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling

通过测试时缩放探查世界模型在空间推理中的有效性

Saurav Jha, M. Jehanzeb Mirza, Wei Lin, Shiqi Yang, Sarath Chandar

机构 * MILA – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Institute for Machine Learning, Johannes Kepler University Linz(林茨约瑟夫·夫兰克大学机器学习研究所) Nankai University(南开大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出ViSA框架,通过可验证的微断言改进世界模型的空间推理能力,但发现当前模型在复杂任务中仍存在信息瓶颈。

Comments Extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05576 2025-12-08 cs.AI 57%

CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning

CureAgent:一种无需训练的执行-分析框架用于临床推理

Ting-Ting Xie, Yixin Zhang

机构 * Cambridge(剑桥)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 CureAgent提出无需训练的执行-分析框架,通过模块化架构和分层集合策略提升临床推理性能,实现CURE-Bench上的最佳表现。

Comments 2nd Place Solution to the CURE-Bench Competition @ NeurIPS 2025. Code available at https://github.com/June01/CureAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05502 2025-12-08 cs.LG 57%

GRASP: Graph Reasoning Agents for Systems Pharmacology with Human-in-the-Loop

GRASP:具有人机交互循环的图推理代理用于系统药理学

Omid Bazgir, Vineeth Manthapuri, Ilia Rattsev, Mohammad Jafarnejad

机构 * Clinical Pharmacology, Genentech(基因泰克临床药理部) Preclinical & Translational PKPD, Genentech Inc.(基因泰克预临床与转化药代动力学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 GRASP通过图推理代理实现系统药理学模型开发的自动化与严谨性,提升生物医学建模的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05122 2025-12-08 cs.AI 57%

Documenting SME Processes with Conversational AI: From Tacit Knowledge to BPMN

用对话式AI记录中小企业流程:从隐性知识到BPMN

Unnikrishnan Radhakrishnan

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的对话助手,通过访谈式对话将中小企业隐性知识转化为BPMN图表,实现流程文档化,降低文档化门槛,提升运营透明度。

Comments Presented at 2025 International Workshop on Low-Cost Digital Solutions for Industrial Automation (LODISA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16567 2025-12-08 cs.CV cs.AI 57%

V-CECE: Visual Counterfactual Explanations via Conceptual Edits

V-CECE:通过概念编辑生成视觉反事实解释

Nikolaos Spanos, Maria Lymperaiou, Giorgos Filandrianos, Konstantinos Thomas, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(国家技术大学雅典)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 V-CECE通过概念编辑生成反事实解释,无需训练即可产生人类水平的可解释性结果。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV 50%

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05398 2025-12-08 cs.CV 50%

The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos

动态先验:为随意动态视频理解3D结构

Zhuoyuan Wu, Xurui Yang, Jiahui Huang, Yue Wang, Jun Gao

机构 * PKU(北京大学) NVIDIA(英伟达) USC(南加州大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出动态先验模型,利用Vision-Language Models和SAM2实现无需任务特定训练的动态物体识别,提升结构3D理解的准确性和鲁棒性。

Comments Code is available at https://github.com/wuzy2115/DYNAPO

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 31 篇

2512.05339 2025-12-08 cs.LG 90%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03589 2025-12-08 cs.AI cs.CL cs.HC 90%

Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models

利用大语言模型进行文本中过程知识图谱提取的人类评估

Valentina Anita Carriero, Antonia Azzini, Ilaria Baroni, Mario Scrocca, Irene Celino

机构 * Princeton University(普林斯顿大学) Springer Heidelberg(斯普林格海德堡) ABC Institute(ABC研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型和提示工程方法,从文本中提取过程知识并构建知识图谱,通过用户研究评估其质量和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 89%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05537 2025-12-08 cs.CL 87%

Automated Identification of Incidentalomas Requiring Follow-Up: A Multi-Anatomy Evaluation of LLM-Based and Supervised Approaches

自动识别需要随访的偶发瘤:基于LLM和监督方法的多解剖评估

Namu Park, Farzad Ahmed, Zhaoyi Sun, Kevin Lybarger, Ethan Breinhorst, Julie Hu, Ozlem Uzuner, Martin Gunn, Meliha Yetisgen

机构 * Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, WA, USA(生物医学信息学与医学教育系,华盛顿大学,西雅图,华盛顿州,美国) Department of Information Sciences and Technology, George Mason University, Fairfax, VA, USA(信息科学与技术系,乔治·马歇尔大学,弗吉尼亚州,美国) Department of Radiology, Te Whatu Ora Health New Zealand, Te Toka Tumai Auckland, Auckland, New Zealand(放射学系,新西兰Te Whatu Ora健康机构,奥克兰,新西兰) Department of Radiology, School of Medicine, University of Washington, Seattle, WA, USA(放射学系,医学院,华盛顿大学,西雅图,华盛顿州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种基于LLM和监督方法的多解剖评估,通过结构化病变标记和解剖学上下文提升偶发瘤检测性能,达到与人类专家相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05700 2025-12-08 cs.CL cs.AI 86%

Faithfulness metric fusion: Improving the evaluation of LLM trustworthiness across domains

可信度度量融合:提升跨领域的LLM可信度评估

Ben Malin, Tatiana Kalganova, Nikolaos Boulgouris

机构 * CEDPS Brunel University London London, UK(CEDPS 布伦大学伦敦 英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过融合多种可信度度量,提升LLM在不同领域中的可信度评估能力,并通过同质化数据集验证其有效性。

Comments 9 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05334 2025-12-08 cs.IR cs.AI cs.CL 86%

The Effect of Document Summarization on LLM-Based Relevance Judgments

文档摘要对基于大语言模型的相关性判断的影响

Samaneh Mohtadi, Kevin Roitero, Stefano Mizzaro, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了文档摘要对基于大语言模型的相关性判断可靠性及IR评估的影响,发现摘要判断在稳定性上与完整文档判断相当,但引入了系统性的标签偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11222 2025-12-08 cs.SE cs.AI cs.CL cs.IR 86%

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal

ORFuzz: 测试LLM安全的'另一面' -- 检测过度拒绝

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Jiashui Wang, Xinlei Ying, Long Liu, Wenhai Wang

机构 * Zhejiang University(浙江大学) Zhejiang University Huzhou Institute of Industrial Control Technology(浙江大学湖州工业控制技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ORFuzz通过进化测试框架系统检测LLM的过度拒绝现象,生成高覆盖率的测试用例并建立新基准,提升LLM安全性。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05336 2025-12-08 cs.LG 85%

PathFinder: MCTS and LLM Feedback-based Path Selection for Multi-Hop Question Answering

PathFinder: 基于MCTS和LLM反馈的多跳问答路径选择

Durga Prasad Maram, Kalpa Gunaratna, Vijay Srinivasan, Haris Jeelani, Srinivas Chappidi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PATHFINDER通过MCTS和LLM反馈优化多跳问答的路径选择,提升训练数据质量与推理准确性。

Comments 5 PAGES, 3 IMAGES

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06211 2025-12-08 cs.CV 85%

iMotion-LLM: Instruction-Conditioned Trajectory Generation

iMotion-LLM:基于指令的轨迹生成

Abdulwahab Felemban, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen, Abduallah Mohamed, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院) Meta Reality Labs(Meta现实实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 iMotion-LLM通过结合预训练LLM与轨迹预测模块,实现基于文本指令的交互式运动生成,提升自动驾驶中的轨迹生成准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03100 2025-12-08 cs.CR 85%

Towards a standardized methodology and dataset for evaluating LLM-based digital forensic timeline analysis

迈向评估基于LLM的数字取证时间线分析的标准化方法和数据集

Hudan Studiawan, Frank Breitinger, Mark Scanlon

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种标准化方法和数据集,用于评估LLM在数字取证时间线分析中的性能,通过BLEU和ROUGE指标进行定量评估,并展示了实验结果及局限性。

Journal ref Forensic Science International: Digital Investigation 54, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05594 2025-12-08 cs.AI cs.CL 82%

Ontology Learning with LLMs: A Benchmark Study on Axiom Identification

基于LLM的本体学习:关于公理识别的基准研究

Roos M. Bakker, Daan L. Di Scala, Maaike H. T. de Boer, Stephan A. Raaijmakers

机构 * Netherlands Organisation for Applied Scientific Research (TNO)(荷兰应用科学研究院) Leiden University Centre for Linguistics (LUCL)(莱顿大学语言研究中心) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OntoAxiom基准,评估不同LLM在公理识别中的表现,发现AbA方法优于直接方法,且领域和模型大小影响性能。

Comments Submitted to Semantic Web Journal, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05536 2025-12-08 cs.HC 80%

Eye of the Beholder: Towards Measuring Visualization Complexity

眼之所见:迈向可视化复杂度的测量

Johannes Ellemose, Niklas Elmqvist

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用零样本LLM评估可视化复杂度,通过众包研究发现其在预测复杂度和提取特征方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01592 2025-12-08 cs.CL cs.AI 80%

AURA: A Diagnostic Framework for Tracking User Satisfaction of Interactive Planning Agents

AURA:一个用于跟踪交互式规划代理用户满意度的诊断框架

Takyoung Kim, Janvijay Singh, Shuhaib Mehri, Emre Can Acikgoz, Sagnik Mukherjee, Nimet Beyza Bozdag, Sumuk Shashidhar, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AURA提出一个诊断框架,用于跟踪交互式规划代理的用户满意度,通过评估代理行为阶段和中间行为来提升用户体验。

Comments NeurIPS 2025 MTI-LLM Workshop. Full version is under review

详情

展开后加载摘要…

URL PDF HTML 收藏