arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32335 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32335 篇

2605.05725 2026-05-08 cs.AI 87%

Detecting Time Series Anomalies Like an Expert: A Multi-Agent LLM Framework with Specialized Analyzers

像专家一样检测时间序列异常:一种多智能体LLM框架与专用分析器

Hyeongwon Kang, Jeongseob Kim, Jinwoo Park, Pilsung Kang

机构 * Department of Industrial and Management Engineering(工业与管理工程系) Korea University(韩国大学) Department of Industrial Engineering(工业工程系) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAGE框架,通过四个专用分析器检测单变量时间序列的异常,结合数值工具和可视化生成证据,提升异常检测的可靠性与实用性。

Comments Preprint. 9 pages main text, 29 pages total, 8 figures, 9 tables, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG 87%

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01582 2026-05-05 cs.IR cs.AI 87%

KG-First, LLM-Fallback: A Hybrid Microservice for Grounded Skill Search and Explanation

基于知识图谱与大语言模型的混合微服务:面向 grounded skill search 和解释的 hybrid 方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * UTC(UTC大学) LPNHE(LPNHE研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 SkillGraph-Service 微服务,通过统一权威能力框架资源构建知识图谱,结合符号严谨与子符号灵活,实现教育者查询中的词汇不匹配处理,并利用大语言模型进行约束排序和受众感知解释,实验证明其在多语言数据集上具有高检索效果和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01449 2026-05-05 cs.CR cs.AI 87%

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

VisInject:破坏≠注入——对视觉-语言模型中通用对抗攻击的双维度评估

Pang Liu, Yingjie Lao

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文通过双维度评估揭示视觉-语言模型中通用对抗攻击的脆弱性,发现攻击成功与精确注入存在显著差异,揭示了模型在微小扰动下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20965 2026-05-01 q-fin.TR cs.AI cs.MA q-fin.CP q-fin.ST 87%

Learning to Aggregate Zero-Shot LLM Agents for Corporate Disclosure Classification

学习聚合零样本大语言模型代理以进行企业披露分类

Kemal Kirtac

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过聚合零样本大语言模型输出提升企业披露分类性能,发现监督聚合优于零样本投票,尤其在混合信号披露中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27421 2026-05-01 cs.IR cs.CL 87%

A Reproducibility Study of LLM-Based Query Reformulation

基于大语言模型的查询改写可重复性研究

Amin Bigdeli, Radin Hamidi Rad, Hai Son Le, Mert Incesu, Negar Arabzadeh, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) Mila – Quebec AI Institute(魁北克AI研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of Toronto(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文在统一框架下系统评估了十种代表性大语言模型查询改写方法,发现检索范式对改写效果有显著影响,且大模型并不总能提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22971 2026-04-28 cs.CY cs.AI cs.MA 87%

Peer Identity Bias in Multi-Agent LLM Evaluation: An Empirical Study Using the TRUST Democratic Discourse Analysis Pipeline

多智能体大语言模型评估中的同伴身份偏差:使用TRUST民主话语分析流水线的实证研究

Juergen Dietrich

机构 * TRUST Project(TRUST项目)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过TRUST民主话语分析流水线评估多智能体大语言模型的同伴身份偏差,发现单一通道匿名化几乎无偏差,而完整流水线匿名化揭示了同质化集合体放大身份驱动的阿谀行为,异质化生产配置则相反。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22273 2026-04-27 cs.AI 87%

When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention

当大语言模型自我纠正有助于什么?一种控制论马尔可夫诊断和先验证干预

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文通过控制论马尔可夫模型分析自我纠正的条件,发现近零误差阈值决定其有效性,并通过实验验证先验证提示能有效减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19645 2026-04-22 cs.CL 87%

The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text

信号即是上限:从开放式调查文本中LLM预测经验评分的测量限制

Andrew Hong, Jason Potteiger, Luis E. Zapata

机构 * Dimension Labs(Dimension实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了提示设计和模型选择对LLM预测经验评分的影响,发现文本本身的语言特征对准确性影响更大,提示工程只能在特定范围内提升性能。

Comments 42 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 87%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17842 2026-04-21 cs.CL 87%

QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks

QuickScope:动态LLM基准测试中验证难题问题

Taylor Lundy, Narun K. Raman, Kevin Leyton-Brown

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出QuickScope方法,通过改进的COUP算法高效识别动态基准测试中的难题问题,减少误报并提升样本效率。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL 87%

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17191 2026-04-21 cs.LG 87%

Do LLM-derived graph priors improve multi-agent coordination?

基于大语言模型的图先验是否能提升多智能体协调?

Nikunj Gupta, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(美国陆军研究办公室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨大语言模型能否通过少量自然语言描述推断出多智能体协调的图先验,以提升动态环境中的协调与适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16337 2026-04-21 cs.IR cs.AI cs.CY 87%

HR-Agents: Using Multiple LLM-based Agents to Improve Q&A about Brazilian Labor Legislation

HR-Agents:利用多个基于大语言模型的代理提高关于巴西劳动立法的问题解答

Abriel K. Moraes, Gabriel S. M. Dias, Vitor L. Fabris, Lucas D. Gessoni, Leonardo R. do Nascimento, Charles S. Oliveira, Vitor G. C. B. de Farias, Fabiana C. Q. de O. Marucci, Matheus H. R. Vicente, Gabriel U. Talasso, Erik Soares, Amparo Munoz, Sildolfo Gomes, Maria L. A. de S. Cruvinel, Leonardo T. dos Santos, Renata De Paris, Wandemberg Gibaut

机构 * Eldorado Institute of Research(埃洛多研究 institute)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用多代理系统提升巴西劳动立法问题解答的准确性与效率,通过整合检索增强生成技术,改进HR专业人员的合规性与操作效率。

Comments Paper presented on: July 2025 Conference: XVII Simpósio Brasileiro de Automação Inteligente (SBAI) At: São João del-Rei

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16318 2026-04-21 cs.IR cs.CL 87%

Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations

诊断基于大语言模型的重排器在冷启动推荐系统中的表现:覆盖、曝光与实际缓解措施

Ekaterina Lemdiasova, Nikita Zmanovskii

机构 * V. A. Trapeznikov ICS RAS Russian Biotechnological University (ROSBIOTECH)(Trapeznikov ICS 俄罗斯科学院俄罗斯生物技术大学) Russian Biotechnological University (ROSBIOTECH)(俄罗斯生物技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Serendipity-2018数据集研究冷启动电影推荐中交叉编码器重排器的表现,发现检索覆盖不足、曝光偏差和评分区分度低三大问题,并提出混合检索策略、候选池优化和评分校准等缓解措施。

Comments 12 pages, 7 figures. Code and data available at https://github.com/nikita-zmanovskiy/cold-start-algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16304 2026-04-21 cs.SE cs.AI cs.HC 87%

Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild

结果-可行动性差距:理解从业者如何在实际中评估大语言模型产品

Willem van der Maden, Malak Sadek, Ziang Xiao, Aske Mottelson, Q. Vera Liao, Jichen Zhu

机构 * HCI \& Design Section IT University of Copenhagen Copenhagen Denmark Centre for Human-Inspired Artificial Intelligence, Cambridge University Cambridge United Kingdom Computer Science Johns Hopkins University Baltimore Maryland United States Engineering University of Michigan Ann Arbor Michigan United States IT University of Copenhagen Centre for Human-Inspired Artificial Intelligence, Cambridge University Johns Hopkins University University of Michigan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨从业者如何评估大语言模型产品,发现'结果-可行动性差距'问题,提出策略帮助从业者从非正式评估转向系统化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15001 2026-04-20 cs.AI 87%

COEVO: Co-Evolutionary Framework for Joint Functional Correctness and PPA Optimization in LLM-Based RTL Generation

COEVO:用于LLM基于RTL生成中功能正确性与PPA优化的联合进化框架

Heng Ping, Peiyu Zhang, Shixuan Li, Wei Yang, Anzhe Cheng, Shukai Duan, Xiaole Zhang, Paul Bogdan

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出COEVO框架,通过联合优化功能正确性与PPA,在单个进化循环中统一两者目标,提升RTL生成效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16761 2026-04-17 cs.CL 87%

Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions

基于扩展调查数据的语言模型微调以预测公众意见分布

Joseph Suh, Erfan Jahanparast, Suhong Moon, Minwoo Kang, Serina Chang

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文通过微调大型语言模型,利用调查数据的结构特性提升对公众意见分布的预测能力,实验显示在多种子群体中模型预测与人类响应的匹配度显著提高,且能泛化到未见过的调查和子群体。

Comments ACL 2025 Long Main (https://aclanthology.org/2025.acl-long.1028/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09152 2026-04-15 cs.AI 87%

PrivacyReasoner: Can LLM Emulate a Human-like Privacy Mind?

PrivacyReasoner: LLM能否模拟出类似人类的隐私思维?

Yiwen Tu, Xuan Liu, Lianhui Qin, Haojian Jin

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出PrivacyReasoner,通过构建基于三个核心理念的代理架构,模拟人类隐私思维,评估结果显示其在预测个人隐私关切和跨领域泛化方面优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12191 2026-04-15 cs.AI 87%

Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities

超越分数:通过细粒度能力进行诊断LLM评估

Xu Zhang, Xudong Gong, Jiacheng Qin, Qiang Wang, JiaQi Liao, Zhe Wang, Dawei Feng, Bo Ding

机构 * College of Computer Science Technology, National University of Defense Technology, Changsha, Hunan, China State Key Laboratory of Complex \& Critical Software Environment, Changsha, Hunan, China National Key Laboratory of Parallel School of Humanities Social Sciences, School of Public Administration, Beihang University, Beijing, China

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于细粒度能力的诊断框架,通过多维项目反应理论估计模型能力,实现对不同任务的精准评估,提升模型改进和任务选择的针对性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG 87%

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05150 2026-03-31 cs.CL 87%

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

希腊MMLU:用于评估希腊语言模型多任务基准的原生来源基准

Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

机构 * LIX, Ecole Polytechnique(巴黎综合理工学院LIX实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) National Technical University of Athens(雅典国家技术大学) University of Ioannina(约阿尼纳大学) University of Peloponnese(伯罗奔尼撒大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 希腊MMLU是一个包含45个学科领域的21805道多选题的希腊多任务评估基准,所有题目均源自希腊学术、专业和政府考试,旨在评估语言模型在希腊语言中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26105 2026-03-30 cs.LG 87%

Are LLM-Enhanced Graph Neural Networks Robust against Poisoning Attacks?

基于大语言模型的图神经网络是否对污染攻击具有鲁棒性?

Yuhang Ma, Jie Wang, Zheng Yan

机构 * State Key Laboratory of Integrated Services Networks, School of Cyber Engineering, Xidian University(西安电子科技大学网络与信息安全学院综合业务网理论及关键技术国家重点实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了大语言模型增强的图神经网络在面对污染攻击时的鲁棒性,通过系统评估框架评估了24种模型,分析了影响鲁棒性的关键因素,并提出了新的攻击方法和防御策略。

Comments To appear at 2026 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI 87%

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 87%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 87%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17094 2026-03-19 cs.CL 87%

Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction

评估LLM模拟的对话在建模不一致和不合作行为中的表现

Ryo Kamoi, Ameya Godbole, Longqi Yang, Rui Zhang, Mengting Wan, Pei Zhou

机构 * Microsoft Corporation(微软公司) Penn State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出CoCoEval框架,通过检测10种不一致和不合作行为评估LLM生成对话与人类对话的差异,发现LLM生成的对话在常规提示下较少出现不一致行为,但通过提示工程难以有效控制,监督微调可能导致过度生成特定行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02224 2026-03-16 cs.CL 87%

From XAI to Stories: A Factorial Study of LLM-Generated Explanation Quality

从XAI到故事:对LLM生成解释质量的因子研究

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) TU Clausthal(Clausthal 技术大学) Hochschule Bielefeld(比勒菲尔德应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过因子研究探讨了预测模型选择、XAI方法、LLM选择和提示策略对LLM生成解释质量的影响,发现LLM选择主导其他因素,且零次提示在成本上具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10467 2026-03-10 cs.AI 87%

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

MERIT反馈促进LLM谈判者更好的协商

Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Amazon AGI(亚马逊人工智能实验室) LG AI Research(LG人工智能研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。

Comments Preprint. Typo corrected, New results added

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06905 2026-03-10 cs.CL 87%

MedInjection-FR: Exploring the Role of Native, Synthetic, and Translated Data in Biomedical Instruction Tuning

MedInjection-FR: 探索原生、合成和翻译数据在生物医学指令微调中的作用

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Benoit Favre, Richard Dufour

专题命中 评测与基准 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MedInjection-FR研究通过结合原生、合成和翻译数据,探索其在生物医学指令微调中的作用,发现原生数据效果最佳,混合数据提供互补优势,合成数据需与原生结合才能提升性能。

Comments Accepted in LREC-2026

详情

展开后加载摘要…

URL PDF HTML 收藏