arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2603.12522 2026-03-30 cs.CL cs.AI cs.CY cs.HC 86%

LLM BiasScope: A Real-Time Bias Analysis Platform for Comparative LLM Evaluation

LLM BiasScope:一种用于比较LLM评估的实时偏见分析平台

Himel Ghosh, Nick Elias Werner

机构 * Technical University of Munich(慕尼黑工业大学) Sapienza University of Rome(罗马大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM BiasScope通过实时偏见分析帮助比较不同LLM模型的输出,支持多供应商模型对比,提供统计、可视化和偏见类型分析。

Comments Accepted at EACL 2026 (24-29 March, Morocco)

Journal ref Proceedings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25674 2026-03-27 cs.CL cs.AI cs.CY 86%

Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors

衡量重要性——或者便利性?:基于LLM的评分系统对无关因素的鲁棒性

Cole Walsh, Rodica Ivan

机构 * Acuity Insights Inc.(Acuity Insights公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了基于LLM的评分系统在面对无关因素时的鲁棒性,发现其在处理无意义填充文本、拼写错误等时表现稳健,但对偏离主题的回答惩罚较重,为未来设计更相关的LLM评分系统提供了支持。

Comments Shortened version of this paper accepted to AIED 2026; experiment 3 was omitted from accepted paper due to space restrictions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24943 2026-03-27 cs.AI cs.CL 86%

FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol

FinMCP-Bench:基于模型上下文协议的LLM代理在真实金融工具使用中的基准测试

Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin Zhang, Lifan Guo, Feng Chen, Yong Liu, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云云计算千问点睛团队) YINGMI Wealth Management(盈米财富管理) Soochow University(苏州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinMCP-Bench,用于评估LLM在解决真实金融问题时通过调用金融模型上下文协议的能力,包含613个样本,涵盖10种主要场景和33种子场景,提供真实和合成查询,评估不同任务复杂度下的模型表现。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22386 2026-03-25 cs.AI cs.CL 86%

From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents

从静态模板到动态运行时图:LLM代理工作流优化的综述

Ling Yue, Kushal Raj Bhandari, Ching-Yun Ko, Dhaval Patel, Shuxin Lin, Nianjun Zhou, Jianxi Gao, Pin-Yu Chen, Shaowu Pan

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系) IBM Research(IBM研究院) Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(伦斯勒理工学院机械、航空航天与核工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM代理工作流优化方法,区分静态与动态方法,探讨结构确定时间、优化部分及评估信号,提出结构感知评估视角以提升可比性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27543 2026-03-24 cs.CL cs.AI 86%

DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models

阿拉伯方言MMLU:评估阿拉伯语和多语言模型在阿拉伯方言上的能力

Malik H. Altakrori, Nizar Habash, Abed Alhakim Freihat, Younes Samih, Kirill Chirkunov, Muhammed AbuOdeh, Radu Florian, Teresa Lynn, Preslav Nakov, Alham Fikri Aji

机构 * IBM Research AI(IBM人工智能研究院) New York University Abu Dhabi(纽约大学迪拜分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出阿拉伯方言MMLU基准,通过手动翻译和适应3000个多项选择题答案对至五个主要方言,评估大语言模型在阿拉伯方言上的推理和理解能力,揭示方言泛化中的持续差距。

Comments 9 pages, 10 tables, accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19264 2026-03-23 cs.CL cs.AI 86%

Generative Active Testing: Efficient LLM Evaluation via Proxy Task Adaptation

生成主动测试:通过代理任务适应实现高效的LLM评估

Aashish Anantha Ramakrishnan, Ardavan Saeedi, Hamid Reza Hassanzadeh, Fazlolah Mohaghegh, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Optum AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成主动测试(GAT),通过利用LLM作为代理任务,改进样本选择过程,减少估计误差40%,实现高效且经济的模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11599 2026-03-20 cs.AI cs.CL cs.CY 86%

SynBullying: A Multi LLM Synthetic Conversational Dataset for Cyberbullying Detection

SynBullying:一个多语言模型合成对话数据集用于网络欺凌检测

Arefeh Kazemi, Hamza Qadeer, Joachim Wagner, Hossein Hosseini, Sri Balaaji Natarajan Kalaivendan, Brian Davis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SynBullying通过多语言模型生成对话数据,提供可扩展且伦理安全的网络欺凌检测研究方法,包含多轮对话结构、上下文感知标注和细粒度标签,评估了五个维度并测试了其作为训练数据和增强源的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18074 2026-03-20 cs.LG cs.AI cs.IR stat.AP 86%

Lightweight Adaptation for LLM-based Technical Service Agent: Latent Logic Augmentation and Robust Noise Reduction

轻量级适应用于基于LLM的技术服务代理:潜在逻辑增强与鲁棒噪声消除

Yi Yu, Junzhuo Ma, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Guangquan Hu, Jianfeng Liu, Weiting Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University, Shanghai, China(复旦大学数学科学学院,上海,中国) Shanghai Center for Mathematical Sciences, Fudan University, Shanghai, China(复旦大学上海数学中心,上海,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University, Shanghai, China(脑启发式智能科学技术研究院,复旦大学,上海,中国) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University, Shanghai, China(应用数学中心及上海当代应用数学重点实验室,复旦大学,上海,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出轻量级适应框架,通过潜在逻辑增强和鲁棒噪声消除提升技术服务代理的稳定性和性能,同时采用混合奖励机制降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17683 2026-03-19 cs.AI cs.LG 86%

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

Sensi:一次学一项——基于课程的学习式测试时间学习用于LLM游戏代理

Mohsen Arjmandi

机构 * Independent Researcher (CTO, evolutionID)(独立研究者(CTO, evolutionID))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Sensi通过结构化测试时间学习机制,提升LLM游戏代理在未知环境中的学习效率,其核心方法包括双玩家架构、课程学习系统和数据库作为控制平面,显著提高了样本效率。

Comments Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24384 2026-03-19 cs.CL cs.AI 86%

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

HarmMetric Eval: 对LLM有害性评估的度量和裁判进行基准测试

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Pretraining Team, xAI(预训练团队,xAI) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HarmMetric Eval,用于评估有害性度量和裁判的质量,发现传统参考型指标在细粒度评估中表现优于LLM裁判,改进的裁判通过结合细粒度标准和参考型指标提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16406 2026-03-18 cs.CL cs.AI 86%

Who Benchmarks the Benchmarks? A Case Study of LLM Evaluation in Icelandic

谁评估评估标准?冰岛语LLM评估的案例研究

Finnur Ágúst Ingimundarson, Steinunn Rut Friðriksdóttir, Bjarki Ármannsson, Iris Edda Nowenstein, Steinþór Steingrímsson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了冰岛语LLM评估现状,指出问题并呼吁改进低/中资源语言的评估方法。研究发现未验证的合成或机器翻译数据导致测试样例严重缺陷,影响结果有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL 86%

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22827 2026-03-17 cs.CL cs.LG 86%

TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models

TARAZ:波斯短答案问题基准用于语言模型的文化评估

Reihaneh Iranmanesh, Saeedeh Davoudi, Pasha Abrishamchian, Ophir Frieder, Nazli Goharian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一个评估框架,用于评估大型语言模型在波斯语中的文化能力,通过结合规则基于的形态学归一化和混合语法和语义相似性模块,改进评分一致性。

Comments 12 pages, 6 figures, Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16457 2026-03-17 cs.HC cs.AI cs.CL 86%

Integrating Personality into Digital Humans: A Review of LLM-Driven Approaches for Virtual Reality

将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述

Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Färber, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了利用大语言模型驱动虚拟现实中的数字人类人格塑造方法,探讨了零样本、少样本和微调等技术,并指出计算需求、延迟及多模态交互评估框架缺乏等挑战。

Comments Revised and expanded version of the survey published in Findings of EMNLP 2025. Includes 14 pages and 2 figures

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 9519--9532

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23329 2026-03-17 cs.AI cs.CL cs.CR cs.CY cs.HC 86%

LLM Novice Uplift on Dual-Use, In Silico Biology Tasks

大语言模型在双用途生物任务中的新手提升

Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yury Orlovskiy, Coleman Breen, Bryce Cai, Jasper Götting, Andrew Bo Liu, Samira Nedungadi, Paula Rodriguez, Yannis Yiming He, Mohamed Shaaban, Zifan Wang, Seth Donoughe, Julian Michael

机构 * Scale AI SecureBio University of Oxford(牛津大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型是否能提升新手在生物任务中的表现,通过多模型多基准测试发现LLM显著提升准确性,并指出单用途LLM可能超越辅助新手的表现。

Comments 59 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12094 2026-03-13 cs.HC cs.AI cs.CL cs.CY 86%

Human-Centred LLM Privacy Audits: Findings and Frictions

以人为中心的LLM隐私审计:发现与摩擦

Dimitri Staufer, Kirsten Morehouse, David Hartmann, Bettina Berendt

机构 * TU Berlin(柏林技术大学) Weizenbaum Institute for the Networked Society(网络化社会研究所) Columbia University(哥伦比亚大学) KU Leuven(根特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM隐私审计中的人机交互问题,通过LMP2工具发现模型对个人信息的关联预测准确率高,但用户对隐私保护的需求与模型输出的不确定性存在矛盾,提出了九项摩擦并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16846 2026-03-13 cs.CL cs.AI 86%

ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers

ConCISE: 一种无需参考的LLM生成回答简洁性评估指标

Seyed Mohssen Ghafari, Ronny Kol, Juan C. Quiroz, Nella Luan, Monika Patial, Chanaka Rupasinghe, Herman Wandabwa, Luiz Pizzato

机构 * Commonwealth Bank of Australia(澳大利亚共同银行)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ConCISE指标,用于评估LLM生成回答的简洁性,通过三种压缩比计算和词删除方法,无需参考实现自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09535 2026-03-11 cs.MM cs.AI cs.CL cs.DL 86%

AI Blob! LLM-Driven Recontextualization of Italian Television Archives

AI Blob!:基于大型语言模型的意大利电视档案再上下文化

Roberto Balestri

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AI Blob!利用大型语言模型和语义技术对意大利电视档案进行再上下文化,通过自动语音识别和向量数据库实现动态检索与叙事重构。

Comments Preprint

Journal ref 16th Media Mutations International Conference (pp. 123-133) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07946 2026-03-10 cs.LG cs.AI 86%

ELLMob: Event-Driven Human Mobility Generation with Self-Aligned LLM Framework

ELLMob: 基于自对齐LLM框架的事件驱动人类移动生成

Yusong Wang, Chuang Yang, Jiawei Wang, Xiaohang Xu, Jiayi Xu, Dongyuan Li, Chuan Xiao, Renhe Jiang

机构 * Institute of Science Tokyo(东京科学研究所) The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ELLMob 基于自对齐LLM框架,通过提取习惯模式与事件约束的竞争性理由并迭代对齐,生成既符合习惯又响应事件的轨迹,有效解决大规模社会事件中的移动模式生成问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06874 2026-03-10 cs.AI cs.CL 86%

LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models

LieCraft:一种用于评估语言模型欺骗能力的多智能体框架

Matthew Lyle Olson, Neale Ratzlaff, Musashi Hinck, Tri Nguyen, Vasudev Lal, Joseph Campbell, Simon Stepputtis, Shao-Yen Tseng

机构 * Intel Labs(英特尔实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。

Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04413 2026-03-09 cs.CL cs.AI 86%

Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries

模拟意义,永不再来!引入ICR:一种用于评估LLM文本摘要中意义的象征-解释学度量标准

Natalie Perez, Sreyoshi Bhaduri, Aman Chadha

机构 * University of Hawai‘i(夏威夷大学) Private Corporation(私营公司) Amazon GenAI(亚马逊生成人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICR度量标准,用于评估LLM生成文本摘要中的意义,通过归纳内容分析和反思主题分析,超越词法相似性度量,评估语义准确性和意义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05471 2026-03-06 cs.CL cs.AI 86%

Leveraging LLM Parametric Knowledge for Fact Checking without Retrieval

利用LLM参数知识进行事实核查而不进行检索

Artem Vazhentsev, Maria Marina, Daniil Moskovskiy, Sergey Pletenev, Mikhail Seleznyov, Mikhail Salnikov, Elena Tutubalina, Vasily Konovalov, Irina Nikishina, Alexander Panchenko, Viktor Moskvoretskii

机构 * S-NLP Group(S-NLP小组) AXXX MIRAI MBZUAI EPFL(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出不依赖检索的事实核查任务,通过利用LLM内部表示提升事实验证性能,展示INTRA方法在多语言和长文本生成场景中的优越表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03790 2026-03-05 cs.CL cs.AI 86%

T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning

T2S-Bench 及 Structure-of-Thought:基准测试与提示的综合文本到结构推理

Qinsi Wang, Hancheng Ye, Jinhee Kim, Jinghan Ke, Yifei Wang, Martin Kuo, Zishan Shao, Dongting Li, Yueqian Lin, Ting Jiang, Chiyue Wei, Qi Qian, Wei Wen, Helen Li, Yiran Chen

机构 * duke(杜克大学) meta

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Structure-of-Thought和T2S-Bench,通过显式文本结构化提升模型文本处理性能,实验表明其在多个任务中显著提升准确率。

Comments Dataset and Code have been released at https://t2s-bench.github.io/T2S-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03321 2026-03-05 cs.CL cs.AI 86%

DIALEVAL: Automated Type-Theoretic Evaluation of LLM Instruction Following

DIALEVAL: 大型语言模型指令遵循的自动类型理论评估

Nardine Basta, Dali Kaafar

机构 * Macquarie University, Australia(麦考瑞大学,澳大利亚)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DIALEVAL通过双LLM代理实现复杂指令的自动类型理论评估,提升对话场景下的评估准确性与人类判断一致性。

Comments PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03319 2026-03-05 cs.CL cs.AI 86%

Automated Concept Discovery for LLM-as-a-Judge Preference Analysis

用于LLM-as-a-Judge偏好分析的自动化概念发现

James Wedgwood, Chhavi Yadav, Virginia Smith

机构 * Department of Computer Science(计算机科学系) Carnegie-Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自动化方法,用于发现LLM判断偏好的驱动因素,通过比较不同概念提取方法,验证了LLM在敏感请求上的偏好,并揭示了新的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01260 2026-03-03 cs.LG cs.AI 86%

MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers

MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台

Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu

机构 * School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院) School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院) Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOSAIC是一个开源平台,通过统一接口和跨范式评估框架,支持在相同环境中比较不同决策范式的智能体,促进可重复的跨领域研究。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR 86%

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23373 2026-03-02 cs.AI cs.CL cs.IR 86%

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

面向反面媒体筛查的代理LLM框架用于反洗钱合规

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank

机构 * Interdisciplinary Centre for Security, Reliability and Trust(安全、可靠与信任跨学科中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM与RAG的代理框架,用于自动化反面媒体筛查,通过多步骤流程实现高风险个体的准确识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16602 2026-02-25 cs.CL cs.AI 86%

Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics

拒绝引导:为敏感话题对LLM拒绝行为实现细粒度控制

Iker García-Ferrero, David Montero, Roman Orus

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过引导向量控制LLM在敏感话题上的拒绝行为,实现安全且可控的审核方法。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 86%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏