arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2512.12264 2026-01-22 cs.CL 88%

Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

市场-基准:评估大型语言模型在初级量化交易和市场动态中的表现

Abhay Srivastava, Sam Jung, Spencer Mateega

机构 * AfterQuery

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MARKET-BENCH评估大型语言模型在初级量化交易任务中的表现,发现其在构建可执行回测程序方面有基本能力,但对价格、库存和风险的推理仍存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12560 2026-01-21 cs.AI cs.MA 88%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12234 2026-01-21 cs.GR cs.AI cs.CV 88%

Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models

Proc3D: 基于大语言模型的3D形状过程生成与参数编辑

Fadlullah Raji, Stefano Petrangeli, Matheus Gadelha, Yu Shen, Uttaran Bhattacharya, Gang Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08689 2026-01-19 cs.CL 88%

QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models

QuantEval:大型语言模型中金融量化任务的基准测试

Zhaolu Kang, Junhao Gong, Wenqing Hu, Shuo Yin, Kehan Jiang, Zhicheng Fang, Yingjie He, Chunlei Meng, Rong Fu, Dongyang Chen, Leqi Zheng, Eric Hanchen Jiang, Yunfei Feng, Yitong Leng, Junfan Zhu, Xiaoyou Chen, Xi Yang, Richeng Xuan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Macau(澳门大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) University of Chicago(芝加哥大学) Shanghai Weina Software Technology(上海韦纳软件技术) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 QuantEval是一个用于评估大型语言模型在金融量化任务中能力的基准测试,涵盖知识问答、数学推理和策略编程,通过回测框架评估模型性能,并展示了改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03543 2026-01-19 cs.CV cs.AI 88%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09972 2026-01-16 cs.AI 88%

Chinese Labor Law Large Language Model Benchmark

中国劳动法大语言模型基准

Zixun Lan, Maochun Xu, Yifan Ren, Rui Wu, Jianghui Zhou, Xueyang Cheng, Jianan Ding Ding, Xinheng Wang, Mingmin Chi, Fei Ma

机构 * Department of Mechatronics and Robotics, Xi’an Jiaotong–Liverpool University(机械与机器人系,西安交通大学利物浦大学) Department of Applied Mathematics, Xi’an Jiaotong–Liverpool University(应用数学系,西安交通大学利物浦大学) Hansheng Lawyers Building(翰盛律师事务所) Suzhou Gewu Digital Technology Co., Ltd.(苏州葛武数字技术有限公司) Kenneth Wang School of Law, Soochow University(肯尼斯·王法学院,苏州大学) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出LabourLawLLM和LabourLawBench,专门针对中国劳动法任务,通过精确的法律知识和复杂推理提升法律AI的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09833 2026-01-16 cs.CL 88%

Stable and Explainable Personality Trait Evaluation in Large Language Models with Internal Activations

在大型语言模型中利用内部激活实现稳定且可解释的人格特质评估

Xiaoxu Ma, Xiangbo Zhang, Zhenyu Weng

机构 * Georgia Institute of Technology(佐治亚理工学院) South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PVNI方法,通过内部激活提取人格向量并插值得分,实现LLMs中稳定且可解释的人格特质评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16685 2026-01-15 cs.CL 88%

Structured yet Bounded Temporal Understanding in Large Language Models

结构化但有界的大型语言模型时间理解

Damin Zhang, Julia Rayz

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比指示性与顺序性时间框架,揭示了大型语言模型在不同时间参考结构下对时间表示的组织方式及影响其时间理解的关键因素。

Comments Under review. Results on larger dataset. Correct a theoretical error. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 88%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08312 2026-01-15 cs.HC cs.CL 88%

Word Synchronization Challenge: A Benchmark for Word Association Responses for Large Language Models

词同步挑战:一种用于大型语言模型词关联响应的基准测试

Tanguy Cazalets, Joni Dambre

机构 * Ghent University(根特大学) Airo lab(Airo实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出词同步挑战基准测试,用于评估大型语言模型在模拟人类认知过程中的词关联能力,揭示模型复杂性对社交互动性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 88%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17899 2026-01-14 cs.CL 88%

Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation

大语言模型能识别隐含的自杀念头吗?一项实证评估

Tong Li, Shu Yang, Junchao Wu, Jiyao Wei, Lijie Hu, Mengdi Li, Derek F. Wong, Joshua R. Oltmanns, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology(卡瓦尔大学科学与技术大学) Washington University in St.Louis(圣路易斯华盛顿大学) University of Macau(澳门大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了大语言模型在识别隐含自杀念头和提供支持性回应方面的能力,发现现有模型存在显著局限,需更复杂的方法来改进心理健康应用。

Comments Dataset: https://huggingface.co/datasets/babytreecc/Implicit-suicide-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 88%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06118 2026-01-13 cs.AI 88%

Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism

超越可重复性:令牌概率揭示大语言模型非确定性

Tairan Fu, Gonzalo Martínez, Javier Conde, Carlos Arriaga, Pedro Reviriego, Xiuyuan Qi, Shanshan Liu

机构 * Politecnico di Milano(米兰理工学院) Information Processing and Telecommunications Center ETSI de Telecomunicación, Universidad Politécnica de Madrid(信息处理与电信中心,马德里理工大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型在非确定性下的令牌概率变化,发现非确定性对生成文本的影响显著,且可通过单次推理分析令牌概率来估计其影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06088 2026-01-13 q-fin.ST cs.LG 88%

PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction

PriceSeer:实时股票预测中大型语言模型的评估

Bohan Liang, Zijian Chen, Qi Jia, Kaiwei Zhang, Kaiyuan Ji, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05578 2026-01-12 cs.AI cs.CE 88%

Reinforcement Learning of Large Language Models for Interpretable Credit Card Fraud Detection

基于大语言模型的强化学习在可解释性信用卡欺诈检测中的应用

Cooper Lin, Yanting Zhang, Maohao Ran, Wei Xue, Hongwei Fan, Yibo Xu, Zhenglin Wan, Sirui Han, Yike Guo, Jun Song

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Baptist University(香港 Baptist 大学) Imperial College London(伦敦帝国理工学院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用强化学习后训练轻量级语言模型,以提高信用卡欺诈检测的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05545 2026-01-12 cs.CL 88%

Can Large Language Models Differentiate Harmful from Argumentative Essays? Steps Toward Ethical Essay Scoring

大型语言模型能否区分有害与论辩性文章?迈向道德文章评分的步骤

Hongjin Kim, Jeonghyun Kang, Harksoo Kim

机构 * Konkuk University(韩国康 kuk 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出HED基准,揭示LLMs在识别有害文章方面的能力不足,并强调需开发更注重伦理因素的AES系统。

Comments COLING 2025 accepted paper (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04540 2026-01-09 cs.SE cs.AI 88%

AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation

AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Jin Zhang, Zhang Zhang, Kang Yang, Yue Yu

机构 * College of Computer Science and Technology(计算机科学与技术学院) National University of Defense and Technology(国防科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。

Comments 13 pages, 7 figures, Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03578 2026-01-08 cs.CL 88%

PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics

PsychEthicsBench: 评估大型语言模型在澳大利亚心理健康伦理中的表现

Yaling Shen, Stephanie Fong, Yiwen Jiang, Zimu Wang, Feilong Tang, Qingyang Xu, Xiangyu Zhao, Zhongxing Xu, Jiahe Liu, Jinpeng Hu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) University of Liverpool(利物浦大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PsychEthicsBench通过多选和开放式任务评估LLMs在心理健康伦理方面的表现,揭示拒绝率作为伦理指标的不足,并指出领域微调可能损害伦理鲁棒性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17118 2026-01-08 cs.CL 88%

After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation

检索后,生成前:增强检索增强生成中大型语言模型的可信度

Xinbang Dai, Huikang Hu, Yuncheng Hua, Jiaqi Li, Yongrui Chen, Rihui Jin, Nan Hu, Guilin Qi

机构 * Southeast University(东南大学) University of New South Wales(新南威尔士大学) Noah’s Ark Lab(诺亚实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 BRIDGE框架通过动态确定响应策略,提升检索增强生成中大型语言模型的可信度,实验显示其在准确性上优于基线方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16160 2026-01-07 cs.CL 88%

EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios

EduBench: 一种全面的评估数据集,用于评估大型语言模型在多样化教育场景中的表现

Bin Xu, Yu Bai, Huashan Sun, Yiguan Lin, Siming Liu, Xinyue Liang, Yaolin Li, Zhuangzhi Dong, Jingren Zhang, Yufan Deng, Xinyu Zou, Yang Gao, Heyan Huang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出EduBench数据集,用于评估大型语言模型在多样化教育场景中的表现,包含9种主要场景和4000多个教育情境,通过多维指标和人工标注验证模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02186 2026-01-06 cs.CL 88%

Toward Global Large Language Models in Medicine

迈向医学领域的全球大语言模型

Rui Yang, Huitao Li, Weihao Xuan, Heli Qi, Xin Li, Kunyu Yu, Yingjian Chen, Rongrong Wang, Jacques Behmoaras, Tianxi Cai, Bibhas Chakraborty, Qingyu Chen, Lionel Tim-Ee Cheng, Marie-Louise Damwanza, Chido Dzinotyiwei, Aosong Feng, Chuan Hong, Yusuke Iwasawa, Yuhe Ke, Linah Kitala, Taehoon Ko, Jisan Lee, Irene Li, Jonathan Chong Kai Liew, Hongfang Liu, Lian Leng Low, Edison Marrese-Taylor, Yutaka Matsuo, Isheanesu Misi, Yilin Ning, Jasmine Chiat Ling Ong, Marcus Eng Hock Ong, Enrico Petretto, Hossein Rouhizadeh, Abiram Sandralegar, Oren Schreier, Iain Bee Huat Tan, Patrick Tan, Daniel Shu Wei Ting, Junjue Wang, Chunhua Weng, Matthew Yu Heng Wong, Fang Wu, Yunze Xiao, Xuhai Xu, Qingcheng Zeng, Zhuo Zheng, Yifan Peng, Douglas Teodoro, Nan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GlobMed数据集和GlobMed-LLMs模型,通过多语言医学任务评估,提升低资源语言医疗信息处理能力。

Comments 182 pages, 65 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24289 2026-01-01 cs.CL 88%

Automated Analysis of Sustainability Reports: Using Large Language Models for the Extraction and Prediction of EU Taxonomy-Compliant KPIs

欧盟可持续性报告的自动化分析:利用大型语言模型提取和预测符合欧盟分类法的KPIs

Jonathan Schmoll, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一个结构化数据集,利用大型语言模型评估欧盟分类法合规性,发现模型在预测财务KPIs上表现不佳,但能辅助识别经济活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17784 2026-01-01 cs.LG 88%

AdditiveLLM: Large Language Models Predict Defects in Additive Manufacturing

AdditiveLLM:大型语言模型预测增材制造缺陷

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,宾夕法尼亚州,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 AdditiveLLM通过自然语言输入预测增材制造缺陷,准确率达93%,简化了工艺参数优化过程。

Journal ref Additive Manufacturing Letters, Vol. 14, July 2025, Article 100292

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22306 2025-12-30 cs.CR cs.AI 88%

Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection

超越单一漏洞:为多漏洞检测大规模语言模型进行基准测试

Chinmay Pushkar, Sanchit Kabra, Dhruv Kumar, Jagat Sesh Challa

机构 * BITS Pilani(比斯·比兰迪大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出多漏洞检测基准测试,评估LLMs在不同漏洞密度下的性能,发现高密度下性能显著下降,尤其在Python和JavaScript中表现较差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19758 2025-12-24 cs.SE cs.AI 88%

Attention Distance: A Novel Metric for Directed Fuzzing with Large Language Models

注意力距离:一种用于大型语言模型定向模糊测试的新度量

Wang Bin, Ao Yang, Kedan Li, Aofan Liu, Hui Li, Guibo Luo, Weixiang Huang, Yan Zhuang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,北京大学深圳研究生院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) China Mobile Internet CO(中国移动互联网公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出注意力距离度量,利用大型语言模型分析代码元素间的注意力分数,提升定向模糊测试效率,实验显示在38个漏洞复现实验中测试效率提升3.43倍,优于DAFL和WindRanger。

Comments Accepted to ICSE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 88%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18244 2025-12-23 cs.CR cs.AI 88%

Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation

打破思维,打破系统:通过类人心理操纵进行大语言模型的劫持攻击

Zehao Liu, Xi Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出类人心理操纵方法,通过操纵大语言模型的心理状态实现高成功率的劫持攻击,验证了心理安全机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20990 2025-12-19 cs.CE cs.AI cs.MM 88%

FinAudio: A Benchmark for Audio Large Language Models in Financial Applications

FinAudio: 一个用于金融应用的音频大语言模型基准

Yupeng Cao, Haohang Li, Yangyang Yu, Shashidhar Reddy Javaji, Yueru He, Jimin Huang, Qianqian Xie, Fabrizio Dimino, Xiao-yang Liu, K. P. Subbalakshmi, Meikang Qiu, Sophia Ananiadou, Jian-Yun Nie

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) The Fin AI(Fin AI公司) Domyn(Domyn公司) Augusta University(奥古斯塔大学) The University of Manchester(曼彻斯特大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 FinAudio是一个用于评估音频大语言模型在金融领域应用的基准,通过三个任务和两个数据集评估七种模型,揭示了现有模型的局限性并提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16030 2025-12-19 cs.AI 88%

Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets

大型语言模型知道它们不知道什么吗?Kalshibench:通过预测市场评估知识校准的新基准

Lukas Nel

机构 * Lotus AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现大型语言模型普遍存在过度自信问题,表明知识校准需要专门发展。

详情

展开后加载摘要…

URL PDF HTML 收藏