arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2606.15532 2026-06-16 cs.CL cs.LG 新提交 82%

EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

EIBench: 基于模拟器的基准测试和用于情绪管理的回合信用强化学习

Rongzhi Zhu, Xiang Huang, Yuchuan Wu, Rui Wang, Zequn Sun, Tao Ren, Weiyao Luo, Bingxue Qiu, Jieping Ye, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Qwen-Character Team, Alibaba Group(阿里巴巴集团Qwen-Character团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出EIBench模拟器基准,包含2222个场景,通过2x2分类(支持、防御、修复、魅力)评估多轮情绪管理;并设计CTC-GRPO方法利用逐轮状态更新作为密集反馈,提升模型情绪智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14200 2026-06-15 cs.AI cs.LG 新提交 82%

When Should Agent Trust Be Conditional? Characterizing and Attacking Skill-Conditional Reputation in Agent Swarms

何时应条件化智能体信任?表征与攻击智能体群中的技能条件声誉

Yihan Xia, Taotao Wang

机构 * Shenzhen University(深圳大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究异构LLM智能体群中技能条件信任的适用条件,通过相图分析揭示其在高异质性、稀疏证据和技能相关场景下有效,但存在跨技能证据被攻击者利用的风险,提出条件信息值测试(CIVT)量化攻击影响。

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12392 2026-06-11 cs.CL cs.AI 新提交 82%

System Report for CCL25-Eval Task 5: New Dataset and LoRA-Fine-Tuned Qwen2.5

CCL25-Eval 任务5系统报告:新数据集与LoRA微调Qwen2.5

Haotao Xie

机构 * The Hangzhou International Innovation Institute Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对古典诗歌翻译与情感理解任务,构建高质量指令数据集CCPoetry-49K,并采用LoRA微调Qwen2.5-14B模型得到PoetryQwen,在CCL25-Eval任务5上取得0.757分,较基线提升9.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12332 2026-06-11 cs.CL cs.LG 新提交 82%

Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

通过信息增益衡量多轮对话中的语义进展

Paul He, Shiva Kasiviswanathan, Dominik Janzing

机构 * NTU Singapore(新加坡南洋理工大学) Amazon(亚马逊) Amazon Research, Tübingen, Germany(亚马逊研究院(德国图宾根))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出基于信息论的信息增益指标,通过高斯嵌入近似量化多轮对话中问题相关的语义进展,无需LLM推理,在多个基准上取得与人类判断一致的结果。

Comments Preprint. 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11232 2026-06-11 cs.CL cs.AI 新提交 82%

Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

每个行为都有代价:前沿大语言模型中的压缩道德组合

Weijia Zhang, Ruiqi Chen, Yunze Xiao, Weihao Xuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对现有道德基准仅评估孤立行为偏好的不足,提出Moral Trolley Arena两阶段盲ELO基准,通过校准个体道德行为并组合为双行为项,发现前沿LLM的道德判断呈压缩而非简单加性关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10852 2026-06-10 cs.CL cs.AI 新提交 82%

Janus: A Benchmark for Goal-Conditioned Information Distortion in LLMs

Janus: 大语言模型中目标导向信息扭曲的基准测试

Polydoros Giannouris, Mohsinul Kabir, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Archimedes/Athena RC(阿基米德/雅典研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出JANUS基准,通过固定事实池对比中性/目标导向条件,测量LLM在事实输出中的选择性扭曲,揭示模型缺乏防误导通信的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09578 2026-06-09 cs.AI cs.CL cs.IR 新提交 82%

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试

Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TABVERSE基准,通过控制表格内容、跨多种结构格式(HTML、Markdown、LaTeX)和渲染图像,系统评估LLM和VLM在问答、结构理解和结构重建任务中的表现,发现表示格式显著影响表格理解能力。

Comments 24 pages, 18 tables, 16 figures, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08938 2026-06-09 cs.CL cs.AI 新提交 82%

PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus

PACT: 通过特权合成与分支共识学习多样化诊断策略

Gen Li, Yuanze Hu, Zhichao Yang, Qingchen Yu, Jianwei Lv, Yue Guo, Yujing Liu, Faguo Wu, Hongwei Zheng, Xiandong Li, Bo Yuan, Yifan Sun, Zhaoxin Fan

机构 * Beihang University(北京航空航天大学) Baidu(百度) ByteDance(字节跳动) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出PACT框架,通过特权合成对话数据和多分支共识训练,使LLM同时学习多种诊断推理范式,在中文医疗诊断基准上取得最优性能。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08893 2026-06-09 cs.LG cs.AI cs.CR 新提交 82%

Cheap Reward Hacking Detection

廉价奖励黑客检测

Iván Belenky, Joaquín Itria, Steven Johns

机构 * Tamarillo

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出用小Transformer编码器将轨迹映射到单位球面,使嵌入距离近似奖励与元数据的L1距离,线性探针检测奖励黑客,AUC达0.9467,成本比LLM-as-judge低四个数量级。

Comments 20 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-06-09 cs.CL cs.AI 新提交 82%

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07167 2026-06-08 cs.CL cs.AI 新提交 82%

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

UrduMMLU:乌尔都语理解的大规模多任务基准

Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

机构 * MBZUAI

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对乌尔都语缺乏本地教育来源的MMLU风格基准,提出包含26,431道多选题的UrduMMLU,覆盖26个学科,评估30个LLM发现Gemini-3.5-Flash最佳,多数模型在人文科目上表现差。

Comments 27 pages, 18 figures, 17 tables, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06959 2026-06-08 cs.CL cs.AI 新提交 82%

OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios

OpenHalDet:面向多种生成场景的幻觉检测统一基准

Xinyi Li, Zhen Fang, Yongxin Deng, Jinyuan Luo, Hongnan Ma, Changdae Oh, Zijing Shi, Shanshan Ye, Hanchen Wang, Shu-Lin Chen, Yadan Luo, Mengyue Yang, Sean Du, Sharon Li, Ling Chen

机构 * University of Technology Sydney(新南威尔士大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Bristol(布里斯托大学) The University of Queensland(昆士兰大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OpenHalDet基准,标准化幻觉检测评估流程,支持黑盒、灰盒、白盒检测器,实现跨任务、模型和检测器的可控比较。

Comments Preprint. Code and data are available at https://github.com/Nellie179/Hallucination-Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14533 2026-08-17 cs.CR 新提交 82%

Finding Vulnerabilities via LLM-Augmented Semantics-Aware Type-Checking

基于大语言模型增强的语义感知类型检查的漏洞发现

Ruizhe Wang, Meng Xu, N. Asokan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出语义感知类型系统SETYPE,由LLMs执行类型推断与检查,构建PYSETYPE原型,在真实Python Web应用中实现87%精度、88%准确率,识别出15个潜在零日漏洞,9个获开发者确认。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13167 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 82%

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

TRAPSBench:视觉-语言模型可编码认知约束却无法表达

Fnu Pramono, John Cai, Sourabh Kulkarni

机构 * Meta Superintelligence Labs(元超级智能实验室) Reflection AI(反射人工智能公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对视觉-语言模型的认知约束表达问题,构建TRAPSBench基准并提出PECS指标,发现模型可感知不确定性却难表达,瓶颈在表达,需输出阶段干预。

Comments 10 Pages excluding Reference and Appendix, Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12034 2026-08-13 eess.AS cs.SD 新提交 82%

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试

Dehui Gao, Zhixian Zhao, Zhennan Lin, Yujie Liao, Yuhang Dai, Yike Zhu, Longshuai Xiao, Hui Bu, Xin Xu, Xie Chen, Shuai Wang, Liumeng Xue, Zhonghua Fu, Jun Du, Eng-Siong Chng, Jun Zhou, Lei Xie

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12195 2026-08-13 cs.HC 新提交 82%

IF:CARGO: LLM-Based Semantic Compilation for Al-Native Rule Programming Games

IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译

Ting-Chen Hsu, Lianye Zhang, Jiangxu Lin, Zhaoyi Yu, Fei Qin, Zihao Chen

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。

Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09068 2026-08-11 cs.SE 新提交 82%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05519 2026-08-07 cs.AI cs.CL cs.LG 新提交 82%

EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

EcoAgent-Bench:评估预算约束下大语言模型智能体的经济决策能力

Jie Wu, Ming Gong, Feixiang Cheng, Qinqin Zhao

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EcoAgent-Bench基准,评估大语言模型智能体在预算约束下的经济决策能力,发现现有智能体在该任务上表现不佳,发布了相关研究资源。

Comments 8 pages, 3 figures, 4 tables. Benchmark, dataset (304 budget-conditioned agent tasks), and evaluation harness; artifacts to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27268 2026-07-31 cs.SD 新提交 82%

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

脑电基础模型能否迁移至语音?显性与想象语音解码的基准测试

Owais Mujtaba Khanday, Mohamed Baha Ben Ticha, Sanae Belfrouh, Marc Ouellet, Jose A. Gonzalez-Lopez

机构 * University of Granada, Spain(格拉纳达大学) Research Centre for Information and Communication Technologies (CITIC-UGR), Spain(信息与通信技术研究中心) University of Chouaib Doukkali, Morocco(舒艾卜·杜卡利大学) Brain, Mind, and Behavior Research Center (CIMCYC), University of Granada, Spain(大脑、心智与行为研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文开展首个脑电基础模型语音解码基准测试,对比LaBraM等模型与EEGNet等基线,发现通用脑电预训练未在语音任务上展现一致优势,为语音专用基础模型研究提供依据。

Comments 6 pages, 1 figure, 3 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26244 2026-07-30 cs.SE 新提交 82%

Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation

代码语言模型是否利用测试?测试驱动代码生成的行为与表征研究

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 该研究以Qwen2.5-Coder-7B和Qwen3.6-27B为对象,针对多个代码生成任务探究代码语言模型对测试的利用情况,发现测试通过语义引导和上下文扰动影响模型,仅表征变化不代表有效利用测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22885 2026-07-28 cs.CR 新提交 82%

ReCon: A Resource-Constrained Benchmark for LLM-Based Cybersecurity Compliance Across Ingestion and Retrieval Pipelines

ReCon:用于跨摄取和检索管道的基于大语言模型的网络安全合规性的资源受限基准测试

Rohit Negi, Rishik Jain, Soumyo V Chakarborty, Amit Negi, Sandeep K Shukla

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究政府、企业和机构网络安全合规问题,利用无需GPU和高内存的大语言模型进行合规检查任务基准测试,实验证明低资源大语言模型在政策文件合规检查中可提供良好一致性/准确性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22165 2026-07-27 cs.DB cs.AI cs.CL cs.LG 新提交 82%

DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

DBA-Bench:基于大语言模型的数据库操作代理的生产保真度基准测试

Junming Chen, Junyang Jiang, Xu Chen, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于大语言模型的数据库操作代理评估问题,提出DBA-Bench基准测试,通过生产保真度等解决评估与生产操作差距,含多场景和难度标签,评估多基线组,揭示安全端到端修复困难。

Comments 14 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21912 2026-07-27 cs.MA 新提交 82%

Reliability-Contagion Feasibility in LLM Multi-Agent Networks

大语言模型多智能体网络中的可靠性传播可行性

Ruiwu Niu, Xincheng Shu, Ying Zhao

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型多智能体网络中错误主张传播问题,制定校正感知网络模型并结合多数投票基准,推导早期入侵条件等,通过模拟和实验得出相关结果,为在可靠性和传播约束下选择连通性提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19795 2026-07-23 cs.SE 新提交 82%

Towards Automated Formal Verification of zkEVMs Using LLM-Guided Constraint Synthesis

使用大语言模型引导的约束合成实现zkEVM的自动化形式验证

Shichen Huang, Zhenghe Jiang, Yi Jiang, Ling-I Wu, Jingyang Li, Guoqiang Li

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对zkEVM因实现错误可能破坏加密保证的问题,提出VeriSynth框架,通过大语言模型引导从Rust代码合成验证模型,采用混合范式及集成多种技术处理状态转换,在验证基准上错误检测率超90%,远超基线。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18819 2026-07-22 cs.CV 新提交 82%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18084 2026-07-21 cs.AI cs.CL cs.LG 新提交 82%

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

世界杯竞技场:语言模型和深度研究代理在足球预测上的细粒度评估

Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang

机构 * Shanghai Jiao Tong University(上海交通大学) McGill University(麦吉尔大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍世界杯竞技场这一语言模型和深度研究代理的动态基准,用于足球预测。模型赛前接收证据或自行搜索信息进行多项预测,赛后与实际结果对比。通过多指标评估104场比赛和13个系统,展示不同模型表现及与基线对比情况,且新赛程可添加用于评估未来模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06873 2026-07-09 cs.SE 新提交 82%

Mining Workflow Graphs for Black-Box Boundary Testing of Conversational LLM Agents

挖掘工作流图用于对话式大语言模型代理的黑盒边界测试

Liting Lin, Boxi Yu, Yuzhong Zhang, Lionel Briand, David-Paul Niland, Emir Muñoz

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对对话式大语言模型代理内部工作流失败难测问题,提出黑盒测试框架AgentEval,通过挖掘对话工作流图,利用其结构枚举测试目标,执行测试,在与白盒审计器对比测试中,能有效覆盖多个不同边界,降低重复率和误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06015 2026-07-08 cs.SD 新提交 82%

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试

Tomáš Sourada, Katia Vendrame, Jan Hajič

机构 * Charles University(查尔斯大学) Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 82%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23380 2026-06-24 cs.CY 新提交 82%

Affective AI Safety: The Missing Piece in LLM Safety

情感AI安全:LLM安全中缺失的一环

Carolin Ifländer, Alba Curry, Flor Miriam Plaza-del-Arco, Amanda Cercas Curry

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏