arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1448 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1448 篇

2607.11715 2026-07-16 cs.CL 版本更新 77%

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

JobHop v2:一个来自非结构化简历的大规模职业轨迹数据集

Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

机构 * AIDA-IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(AIDA-ID实验室,电子与信息系统系,根特大学,根特,比利时) AIDA-IDLab, Department of Electronics(AIDA-ID实验室,电子系) Information Systems, Ghent University, Ghent, Belgium(信息系统,根特大学,根特,比利时)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出JobHop v2数据集,通过端到端大语言模型从大量简历中提取职业轨迹。它扩大了覆盖范围与注释丰富度,引入新提取管道、模式及评估协议,最好提取器接近注释者间一致性上限,数据集和代码公开助力职业轨迹研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15886 2026-07-16 cs.CL 版本更新 77%

Linked Multi-Modal Data on Russian Domestic and Foreign Policy Speeches

连接多模型数据:俄罗斯国内与对外政策演讲

Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22432 2026-07-15 cs.LG 版本更新 77%

AMUSE: Anytime Muon with Stable Gradient Evaluation

AMUSE: 任何时刻的Muon with Stable Gradient Evaluation

Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文研究了Muon算法的机制,提出了一种名为AMUSE的算法,通过结合Muon的快速批量进步和Schedule-Free平均的稳定效果,实现了无需学习率调度的任何时刻训练,并在视觉任务和大语言模型预训练中提升了性能-迭代帕累托前沿。

Comments 44 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23750 2026-07-14 cs.CL 版本更新 77%

IslamicMMLU: A Benchmark for Evaluating LLMs on Islamic Knowledge

伊斯兰MMLU:评估大语言模型在伊斯兰知识上的基准

Ali Abdelaal, Mohammed Nader Al Haffar, Mahmoud Fawzi, Walid Magdy

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 伊斯兰MMLU基准通过10,013道题评估大语言模型在伊斯兰知识上的表现,涵盖《古兰经》、圣训和教法三个领域,测试模型在不同方面的能力,初步评估26个模型,准确率差异显著。

Comments Leaderboard link: https://huggingface.co/spaces/islamicmmlu/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新 77%

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23816 2026-07-07 cs.SE cs.AI 版本更新 77%

Query2Diagram: Answering Developer Queries with UML Diagrams

Query2Diagram:通过UML图回答开发者查询

Oleg Baryshnikov, Anton M. Alekseev, Sergey I. Nikolenko

机构 * HSE University(俄罗斯高等经济学院) St. Petersburg Department of Steklov Mathematical Institute, RAS(圣彼得堡斯捷克洛夫数学研究所(俄罗斯科学院)) St. Petersburg State University(圣彼得堡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出基于LLM的UML图生成方法,通过微调Qwen2.5-Coder-14B模型,生成语义聚焦的代码图谱,提升文档生成的准确性和实用性。

Comments 20 pages, 6 figures. Code: https://github.com/i-need-a-pencil/query2diagram

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00660 2026-07-07 cs.DB cs.AI 版本更新 77%

Streaming Model Cascades for Semantic SQL

流式模型级联用于语义SQL

Paweł Liskowski, Kyle Schmaus

机构 * Snowflake Inc.(雪花公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出两种流式模型级联算法,用于在分布式系统中高效处理语义SQL查询,通过迭代阈值优化和联合精度召回保证提升效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 77%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20133 2026-06-25 cs.AI 版本更新 77%

EvoAgent: An Evolvable Agent Framework with Skill Learning and Multi-Agent Delegation

EvoAgent:一种具备技能学习和多智能体委托的可进化代理框架

Aimin Zhang, Jiajing Guo, Fuwei Jia, Chen Lv, Boyu Wang, Fangzheng Li

机构 * Focus AI Center, Focus Technology Co., Ltd.(Focus技术有限公司人工智能中心) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(信息科学技术大学南京教育部长数字取证工程研究中心) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EvoAgent框架,通过结构化技能学习与分层子代理委托机制,实现技能的持续生成与优化,并通过实验展示其在外贸场景中的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00710 2026-06-23 cs.AI 版本更新 77%

Learning More from Less: Unlocking Internal Representations for Benchmark Compression

从更少中学习更多:解锁内部表示以实现基准压缩

Yueqi Zhang, Jin Hu, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yiwei Li, Jiayi Shi, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RepCore方法,通过对齐异构隐藏状态构建代表性核心集,仅需少量源模型即可精确估计大语言模型在完整基准上的性能,显著优于基于输出的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15378 2026-06-23 cs.CL 版本更新 77%

AlgoSimBench: Identifying Algorithmically Similar Problems for Competitive Programming

AlgoSimBench: 识别算法相似问题的竞赛编程基准

Jierui Li, Raymond Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AlgoSimBench基准,通过对抗性设计的多选题评估大语言模型识别算法相似问题的能力,并引入尝试解决方案匹配方法提升准确率。

Comments 14 pages, accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05435 2026-06-19 cs.AI 版本更新 77%

CareTransition-Audit: A Benchmark to Audit Discharge Summaries for Efficient Care Transitions

CareTransition-Audit:用于高效护理过渡的出院总结审计基准

Akshat Dasula, Prasanna Desikan, Jaideep Srivastava, Shivali Dalmia, Abhishek Mukherji

机构 * Department of Computer Science \& Engineering, University of Minnesota-Twin Cities, Minneapolis, USA Centific AI Research, Redmond, USA

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于大语言模型的自动化框架,通过46项检查清单审计出院总结完整性,在MIMIC-IV数据集上基准测试11个模型,最佳模型与临床医生标签的Cohen's kappa约0.5,所有模型难以识别模糊文档。

Comments Accepted as a poster at IEEE-ICHI 2026; Accepted at SD4H@ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10384 2026-06-17 cs.CL 版本更新 77%

When Tables Go Crazy: Evaluating Multimodal Models on French Financial Documents

当表格失控:评估多模态模型在法语金融文档上的表现

Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah

机构 * Inria Paris(巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出Scribe Finance基准,评估多模态模型在法语金融文档上的文本、表格、图表及多轮对话理解能力,发现模型在图表和多轮对话中表现脆弱。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00873 2026-06-16 cs.MM cs.AI cs.CV 版本更新 77%

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

BRITE:面向不可信场景的可靠可解释文本到视频评估基准

Advait Tilak, Jiwon Choi, Nazifa Mouli, Wei Le

机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新 77%

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19697 2026-06-16 cs.SE cs.AI 版本更新 77%

AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion

AlignCoder: 为目标意图对齐检索以实现仓库级代码补全

Tianyue Jiang, Yanli Wang, Yanlin Wang, Daya Guo, Ensheng Shi, Yuchi Ma, Jiachi Chen, Zibin Zheng

机构 * School of Software, Sun Yat-sen University(中山大学软件学院) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对仓库级代码补全中检索与目标代码不匹配及无法利用推理信息的问题,提出AlignCoder框架,通过查询增强和基于强化学习的检索器训练,在CrossCodeEval上EM分数提升18.1%。

Comments To appear at ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02627 2026-06-12 cs.AI 版本更新 77%

DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning

DecompSR:用于组合多跳空间推理分解分析的数据集

Lachlan McPheat, Navdeep Kaur, Robert Blackwell, Alessandra Russo, Anthony G. Cohn, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所) Imperial College London(帝国理工学院伦敦分校) The University of Leeds(利兹大学) City St George’s University of London(伦敦城市圣乔治大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DecompSR数据集(超500万数据点),通过程序化生成独立控制组合性的多个方面(如推理深度、语言变异性),用于细粒度评估大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03792 2026-06-11 cs.CL 版本更新 77%

VietMed-MCQ: A Consistency-Filtered Data Synthesis Framework for Vietnamese Traditional Medicine Evaluation

VietMed-MCQ:面向越南传统医学评估的一致性过滤数据合成框架

Huynh Trung Kiet, Dao Sy Duy Minh, Nguyen Dinh Ha Duong, Le Hoang Minh Huy, Long Nguyen, Dien Dinh

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于检索增强生成和一致性过滤的VietMed-MCQ数据集,含3190道多选题,经专家验证准确率94.2%,基准测试显示通用模型优于越南语模型。

Comments The authors have withdrawn this article because the current version is still undergoing substantial revision. Several components of the data synthesis framework, consistency-filtering procedure, evaluation protocol, and experimental analysis are being refined and expanded. As a result, the current manuscript should not be considered a complete or final representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22079 2026-06-09 cs.CL 版本更新 77%

Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements

Ishigaki-IDS-Bench: 一个用于从BIM信息需求生成信息交付规范的基准

Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Shuhei Saitoh, Atomu Kondo, Koki Arakawa, Daiho Nishioka

机构 * ONESTRUCTION Inc.(ONESTRUCTION公司) AWS GenAI Innovation Center(AWS生成式人工智能创新中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出Ishigaki-IDS-Bench基准,用于评估大型语言模型生成符合行业标准的XML信息交付规范(IDS)的能力,通过166个由BIM/IDS专家编写和验证的示例,结合内容一致性评估和结构审核,展示了当前LLM在生成满足IDS标准和IFC词汇约束的XML方面的局限性。

Comments 7 pages; benchmark data and evaluation scripts are available on GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17173 2026-08-12 cs.CL cs.AI cs.LG 版本更新 76%

Why Do Safety Guardrails Degrade Across Languages?

为何安全护栏在不同语言中会退化?

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过引入多组项目反应理论框架,揭示了语言无关的安全鲁棒性、提示内在难度、全球语言处理难度和提示特定的跨语言安全差距等因素,发现安全退化并非仅在低资源语言中发生,且文化与概念不匹配也会影响安全性能。

Comments Poster at Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12220 2026-08-14 cs.LG cs.AI cs.CR 版本更新 76%

Unlearning at Scale: State-Exact Trace-Preserving Deletion in Billion-Parameter Language Models

大规模模型的遗忘:十亿参数语言模型中的状态精确、保留轨迹的删除

Abdullah X

机构 * Zephara AI

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

AI总结 该研究针对十亿参数语言模型,提出保留轨迹的删除方法,在Pythia、Llama模型上实现状态精确删除,但分散请求会导致高重放成本,发布相关测量作为诊断工具。

Comments 18 pages, 2 figures, 7 tables. Code and frozen research records available at https://github.com/abdullah-x-bd/unlearning (v0.3.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21951 2026-08-24 cs.IR cs.CR 版本更新 75%

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

SIREN(诱使大语言模型陷入困境):网页增强型大语言模型推荐系统中基于配对驱动的偏好操纵

Evan Caville, Spencer Kayser, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究网页增强型大语言模型推荐系统中排序推荐的对抗操纵问题,提出SIREN方法,利用23种内容中毒技术迭代编辑检索到的网页,在两个Claude模型上实验,使选定实体多次达排名第1,验证了声明性排名等方式的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16681 2026-08-18 eess.AS cs.SD eess.SP 版本更新 75%

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频超分辨率和带宽扩展从判别模型到生成模型的综述

Ningyuan Yang, Yize Li, Diego A. Cuji, Ryan M. Corey, Pu Zhao, Xue Lin, Andrew C. Singer

机构 * Discovery Partners Institute(发现伙伴研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03880 2026-08-14 cs.CV 版本更新 75%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新 75%

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12226 2026-08-12 cs.IR 版本更新 75%

Crowd-OM: Crowdsourcing for Ontology Matching Validation

解锁众包用于本体匹配验证

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对本体匹配验证依赖领域专家的问题,提出一种结合差分可信度、一致性预填充和时变意见的众包系统,实现人机协同验证。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14657 2026-08-04 cs.CL cs.AI cs.LG 版本更新 75%

OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset

OpenDebateEvidence:一个大规模论证挖掘与摘要数据集

Allen Roush, Yusuf Shabazz, Arvind Balaji, Peter Zhang, Stefano Mezza, Markus Zhang, Sanjay Basu, Sriram Vishwanath, Mehdi Fatemi, Ravid Shwartz-Ziv

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出源自美国竞技辩论界的大规模OpenDebateEvidence数据集,经实验验证微调大语言模型可实现论证性抽象摘要,旨在推进计算论证并公开数据集供研究使用。

Comments Published to the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11518 2026-07-31 cs.IR 版本更新 75%

KuaiSearch: An E-Commerce Search Dataset with Authentic Queries and Product Texts for Recall, Ranking, and Relevance

KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性

Yupeng Li, Ben Chen, Mingyue Cheng, Zhiding Liu, Xuxin Zhang, Chenyi Lei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25635 2026-07-30 cs.SE 版本更新 75%

An Empirical Study of Model Context Protocol Applications

模型上下文协议应用的实证研究

Muhammad Hamza Arshad Majeed, May Mahmoud, Sarah Nadi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究对1723个GitHub上的MCP应用展开大规模研究,先从样本得出分类,再用大语言模型辅助流程刻画服务器集成。结果表明该生态系统部分实践趋同,如多数用文件配置服务器、用官方SDK通信,但配置文件命名无约定,人工监督差异大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17492 2026-07-28 cs.AI cs.CL cs.LG 版本更新 75%

PD$^3$: A Project Duplication Detection Framework via Adapted Multi-Agent Debate

PD$^3$:一种通过适应性多智能体辩论的项目重复检测框架

Dezheng Bao, Yueci Yang, Chutian Yu, Xin Chen, Zeguo Fei, Xiang Yuan, Lijun Zhang, Jiangqian Huang, Zhengxuan Jiang, Daoze Zhang, Junru Chen, Yang Yang

机构 * Zhejiang University(浙江大学) State Grid Power Supply Co. Ltd.(国网电力供应有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究项目重复检测问题,提出PD$^3$框架,通过适应性多智能体辩论,结合局部多智能体辩论与全局循环调度检索项目集,能保证公平比较并产生相关分数和反馈,在真实项目上优于基线,还部署平台节省资金。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏