arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-30 至 2025-12-30 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 36 篇

2502.01812 2025-12-30 cs.CL cs.LG 90%

SelfCheck-Eval: A Multi-Module Framework for Zero-Resource Hallucination Detection in Large Language Models

SelfCheck-Eval: 一个用于大型语言模型中零资源幻觉检测的多模块框架

Diyana Muhammed, Giusy Giulia Tuccari, Gollam Rabby, Sören Auer, Sahar Vahdati

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) L3S Research Center, Leibniz University Hannover(汉诺威莱布尼茨大学L3S研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 SelfCheck-Eval提出了一种多模块框架,专门用于检测大型语言模型在数学推理中的幻觉问题,通过三个独立模块提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22249 2025-12-30 cs.LG cs.CV 89%

Temporal Visual Semantics-Induced Human Motion Understanding with Large Language Models

基于大语言模型的时序视觉语义诱导的人体运动理解

Zheng Xing, Weibing Zhao

机构 * Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen(计算机科学与软件工程学院,深圳大学,深圳)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型提取时间视觉语义并整合到子空间聚类中,以提升人体运动分割性能的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22145 2025-12-30 cs.DL cs.AI cs.CY 89%

Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models

预审至同行评审:使用大型语言模型自动化评审的陷阱

Akhil Pandey Akella, Harish Varma Siravuri, Shaurya Rohatgi

机构 * AllSci Corp(AllSci公司) Sunwater Capital(Sunwater资本) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01967 2025-12-30 cs.CL cs.AI cs.HC 88%

Analyzing Cognitive Differences Among Large Language Models through the Lens of Social Worldview

通过社会世界观的视角分析大型语言模型的认知差异

Jiatao Li, Yanheng Li, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Information Management Department, Peking University(北京大学信息管理系) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社会世界观分类法分析大型语言模型的认知差异,揭示其在动态社会环境中的适应性与认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22306 2025-12-30 cs.CR cs.AI 88%

Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection

超越单一漏洞:为多漏洞检测大规模语言模型进行基准测试

Chinmay Pushkar, Sanchit Kabra, Dhruv Kumar, Jagat Sesh Challa

机构 * BITS Pilani(比斯·比兰迪大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出多漏洞检测基准测试,评估LLMs在不同漏洞密度下的性能,发现高密度下性能显著下降,尤其在Python和JavaScript中表现较差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV 88%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20933 2025-12-30 cs.SE 88%

Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code

大型语言模型代码设计能力的分层评估

Mootez Saad, Boqi Chen, José Antonio Hernández López, Dániel Varró, Tushar Sharma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了大型语言模型在代码设计能力上的分层表现,发现其在耦合性推理上易受噪声影响,而内聚性分析在受控环境下较稳健,但整体自主推理能力有限。

Comments 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23572 2025-12-30 cs.CL cs.CV 87%

Instruction-Following Evaluation of Large Vision-Language Models

大视觉-语言模型的指令遵循评估

Daiki Shiono, Shumpei Miyawaki, Ryota Tanaka, Jun Suzuki

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

AI总结 本研究评估了大视觉-语言模型在微调后的指令遵循能力,发现其能力下降并分析了原因,提出通过包含输出格式指示的训练数据集可缓解此问题。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12382 2025-12-30 cs.CL 87%

LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation

LLM-as-a-Judge: 快速评估法律文档推荐用于检索增强生成

Anu Pradhan, Alexandra Ortan, Apurv Verma, Madhavan Seshadri

机构 * Bloomberg(彭博)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本文提出LLM-as-a-Judge方法,通过改进评估指标和统计检验,实现法律文档推荐系统的自动化评估,提高评估效率和准确性。

Comments Accepted in EARL 25: The 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models at RecSys 2025

Journal ref Proceedings of the 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models (EARL), RecSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 86%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21647 2025-12-30 cond-mat.mtrl-sci cs.LG 86%

Automated Machine Learning Pipeline: Large Language Models-Assisted Automated Dataset Generation for Training Machine-Learned Interatomic Potentials

自动化机器学习流水线:基于大语言模型的自动化数据集生成用于训练机器学习互作用势

Adam Lahouari, Jutta Rogal, Mark E. Tuckerman

机构 * NYU, Department of Chemistry(纽约大学化学系) Initiative for Computational Catalysis, Flatiron Institute(计算催化计划,Flatiron研究所) NYU, Department of Physics(纽约大学物理系) Courant Institute of Mathematical Sciences, NYU(数学科学学院,纽约大学) NYU-ECNU Center for Computational Chemistry(纽约大学-复旦大学计算化学中心) Simons Center for Computational Physical Chemistry, NYU(Simons计算物理化学中心,纽约大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的自动化机器学习流水线,用于生成训练数据集以提升机器学习互作用势的精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23684 2025-12-30 cs.CL cs.AI 86%

Multilingual Hidden Prompt Injection Attacks on LLM-Based Academic Reviewing

多语言隐藏提示注入攻击对基于LLM的学术评审的影响

Panagiotis Theocharopoulos, Ajinkya Kulkarni, Mathew Magimai. -Doss

机构 * International School of Athens(希腊国际学校) Idiap Research Institute(Idiap研究 institute)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,多语言隐藏提示注入攻击对LLM基于的学术评审系统产生显著影响,尤其在英语、日语和中文中表现明显,而阿拉伯语则影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22470 2025-12-30 cs.AI 85%

DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior

DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为

Sadia Asif, Israel Antonio Rosales Laguan, Haris Khan, Shumaila Asif, Muneeb Asif

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) National University of Sciences and Technology(国立科学与技术大学) School of Electrical Engineering & Computer Science(电子与计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00592 2025-12-30 cs.PL cs.DC cs.LG cs.PF 85%

Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization

代理自调度:LLM引导循环优化的实验研究

Massinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ComPilot框架,利用LLM与编译器闭环交互实现代码优化,实验表明其在循环优化中效果优于现有方法。

Comments Accepted at the 34th International Conference on Parallel Architectures and Compilation Techniques (PACT 2025). 12 pages, plus appendix

Journal ref 2025 34th International Conference on Parallel Architectures and Compilation Techniques (PACT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22650 2025-12-30 cs.LG cs.AI cs.CL 80%

Scaling Unverifiable Rewards: A Case Study on Visual Insights

扩展不可验证的奖励:视觉洞察的案例研究

Shuyu Gan, James Mooney, Pan Hao, Renxiang Wang, Mingyi Hong, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Selective TTS框架,通过多阶段流程优化提升视觉洞察质量,实现计算预算固定下的性能提升。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22257 2025-12-30 q-bio.QM 80%

LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science

LiveProteinBench: 一种无污染的基准测试,用于评估模型在蛋白质科学中的专用能力

Dingyi Rong, Zijian Chen, Qi Jia, Kaiwei Zhang, Haotian Lu, Guangtao Zhai, Ning Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 LiveProteinBench通过无污染的多模态基准测试,评估LLM在蛋白质科学中的专用能力,揭示了通用模型在零样本性能上的优势及多模态信息融合的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21118 2025-12-30 cs.CL cs.AI 79%

The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection

信仰的灰色地带:在不忠检测中消除歧义

Qiang Ding, Lvzhou Luo, Yixuan Cao, Ping Luo

机构 * Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院信息处理重点实验室) State Key Lab of Al Safety(人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的忠实性注释框架和VeriGray基准,用于解决摘要任务中因外部知识边界不明确导致的注释歧义问题,并展示了其对现有方法的挑战。

Comments Update the evaluation results due to the annotation updates; revise the citation to Seo et al., 2025; add the acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22899 2025-12-30 cs.AI cs.CV 77%

HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery

HiSciBench: 一个分层多学科基准,用于从阅读到发现的科学智能

Yaping Zhang, Qixuan Zhang, Xingquan Zhang, Zhiyuan Chen, Wenwen Zhuang, Yupu Liang, Lu Xiang, Yang Zhao, Jiajun Zhang, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 HiSciBench是一个分层多学科基准,用于评估从阅读到发现的科学智能,涵盖五个层次,揭示了模型在不同科学推理阶段的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23701 2025-12-30 cs.CL cs.LG 73%

Eliciting Behaviors in Multi-Turn Conversations

多轮对话中的行为引导

Jing Huang, Shujian Zhang, Lun Wang, Andrew Hard, Rajiv Mathews, John Lambert

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出了一种多轮对话中的行为引导方法,通过分析不同方法的效率,展示了在线方法在多任务中的高成功率,强调了动态基准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22741 2025-12-30 cs.CL 70%

Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis

基于解释和时序对齐的文本引导稀疏专家混合模型用于多模态情感分析

Dongning Rao, Yunbiao Zeng, Zhihua Jiang, Jujian Lv

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于解释和时序对齐的文本引导稀疏专家混合模型,用于提升多模态情感分析的性能。

Comments 9 pages, 9 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22628 2025-12-30 cs.CL 70%

M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation

M2G-Eval: 提升和评估多粒度多语言代码生成

Fanglin Xu, Wei Zhang, Jian Yang, Guo Chen, Aishan Liu, Zhoujun Li, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Hunan University(湖南大学) Ubiquant

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 M2G-Eval通过多粒度多语言框架评估代码生成能力,揭示了不同粒度任务的难度差异和跨语言学习的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22496 2025-12-30 cs.MA cs.AI 70%

Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring

层级教学监督:一种多智能体对抗框架用于可靠的AI辅导

Saisab Sadhu, Ashim Dhor

机构 * AAAI 2026 EGSAI Community Activity(AAAI 2026 EGSAI 社区活动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出层级教学监督框架,通过多智能体对抗机制提升AI辅导的可靠性与效率,实验结果显示其在资源受限环境下表现优异。

Comments Accepted for presentation at the AAAI 2026 EGSAI Community Activity (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23691 2025-12-30 astro-ph.IM astro-ph.GA 67%

Galaxy Zoo Evo: 1 million human-annotated images of galaxies

Galaxy Zoo Evo: 100万张人类标注的星系图像

Mike Walmsley, Steven Bamford, Hugh Dickinson, Tobias Géron, Alexander J. Gordon, Annette M. N. Ferguson, Lucy Fortson, Sandor Kruk, Natalie Lines, Chris J. Lintott, Karen L. Masters, Robert G. Mann, James Pearson, Hayley Roberts, Anna M. M. Scaife, Stefan Schuldt, Brooke Simmons, Rebecca Smethurst, Josh Speagle, Kyle Willett

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 Galaxy Zoo Evo提供100万张人类标注的星系图像,用于构建和评估天文基础模型,支持领域适应和不确定性学习,助力未来天文研究。

Comments Submitted to NeurIPS Datasets and Benchmarks 2025. Positive reviews but rejected by AC; see OpenReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 67%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22721 2025-12-30 cs.NI cs.GT 67%

Cyber Resilience in Next-Generation Networks: Threat Landscape, Theoretical Foundations, and Design Paradigms

下一代网络中的网络韧性:威胁图景、理论基础与设计范式

Junaid Farooq, Quanyan Zhu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本书探讨下一代网络中网络韧性的重新概念化与工程化,通过零信任架构、博弈论威胁建模和AI技术,应对复杂威胁挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22680 2025-12-30 eess.SY cs.SY 67%

From Electrochemical Energy Storage to Next-Generation Intelligent Battery Technologies for Electric Vehicles: A Survey

从电化学储能到下一代智能电池技术:电动汽车的综述

Abderaouf Bahi, Amel Ourici, Chaima Lagraa, Siham Lameche, Soundess Halimi, Inoussa Mouiche, Ylias Sabri, Waseem Haider, Mohamed Trari

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了电化学储能技术的最新进展,探讨了智能电池管理系统中机器学习和AI的应用,旨在为电动汽车领域提供下一代电池技术的全面理解。

Comments This work was supervised by leading professor in the field (Pr. Mohamed Trari, Pr. Waseem Haider, Pr. Ylias Sabri)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05948 2025-12-30 cs.LG cs.CL 62%

DE$^3$-BERT: Distance-Enhanced Early Exiting for BERT based on Prototypical Networks

DE$^3$-BERT: 基于原型网络的距离增强型BERT早期退出

Jianing He, Qi Zhang, Weiping Ding, Duoqian Miao, Jun Zhao, Liang Hu, Longbing Cao

机构 * School of Information Engineering, Tianjin University of Commerce(天津商业大学信息工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) National Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) DataX Research Centre, School of Computing, Macquarie University(麦考瑞大学计算学院DataX研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 DE$^3$-BERT通过结合局部和全局信息提升BERT的早期退出效果,实验表明其在不同加速比例下性能更优。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23686 2025-12-30 cs.CL cs.SD 57%

PROFASR-BENCH: A Benchmark for Context-Conditioned ASR in High-Stakes Professional Speech

PROFASR-BENCH:面向高风险专业演讲的上下文条件ASR基准

Deepak Babu Piskala

机构 * Seattle, USA(美国西雅图)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 ProfASR-Bench 是一个针对高风险专业演讲的ASR基准测试,通过上下文条件识别评估,揭示了当前系统在利用上下文信息方面的不足。

Comments Benchmark dataset and evaluation suite. Data and code available at: https://huggingface.co/datasets/prdeepakbabu/ProfASR-Bench https://github.com/prdeepakbabu/ProfASR-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20491 2025-12-30 cs.CL 57%

Step-DeepResearch Technical Report

Step-DeepResearch 技术报告

Chen Hu, Haikuo Du, Heng Wang, Lin Lin, Mingrui Chen, Peng Liu, Ruihang Miao, Tianchi Yue, Wang You, Wei Ji, Wei Yuan, Wenjin Deng, Xiaojian Yuan, Xiaoyun Zhang, Xiangyu Liu, Xikai Liu, Yanming Xu, Yicheng Cao, Yifei Zhang, Yongyao Wang, Yubo Shu, Yurong Zhang, Yuxiang Zhang, Zheng Gong, Zhichao Chang, Binyan Li, Dan Ma, Furong Jia, Hongyuan Wang, Jiayu Liu, Jing Bai, Junlan Liu, Manjiao Liu, Na Wang, Qiuping Wu, Qinxin Du, Shiwei Li, Wen Sun, Yifeng Gong, Yonglin Chen, Yuling Zhao, Yuxuan Lin, Ziqi Ren, Zixuan Wang, Aihu Zhang, Brian Li, Buyun Ma, Kang An, Li Xie, Mingliang Li, Pan Li, Shidong Yang, Xi Chen, Xiaojia Liu, Yuchu Luo, Yuan Song, YuanHao Ding, Yuanwei Liang, Zexi Li, Zhaoning Zhang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * Step-DeepResearch

专题命中 评测与基准 :SFT(abstract);分类 cs.CL

AI总结 Step-DeepResearch通过原子能力数据合成策略和渐进式训练路径,实现低成本高效率的深度研究代理,实验表明其在Scale AI Research Rubrics和ADR-Bench上的表现优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22629 2025-12-30 cs.AI cs.IR 57%

DICE: Discrete Interpretable Comparative Evaluation with Probabilistic Scoring for Retrieval-Augmented Generation

DICE:基于概率评分的离散可解释比较评估用于检索增强生成

Shiyan Liu, Jian Ma, Rui Qu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 DICE提出一种基于概率评分的两阶段框架,提升RAG评估的可解释性和稳健性,通过透明判断和系统性错误诊断,实现高效且可信的评估。

Comments Accepted at ResponsibleFM @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏