arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1448 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1448 篇

2511.20274 2026-07-03 cs.CV 版本更新 78%

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP

Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 78%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04764 2026-06-24 cs.CV 版本更新 78%

Do Foundation Models See Biology? Evaluating Attention Coherence with Spatial Transcriptomics in Glioblastoma

基础模型是否理解生物学?利用空间转录组学评估胶质母细胞瘤中的注意力一致性

Dilakshan Srikanthan, Amoon Jamzad, Paul Wilson, Nooshin Maghsoodi, Robert Policelli, Gabor Fichtinger, John F. Rudan, Parvin Mousavi

机构 * Translational Medicine, School of Medicine, Queen’s University, Kingston, ON, Canada(转化医学、医学院、皇后大学、金斯顿,ON,加拿大) School of Computing, Queen’s University, Kingston, ON, Canada(计算学院、皇后大学、金斯顿,ON,加拿大) Department of Surgery, Queen’s University, Kingston, ON, Canada(外科部门、皇后大学、金斯顿,ON,加拿大)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出基于空间转录组学的框架,客观评估病理基础模型注意力图与生物学的一致性,发现注意力捕捉多基因转录程序而非单个分子事件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09054 2026-06-24 cs.SD cs.MM 版本更新 78%

HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation

HAFM:用于音乐伴奏生成的分层自回归基础模型

Jian Zhu, Jianwei Cui, Yunlong Xue, Shihao Chen, Yubang Zhang, Cheng Luo, Jun Sun

机构 * Zhejiang Lab(浙江实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang International Studies University(浙江国际 Studies 大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。

Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05739 2026-06-18 cs.SD eess.AS 版本更新 78%

Do speech foundation models perceive speaker similarity as humans do?

语音基础模型是否像人类一样感知说话人相似性?

Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi, Yuki Saito

机构 * Keio University, Japan(庆应大学,日本) The University of Tokyo, Japan(东京大学,日本)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究通过比较40多个语音基础模型的说话人嵌入与人类主观相似性评分,探究模型距离是否与人类感知一致,并识别影响模型与人类感知一致性的关键配置因素。

Comments Accepted by INTERSPEECH 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04796 2026-06-18 eess.AS cs.SD 版本更新 78%

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

LALM-as-a-Judge:用于多轮口语对话安全评估的大型音频语言模型基准测试

Amir Ivry, Shinji Watanabe

机构 * Computer Engineering, Technion--Israel Institute of Technology, Haifa, Israel(技术学院电子工程系,技术离子技术研究所,以色列海法) Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,卡内基梅隆大学,美国匹兹堡)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对口语对话中社会不安全内容评估仍以文本为中心、忽略韵律和转录失败的问题,提出包含24000个多轮口语对话的开放基准,评估6种大型音频语言模型在文本、音频和多模态设置下的敏感性、严重性顺序特异性和轮次位置偏差,发现音频提供非词汇证据,多模态增益非普遍且存在多种模式。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03308 2026-06-11 cs.CR 版本更新 78%

The Security Budget of Code-LLM Prompt Hardening: Provable Limits Under Pass-Only Acceptance

代码大语言模型的安全预算:一种信息论容量-安全界限

Jianwei Tai

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出一种信息论框架,通过容量-安全界限量化代码大语言模型在提示扰动下的功能容量与扰动保留之间的权衡,并利用输出隐藏状态进行实证验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22153 2026-06-10 eess.AS 版本更新 78%

Towards Paradigm-General Suicide Risk Detection via Speech LLM

面向范式通用的语音自杀风险检测:基于语音大语言模型

Jialun Li, Weitao Jiang, Ziyun Cui, Yinan Duan, Diyang Qu, Chao Zhang, Runsen Chen, Chang Lei, Wen Wu

专题命中 评测与基准 :LLM(title,abstract)

AI总结 提出基于语音大语言模型和混合DoRA专家的方法,统一多种语音诱发范式,在1223名参与者十种范式上优于特定范式及传统联合学习模型,并泛化至未见范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14441 2026-06-09 eess.SP 版本更新 78%

Batch Effects In Brain Foundation Model Embeddings

脑基础模型嵌入中的批次效应

Ye Tao, Bradley T. Baker, Yu Wu, Anand D. Sarwate, Sandeep Panta, Sergey Plis, Vince D. Calhoun

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究评估了两个脑影像基础模型在多中心fMRI数据集中的嵌入表现,发现嵌入编码了显著的批次相关变异,并探讨了和谐化对嵌入的影响,揭示了不同模型对区域活动和区域交互的偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19515 2026-08-24 cs.CL 版本更新 77%

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

Hear2Act:对韵律应何时改变助手行为的基准测试

Xinyi Liu, Hooshang Nayyeri, Dilek Hakkani-Tur, Emine Yilmaz, Joo-Kyung Kim, Yifei Zhang, Charith Peris, Hari Thadakamalla

机构 * Amazon(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究推出 Hear2Act 基准,评估发现词汇证据不足时韵律对助手决策很重要,具备音频能力的 LLM 能从语音恢复信息但需显式中间表示才能可靠转化为行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26703 2026-08-19 cond-mat.mtrl-sci cs.AI physics.comp-ph 版本更新 77%

Discovering physical mechanisms from experiment-simulation mismatches

可自我进化的代理用于DFT实验能带不匹配的可解释诊断

Yue Li, Penghui Yang, Yushan Xiao, Zhonghan Zhang, Jianguo Huang, Yuhao Lu, Cuntai Guan, Bo An, Bijun Tang, Zheng Liu

机构 * School of Materials Science and Engineering, Nanyang Technological University(南洋理工大学材料科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出XDFT代理,通过自动诊断DFT计算中能带不匹配问题,利用贝叶斯后验更新假设有效性,有效识别78%的不匹配案例,优于随机基线和静态LLM排序。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17127 2026-08-19 cs.CL 版本更新 77%

The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI

实验室驱动的对齐签名的出现:一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险

Dusan Bosnjakovic

机构 * AI Researcher(人工智能研究员)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险,通过分析九个领先模型的实验室信号,揭示了持续行为聚类的成因。

Comments v2: expanded from 9 to 18 behavioral dimensions and from 4 to 6 developer organizations; revised statistical methodology (rank-based inference with effect-size criterion, replacing variance-decomposition approach); model-level results now reported; references corrected throughout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09860 2026-08-18 cs.RO cs.AI 版本更新 77%

RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies

RoboLab:一种高保真模拟基准,用于分析任务通用策略

Jenai Xuning Yang, Rishit Dagli, Alex Zook, Hugo Hadfield, Ankit Goyal, Stan Birchfield, Fabio Ramos, Jonathan Tremblay

机构 * NVIDIA University of Toronto(多伦多大学) The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 RoboLab通过高保真模拟环境评估任务通用策略的真实泛化能力,提供120个任务的视觉、程序和关系能力测试,揭示当前最佳模型的性能差距。

Journal ref Robotics: Science and Systems XXII, Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18785 2026-08-17 cs.AI 版本更新 77%

SkillSight: Calibrating Generic Content Bias for Skill Retrieval

SkillSight:通过共享描述实现准确技能检索

Jinying Xiao, Bin Li, Xiaopeng Li, Jianling Li, Jiacheng Jie, Xiaodong Liu, Ma Jun, Chao Wang, Nyima Tashi, Jie Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体技能检索问题,提出SkillSight框架,通过语义和词汇空间校准共享背景,减少偏差,实验证明该方法能提升检索指标,在端到端评估中表现出色且速度快,实现准确高效的技能选择。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 77%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 77%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 77%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12383 2026-08-10 cs.CL 版本更新 77%

Beyond Binary Detection: A Multi-Dimensional Taxonomy of Cancer Misinformation on Reddit

超越二元检测:Reddit 上癌症错误信息的多维分类法

Aria Pessianzadeh, Pooriya Jamie, Naima Sultana, Georgia Himmelstein, Yuliya Zektser, Patricia Ganz, Homa Hosseinmardi, Amir Ghasemian, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究旨在刻画Reddit上癌症错误信息,引入多维分类法涵盖七个维度。利用专家标注数据评估大语言模型,分析错误信息。发现其约占癌症讨论6%,少样本提示可提高性能,还识别出常见错误信息叙述,为相关建模奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 77%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 77%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新 77%

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10619 2026-08-03 cs.CL 版本更新 77%

Disentangling Similarity and Relatedness in Topic Models

在主题模型中区分相似性和相关性

Hanlin Xiao, Yang Wang, Mauricio A. Álvarez, Rainer Breitling

机构 * Manchester Institute of Biotechnology, The University of Manchester, UK(曼彻斯特生物技术研究所,曼彻斯特大学,英国) Department of Computer Science, The University of Manchester, UK(计算机科学系,曼彻斯特大学,英国) Department of Chemistry, The University of Manchester, UK(化学系,曼彻斯特大学,英国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文通过构建大规模合成基准和神经评分器,从心理语言学角度区分主题词之间的主题相关性和分类相似性,并证明两个维度对下游任务性能有不同影响。

Comments 26 pages, 9 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15715 2026-07-30 cs.AI 版本更新 77%

Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents

信息提取的智能模型行为可控性:从固定工作流程到反思性智能体

Lujia Zhang, Xingzhou Chen, Hongwei Feng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体用于信息提取任务时,反思和记忆等智能组件能否带来改进。通过会议论文数据集提取实验,比较固定工作流程与反思智能体变体,指定优化条件,评估过程行为,明确智能机制对系统行为的影响及如何推动智能体设计优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25758 2026-07-28 cs.CL 版本更新 77%

StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios

StreamProfileBench:真实流式场景中细粒度用户画像推断的基准

Sizhe Wang, Feiyu Duan, Juelin Wang, Liwen Zhang, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Shanghai University of Finance and Economics(上海财经大学) MOE laboratory for National Development and Intelligent Governance, Fudan University(复旦大学国家发展与智能治理实验室) Research Institute of Intelligent Complex Systems, Fudan University(复旦大学智能复杂系统研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出StreamProfileBench基准,通过持续状态维护任务和免标注评估框架,研究大语言模型在流式用户画像更新中的保守偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07889 2026-07-28 cs.CL 版本更新 77%

BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science

BioProBench: 一个全面的数据集和生物协议理解与推理基准

Yuyang Liu, Liuzhenghao Lv, Xiancheng Zhang, Jingya Wang Li Yuan, Yonghong Tian

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Chemical Biology&Biotechnology, Peking University(北京大学化学生物学与生物技术学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 BioProBench通过构建大规模数据集和基准,提升生物协议理解与推理的LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07738 2026-07-27 cs.SE cs.AI cs.CR cs.PL 版本更新 77%

REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming

REFORGE:一种在反编译二进制函数命名中对大语言模型逆向工程能力进行基准测试的方法

Nicolas Koller, Andreas U. Schmidt

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型逆向工程能力评估难的问题,提出Reforge方法,通过特定流程构建函数级真实情况并处理对齐不确定性,经实验验证该方法能揭示优化对模型性能的影响,推动不确定性感知基准测试实践。

Comments 10 pages, 5 figures; accepted for publication to the 23rd International Conference on Applied Computing 2026, Lisbon October 24-26,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17191 2026-07-23 cs.AI 版本更新 77%

Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment

迈向拟人化对话:一个用于类人聊天生成、评估和偏好对齐的闭环框架

Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji Wang

机构 * Shanghai Institute of Innovation(上海创新研究院) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Chabiyue (Shanghai) Information Technology Co., Ltd.(上海叉叉悦信息技术有限公司) Shanghai Tianyou Software Co., Ltd.(上海天游软件有限公司) Zhejiang Century Huatong Group Co., Ltd.(浙江世纪华通集团有限公司)

专题命中 评测与基准 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 该研究提出AnthroDial闭环框架,将拟人化对话作为联合问题,结合角色调度运行时、可执行基准和训练后管道。在多场景基准上评估多个系统,结果显示共享行为维度时拟人化对话有益,不同方法提升了严格准确率。

Comments 17 pages, 2 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06374 2026-07-22 cs.CL 版本更新 77%

Evaluating Style-Personalized Text Generation: Challenges and Directions

评估风格个性化文本生成:挑战与方向

Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan, Adrian de Wynter, Sujay Kumar Jauhar

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) The University of York(约克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究风格个性化文本生成面临的挑战,通过提出的风格判别基准评估常用指标,发现多样评估指标集成效果更佳,为可靠评估该文本生成提供指导。

Comments Accepted to the 5th GEM workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14335 2026-07-21 cs.CR cs.AI cs.SE 版本更新 77%

Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型

Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。

Comments Paper has beed accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00724 2026-07-17 cs.CL 版本更新 77%

MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

MSQA:一个原生来源的多语言多文化SimpleQA基准

Xianru Chen, Yukai Huang, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Ge Zhang, Wenhao Huang, Jiaheng Liu

机构 * M-A-P ByteDance Seed(字节跳动Seed) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出MSQA基准,包含1064个原生问题覆盖11种语言和5个文化维度,评估18个LLM发现文化能力随预训练暴露程度下降,且推理时补救措施无效。

Comments Due to the company's data approval issue, we need to withdraw the article

详情

展开后加载摘要…

URL PDF HTML 收藏