arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-07 至 2026-01-07 共收录 192 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 30 篇

2509.22461 2026-01-07 cs.SD cs.AI cs.CL eess.AS 62%

CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges

CMDAR:一个包含多样挑战的中文多场景动态音频推理基准

Hui Li, Changhao Jiang, Hongyu Wang, Ming Zhang, Jiajun Sun, Zhixiong Yang, Yifei Cao, Shihan Dou, Xiaoran Fan, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) IEIT Systems Co Ltd(IEIT系统有限公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 CMDAR是一个中文多场景动态音频推理基准,旨在评估模型在复杂音频推理任务中的表现,通过精心设计的问题-答案对和多样化音频片段,揭示现有音频语言模型在复杂推理任务中的局限性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12366 2026-01-07 cs.LG cs.AI 62%

DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization

DisCO:通过判别约束优化强化大推理模型

Gang Li, Ming Lin, Tomer Galanti, Zhengzhong Tu, Tianbao Yang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 DisCO通过判别约束优化方法,有效解决大推理模型中的难度偏差和熵不稳定性,显著提升数学推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03217 2026-01-07 cs.CL 57%

MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics

MalruleLib: 大规模可执行的错误推理与步骤追踪用于数学学生思维建模

Xinghe Chen, Naiming Liu, Shashank Sonkar

机构 * Rice University(里士大学) University of Central Florida(中央佛罗里达大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 MalruleLib通过可执行的错误推理和步骤追踪,建模数学学生思维,实现跨模板的误解预测与反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23659 2026-01-07 cs.CL 57%

Less is more: Probabilistic reduction is best explained by small-scale predictability measures

少即是多:概率性缩减最好由小规模可预测性度量解释

Cassandra L. Jacobs, Andrés Buxó-Lugo, Anna K. Taylor, Marie Leopold-Hooke

机构 * Department of Linguistics, University at Buffalo(语言学系,布法罗大学) Department of Psychology, University at Buffalo(心理学系,布法罗大学) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文探讨了语言模型概率与认知现象关系中所需上下文量,证明n-gram表示可作为认知规划的单位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 50%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 推理与问题求解 :LLM(abstract)

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 45 篇

2503.21813 2026-01-07 cs.AI cs.CL cs.IR cs.LG 92%

OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM-T:用于理解大规模语言模型幻觉的本体匹配TBox基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OAEI-LLM-T是一个用于研究大规模语言模型在本体匹配中幻觉问题的TBox基准数据集,通过分类幻觉类型并提供评估工具,促进对LLM在OM任务中表现的深入理解。

Comments 14 pages, 4 figures, 4 tables, 2 prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02908 2026-01-07 cs.CV cs.AI cs.LG 92%

TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors

TA-Prompting: 通过时间锚点增强视频大语言模型以实现密集视频描述

Wei-Yuan Cheng, Kai-Po Chang, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA(NVIDIA公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.AI、cs.LG

AI总结 TA-Prompting通过引入时间锚点提升视频大语言模型的密集视频描述能力,有效解决时间边界识别问题,提升时间感知视频事件理解性能。

Comments 8 pages for main paper (exclude citation pages), 6 pages for appendix, totally 10 figures 7 tables and 2 algorithms. The paper is accepted by WACV 2026

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02404 2026-01-07 cs.CL cs.AI 90%

PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models

PCEval: 一个评估大型语言模型物理计算能力的基准

Inpyo Song, Eunji Jeon, Jangwon Lee

机构 * Department of Immersive Media Engineering(沉浸媒体工程系) Sungkyunkwan University(成均馆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 PCEval是一个评估大型语言模型物理计算能力的基准,通过自动评估电路生成和硬件交互能力,揭示LLMs在物理布局设计中的不足。

Comments Code and Dataset available at https://github.com/Null99-Dog/PCEval-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02677 2026-01-07 cs.LG q-fin.RM q-fin.ST 89%

Uni-FinLLM: A Unified Multimodal Large Language Model with Modular Task Heads for Micro-Level Stock Prediction and Macro-Level Systemic Risk Assessment

Uni-FinLLM:一种具有模块化任务头的统一多模态大语言模型,用于微观层面的股票预测和宏观层面的系统性风险评估

Gongao Zhang, Haijiang Zeng, Lu Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Uni-FinLLM通过统一多模态大语言模型,结合模块化任务头,实现了对股票预测和系统性风险评估的高效联合建模,显著提升了预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 89%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02443 2026-01-07 cs.CV cs.AI eess.IV 89%

Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative

评估多模态大语言模型的诊断分类能力:来自骨关节炎倡议的见解

Li Wang, Xi Chen, XiangWen Deng, HuaHui Yi, ZeKun Jiang, Kang Li, Jian Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究发现,多模态大语言模型在医学图像分类中表现不佳,建议优先优化视觉编码器和数据集质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16160 2026-01-07 cs.CL 88%

EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios

EduBench: 一种全面的评估数据集,用于评估大型语言模型在多样化教育场景中的表现

Bin Xu, Yu Bai, Huashan Sun, Yiguan Lin, Siming Liu, Xinyue Liang, Yaolin Li, Zhuangzhi Dong, Jingren Zhang, Yufan Deng, Xinyu Zou, Yang Gao, Heyan Huang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出EduBench数据集,用于评估大型语言模型在多样化教育场景中的表现,包含9种主要场景和4000多个教育情境,通过多维指标和人工标注验证模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03232 2026-01-07 cs.CL cs.AI 86%

Multi-RADS Synthetic Radiology Report Dataset and Head-to-Head Benchmarking of 41 Open-Weight and Proprietary Language Models

多RADS合成放射学报告数据集及41种开源和专有语言模型的头对头基准测试

Kartik Bose, Abhinandan Kumar, Raghuraman Soundararajan, Priya Mudgil, Samonee Ralmilay, Niharika Dutta, Manphool Singhal, Arun Kumar, Saugata Sen, Anurima Patra, Priya Ghosh, Abanti Das, Amit Gupta, Ashish Verma, Dipin Sudhakaran, Ekta Dhamija, Himangi Unde, Ishan Kumar, Krithika Rangarajan, Prerna Garg, Rachel Sequeira, Sudhin Shylendran, Taruna Yadav, Tej Pal, Pankaj Gupta

机构 * Postgraduate Institute of Medical Education and Research(医学教育与研究研究生院) Tata Medical Center(塔塔医学中心) All India Institute of Medical Sciences(全印度医学科学研究所) National Cancer Institute(国家癌症研究所) Banaras Hindu University(巴纳尔斯·胡斯·印度大学) Aster Malabar Institute of Medical Sciences(Aster马拉巴医学科学研究所)

专题命中 评测与基准 :language model(title,abstract);small language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了多RADS合成放射学报告数据集RXL-RADSet,并比较了41种开源和专有语言模型在RADS分配任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03194 2026-01-07 cs.CL 85%

X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework

X-MuTeST:一个用于可解释仇恨言论检测的多语言基准及一种新颖的LLM咨询解释框架

Mohammad Zia Ur Rehman, Sai Kartheek Reddy Kasu, Shashivardhan Reddy Koppula, Sai Rithwik Reddy Chirra, Shwetank Shekhar Singh, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院Indore) Indian Institute of Information Technology Dharwad(印度信息科技学院Dharwad) Arizona State University(亚利桑那州立大学) Indian Institute of Technology Mandi(印度理工学院Mandi)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 X-MuTeST提出一种结合LLM和传统技术的多语言仇恨言论检测框架,通过人类注释的解释提升分类性能和可解释性。

Comments Accepted in the proceedings of AAAI 2026

Journal ref AAA 2026 (AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03251 2026-01-07 cs.SE 85%

NavAI: A Generalizable LLM Framework for Navigation Tasks in Virtual Reality Environments

NavAI: 一种适用于虚拟现实环境导航任务的通用大语言模型框架

Xue Qin, Matthew DiGiovanni

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 NavAI是一种基于大语言模型的通用导航框架,能够有效支持虚拟现实环境中的基础动作和复杂目标导向任务,实验显示其在目标导向任务中达到89%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 85%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10449 2026-01-07 cs.AI cs.CL cs.CR 84%

When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection

当拒绝转为接受:量化基于LLM的科学评审员对间接提示注入的脆弱性

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Jahnvi Singh, Vinay Chamola, Yash Sinha, Murari Mandal, Dhruv Kumar

机构 * BITS Pilani KIIT University(KIIT大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究量化了基于LLM的科学评审系统对间接提示注入攻击的脆弱性,揭示了通过隐藏文本注入和布局感知攻击翻转评审决定的风险,并提出WAVS指标评估此类攻击的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03103 2026-01-07 cs.CL cs.AI 82%

Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs

谁与谁一起笑?在用户集群和LLMs中解构影响幽默偏好的因素

Soichiro Murakami, Hidetaka Kamigaito, Hiroya Takamura, Manabu Okumura

机构 * CyberAgent Nara Institute of Science and Technology(奈良科学技術研究所) Institute of Science Tokyo(东京科学研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过聚类和LLM提示解构幽默偏好影响因素,展示用户集群与LLM偏好之间的关联及可调节性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02858 2026-01-07 cs.CL 81%

To Generate or Discriminate? Methodological Considerations for Measuring Cultural Alignment in LLMs

是生成还是判别?衡量LLM文化契合度的方法论考虑

Saurabh Kumar Pandey, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过反向社会人口提示方法探讨LLM文化契合度测量问题,发现真实行为表现优于模拟行为,但个体层面个性化存在局限。

Comments IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03181 2026-01-07 cs.NI cs.AI cs.CL cs.CV 81%

Multi-Modal Data-Enhanced Foundation Models for Prediction and Control in Wireless Networks: A Survey

多模态数据增强的基础模型用于无线网络中的预测与控制:综述

Han Zhang, Mohammad Farzanullah, Mohammad Ghassemi, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电子工程与计算机科学学院) Ericsson(埃里克森公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了多模态数据增强的基础模型在无线网络预测与控制中的应用,探讨了其在无线网络管理中的关键任务和未来发展方向。

Comments 5 figures, 7 tables, IEEE COMST

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02573 2026-01-07 cs.LG cs.AI cs.CE 81%

LendNova: Towards Automated Credit Risk Assessment with Language Models

LendNova:迈向利用语言模型进行自动信用风险评估

Kiarash Shamsi, Danijel Novokmet, Joshua Peters, Mao Lin Liu, Paul K Edwards, Vahab Khoshdel

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LendNova利用语言模型实现自动信用风险评估,通过直接处理原始信用记录文本,无需手动特征工程,提高准确性和可扩展性。

Journal ref AAAI 2026, Workshop on Agentic AI in Financial Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02427 2026-01-07 cs.CV cs.AI cs.LG 81%

NitroGen: An Open Foundation Model for Generalist Gaming Agents

NitroGen:一种通用游戏代理的开源基础模型

Loïc Magne, Anas Awadalla, Guanzhi Wang, Yinzhen Xu, Joshua Belofsky, Fengyuan Hu, Joohwan Kim, Ludwig Schmidt, Georgia Gkioxari, Jan Kautz, Yisong Yue, Yejin Choi, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA Stanford(斯坦福大学) Caltech(加州理工学院) UChicago(芝加哥大学) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 NitroGen通过大规模行为克隆训练,实现跨游戏泛化能力,提升任务成功率达52%

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03278 2026-01-07 cs.DB cs.AI 80%

Thucy: An LLM-based Multi-Agent System for Claim Verification across Relational Databases

Thucy:基于LLM的多智能体系统,用于跨关系数据库的声明验证

Michael Theologitis, Dan Suciu

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 Thucy是一种基于LLM的多智能体系统,能够跨关系数据库验证声明,并提供支持裁定的SQL查询,准确率达94.3%。

Comments Accepted at AAAI 2026 Workshop on LLM-based Multi-Agent Systems (LaMAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI 79%

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03144 2026-01-07 cs.CL cs.AI 79%

Self-Verification is All You Need To Pass The Japanese Bar Examination

自我验证就是通过日本司法考试所需

Andrew Shin

机构 * Keio University(.keio大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。

Comments https://github.com/shinandrew/self_verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02514 2026-01-07 cs.AI 77%

Textual Explanations and Their Evaluations for Reinforcement Learning Policy

强化学习策略的文本解释及其评估

Ahmad Terra, Mohit Ahmed, Rafia Inam, Elena Fersman, Martin Törngren

机构 * Ericsson Research(爱立信研究) Ericsson AB(爱立信公司) KTH Royal Institute of Technology(皇家理工学院) Uppsala University(乌普萨拉大学) Global AI Accelerator(全球人工智能加速器) Ericsson Inc.(爱立信公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的XRL框架,通过生成文本解释并转换为透明规则,提升解释质量并进行评估,以解决现有方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07261 2026-01-07 cs.CR cs.LG 77%

MemHunter: Automated and Verifiable Memorization Detection at Dataset-scale in LLMs

MemHunter: 在大规模数据集上实现LLM的记忆检测的自动化与可验证方法

Zhenpeng Wu, Jian Lou, Zibin Zheng, Chuan Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MemHunter通过训练记忆诱导模型并利用假设检验,在数据集层面高效检测LLM的记忆行为,提升隐私风险评估能力。

Comments Withdrawn by the authors due to an inconsistency in the reported base model: Section 4 (Experiments) states "Llama-2-7B" while Fig. 3 labels "Llama-2-7B-Chat". Because this affects the experimental configuration, parts of the results must be re-verified by rerunning experiments; we withdraw to avoid misleading readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15125 2026-01-07 cs.CL cs.AI cs.CY cs.LG cs.SI 75%

Iterative Topic Taxonomy Induction with LLMs: A Case Study of Electoral Advertising

基于大语言模型的迭代主题分类诱导:选举广告案例研究

Alexander Brady, Tunazzina Islam

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系) Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于大语言模型的迭代主题分类方法,通过选举广告案例验证,实现了无需预定义标签的自动主题分类,并在人类评估中表现出更一致和可解释的结果。

Comments Under-submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 75%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02362 2026-01-07 cs.IR cs.AI 74%

The Impact of LLM-Generated Reviews on Recommender Systems: Textual Shifts, Performance Effects, and Strategic Platform Control

大语言模型生成的评论对推荐系统的影响:文本变化、性能影响和平台控制策略

Itzhak Ziv, Moshe Unger, Hilah Geva

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究探讨了大语言模型生成的评论对推荐系统的影响,发现人工数据在性能上优于AI生成内容,并强调平台控制在管理AI生成评论中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏