arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-31 至 2025-10-31 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 48 篇

2408.10455 2025-10-31 cs.CL cs.AI 90%

IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abduction

Kaiyu He, Mian Zhang, Shuo Yan, Peilin Wu, Zhiyu Zoey Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系德克萨斯大学达拉斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26484 2025-10-31 cs.CL cs.AI 90%

Bayesian Network Fusion of Large Language Models for Sentiment Analysis

Rasoul Amirzadeh, Dhananjay Thiruvady, Fatemeh Shiri

机构 * School of Information Technology, Deakin University(德克萨斯大学信息技术学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算机技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26422 2025-10-31 cs.CL 89%

OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education

Min Zhang, Hao Chen, Hao Chen, Wenqi Zhang, Didi Zhu, Xin Lin, Bo Jiang, Aimin Zhou, Fei Wu, Kun Kuang

机构 * East China Normal University(东华师范大学) Zhejiang University(浙江大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08604 2025-10-31 cs.CL cs.AI cs.LG 89%

LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback

Raffaele Mura, Giorgio Piras, Kamilė Lukošiūtė, Maura Pintor, Amin Karbasi, Battista Biggio

机构 * University of Cagliari(卡利亚里大学) Centre for AI Governance(人工智能治理中心) Foundation AI – Cisco Systems Inc.(AI基金会——思科系统公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20945 2025-10-31 cs.CR 89%

IRCopilot: Automated Incident Response with Large Language Models

Xihuan Lin, Jie Zhang, Gelei Deng, Tianzhe Liu, Tianwei Zhang, Qing Guo, Riqing Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15066 2025-10-31 cs.HC cs.CY 89%

Constraining Participation: Affordances of Feedback Features in Interfaces to Large Language Models

Ned Cooper, Alexandra Zafiroglu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Version accepted for publication

Journal ref ACM Journal on Responsible Computing, Volume 2, Issue 4, Article 16 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26543 2025-10-31 cs.CL cs.AI cs.LG 88%

The Structure of Relation Decoding Linear Operators in Large Language Models

Miranda Anna Christ, Adrián Csiszárik, Gergely Becsó, Dániel Varga

机构 * Fazekas Mihály High School(法泽卡米哈伊高中) HUN-REN Alfréd Rényi Insititute of Mathematics(HUN-REN阿弗雷德·雷尼数学研究所) Eötvös Loránd University(欧多布查伊·劳尔大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11094 2025-10-31 cs.CV 88%

Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space

Weichen Zhang, Zile Zhou, Xin Zeng, Xuchen Liu, Jianjie Fang, Chen Gao, Yong Li, Jinqiang Cui, Xinlei Chen, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26238 2025-10-31 cs.AI 87%

Questionnaire meets LLM: A Benchmark and Empirical Study of Structural Skills for Understanding Questions and Responses

Duc-Hai Nguyen, Vijayakumar Nanjappan, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 14 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24014 2025-10-31 cs.CL 86%

TEXT2DB: Integration-Aware Information Extraction with Large Language Model Agents

Yizhu Jiao, Sha Li, Sizhe Zhou, Heng Ji, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Source code: https://github.com/yzjiao/Text2DB

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01543 2025-10-31 cs.AI 85%

Refine-n-Judge: Curating High-Quality Preference Chains for LLM-Fine-Tuning

Derin Cayir, Renjie Tao, Rashi Rungta, Kai Sun, Sean Chen, Haidar Khan, Minseok Kim, Julia Reinspach, Yue Liu

机构 * Florida International University(佛罗里达国际大学) Meta Reality Labs(Meta现实实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26309 2025-10-31 cs.AI cs.IR 85%

GraphCompliance: Aligning Policy and Context Graphs for LLM-Based Regulatory Compliance

Jiseong Chung, Ronny Ko, Wonchul Yoo, Makoto Onizuka, Sungmok Kim, Tae-Wan Kim, Won-Yong Shin

机构 * Seoul National University(首尔国立大学) Osaka University(大阪大学) Yonsei University(延世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Under review at The Web Conference 2026 (Semantics & Knowledge track). Code will be released upon acceptance. This arXiv v1 contains no repository links to preserve double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25536 2025-10-31 cs.CL 85%

TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation

Bangde Du, Minghao Guo, Songming He, Ziyi Ye, Xi Zhu, Weihang Su, Shuqi Zhu, Yujia Zhou, Yongfeng Zhang, Qingyao Ai, Yiqun Liu

机构 * Tsinghua University(清华大学) Rutgers University(罗格斯大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Main paper: 11 pages, 3 figures, 6 tables. Appendix: 28 pages. Bangde Du and Minghao Guo contributed equally. Corresponding authors: Ziyi Ye (ziyiye@fudan.edu.cn), Qingyao Ai (aiqy@tsinghua.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11695 2025-10-31 cs.CL 85%

When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents

Lingfei Qian, Xueqing Peng, Yan Wang, Vincent Jim Zhang, Huan He, Hanley Smith, Yi Han, Yueru He, Haohang Li, Yupeng Cao, Yangyang Yu, Alejandro Lopez-Lira, Peng Lu, Jian-Yun Nie, Guojun Xiong, Jimin Huang, Sophia Ananiadou

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Florida(佛罗里达大学) Harvard University(哈佛大学) National Centre for Text Mining, University of Manchester(曼彻斯特大学文本挖掘中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04953 2025-10-31 cs.CL cs.AI 84%

M-Prometheus: A Suite of Open Multilingual LLM Judges

José Pombal, Dongkeun Yoon, Patrick Fernandes, Ian Wu, Seungone Kim, Ricardo Rei, Graham Neubig, André F. T. Martins

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26052 2025-10-31 cs.CV cs.AI 83%

Dynamic VLM-Guided Negative Prompting for Diffusion Models

Hoyeon Chang, Seungjin Kim, Yoonseok Choi

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract);分类 cs.AI

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: The First Workshop on Generative and Protective AI for Content Creation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26647 2025-10-31 math.OC 82%

Accelerating mathematical research with language models: A case study of an interaction with GPT-5-Pro on a convex analysis problem

Adil Salim

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26634 2025-10-31 cs.SE 82%

Stitch: Step-by-step LLM Guided Tutoring for Scratch

Yuan Si, Kyle Qi, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26732 2025-10-31 cs.AI cs.CL 81%

Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models

J. de Curtò, I. de Zarzà, Pablo García, Jordi Cabot

机构 * BARCELONA Supercomputing Center (BSC)(巴塞罗那超级计算中心) LUXEMBOURG Institute of Science(卢森堡科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25904 2025-10-31 cs.CL cs.AI 81%

Evaluating the Impact of LLM-Assisted Annotation in a Perspectivized Setting: the Case of FrameNet Annotation

Frederico Belcavello, Ely Matos, Arthur Lorenzi, Lisandra Bonoto, Lívia Ruiz, Luiz Fernando Pereira, Victor Herbst, Yulla Navarro, Helen de Andrade Abreu, Lívia Dutra, Tiago Timponi Torrent

机构 * Federal University of Juiz de Fora(弗雷德里克大学) Gothenburg University(哥德堡大学) Brazilian National Council for Scientific and Technological Development - CNPq(巴西科学与技术发展国家委员会 - CNPq)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15095 2025-10-31 cs.CL cs.AI 81%

Nek Minit: Harnessing Pragmatic Metacognitive Prompting for Explainable Sarcasm Detection of Australian and Indian English

Ishmanbir Singh, Dipankar Srirag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.CL、cs.AI

Comments ALTA 2025 (Best Paper Honorable Mention). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01001 2025-10-31 cs.CL cs.AI 81%

Zero-shot Benchmarking: A Framework for Flexible and Scalable Automatic Evaluation of Language Models

José Pombal, Nuno M. Guerreiro, Ricardo Rei, André F. T. Martins

机构 * Unbabel Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、CentraleSupélec、巴黎萨克雷大学) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02820 2025-10-31 cs.AI cs.CL cs.LG 80%

AutoLibra: Agent Metric Induction from Open-Ended Human Feedback

Hao Zhu, Phil Cuvin, Xinkai Yu, Charlotte Ka Yee Yan, Jason Zhang, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

Comments https://github.com/Open-Social-World/autolibra

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26769 2025-10-31 cs.CV cs.LG 79%

SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models

Anushka Sivakumar, Andrew Zhang, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25054 2025-10-31 cs.CL eess.AS 79%

Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech

Pedro Corrêa, João Lima, Victor Moreno, Lucas Ueda, Paula Dornhofer Paro Costa

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Submitted to IEEE ICASSP 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26124 2025-10-31 cs.CL 77%

On the Influence of Discourse Relations in Persuasive Texts

Nawar Turk, Sevag Kaspar, Leila Kosseim

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in Proceedings of the 38th Canadian Conference on Artificial Intelligence CanAI 2025 Calgary Alberta May 26-27 2025. 5 figures 7 tables

Journal ref Proceedings of the 38th Canadian Conference on Artificial Intelligence CanAI 2025 Canadian Artificial Intelligence Association Article ID 2025L162 Calgary Canada May 26-27 2025 Published online at https://caiac.pubpub.org/pub/p99aab5q/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26086 2025-10-31 cs.LG 77%

LLMBisect: Breaking Barriers in Bug Bisection with A Comparative Analysis Pipeline

Zheng Zhang, Haonan Li, Xingyu Li, Hang Zhang, Zhiyun Qian

机构 * University of California, Riverside(加州大学河滨分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25820 2025-10-31 cs.AI cs.HC 77%

Symbolically Scaffolded Play: Designing Role-Sensitive Prompts for Generative NPC Dialogue

Vanessa Figueiredo, David Elumeze

机构 * ExplorAI, Department of Computer Science, University of Regina(ExplorAI,计算机科学系,里嘉大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26228 2025-10-31 q-fin.PM q-fin.PR 75%

ChatGPT in Systematic Investing -- Enhancing Risk-Adjusted Returns with LLMs

Nikolas Anic, Andrea Barbon, Ralf Seiz, Carlo Zarattini

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26480 2025-10-31 cs.SE 75%

Automated Extract Method Refactoring with Open-Source LLMs: A Comparative Study

Sivajeet Chand, Melih Kilic, Roland Würsching, Sushant Kumar Pandey, Alexander Pretschner

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at AIware'25 - Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏