arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-15 至 2025-09-15 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31 篇

2509.09724 2025-09-15 cs.CL cs.AI cs.LG 91%

DiTTO-LLM: Framework for Discovering Topic-based Technology Opportunities via Large Language Model

Wonyoung Kim, Sujeong Seo, Juhyun Lee

机构 * Department of Library and Information Science(图书馆与信息科学系) Chung-Ang University(Chung-Ang 大学) Insurance Strategy Planning Team(保险战略规划团队) Postal Savings & Insurance Development Institute(邮政储蓄与保险发展研究所) Future Technology Analysis Center(未来技术分析中心) Korea Institute of Science and Technology Information(韩国科学技术信息院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI、cs.LG

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09709 2025-09-15 cs.CL cs.AI 90%

Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement

Jing Ren, Weiqi Wang

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09918 2025-09-15 cs.SE cs.AI 88%

WALL: A Web Application for Automated Quality Assurance using Large Language Models

Seyed Moein Abtahi, Akramul Azim

机构 * Faculty of Engineering(工程学院) Applied Science Ontario Tech University(应用科学Ontario技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20241 2025-09-15 cs.CL 88%

Reframe Your Life Story: Interactive Narrative Therapist and Innovative Moment Assessment with Large Language Models

Yi Feng, Jiaqi Wang, Wenxuan Zhang, Zhuang Chen, Yutong Shen, Xiyao Xiao, Minlie Huang, Liping Jing, Jian Yu

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) CoAI Group(CoAI集团) DCST(国防科技大学) IAI(人工智能院) BNRIST(北航机器人与智能技术研究院) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Singapore University of Technology and Design(新加坡科技与设计大学) Central South University(中南大学) Lingxin AI(灵犀AI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09912 2025-09-15 cs.CY cs.CR 87%

When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review

Changjia Zhu, Junjie Xiong, Renkai Ma, Zhicong Lu, Yao Liu, Lingyao Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09740 2025-09-15 q-bio.QM cs.AI cs.CL cs.LG 87%

HypoGeneAgent: A Hypothesis Language Agent for Gene-Set Cluster Resolution Selection Using Perturb-seq Datasets

Ying Yuan, Xing-Yue Monica Ge, Aaron Archer Waterman, Tommaso Biancalani, David Richmond, Yogesh Pandit, Avtar Singh, Russell Littman, Jin Liu, Jan-Christian Huetter, Vladimir Ermakov

专题命中 评测与基准 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09707 2025-09-15 cs.NE cs.AI cs.CL 86%

LLM-Based Instance-Driven Heuristic Bias In the Context of a Biased Random Key Genetic Algorithm

Camilo Chacón Sartori, Martín Isla Pino, Pedro Pinacho-Davidson, Christian Blum

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Submitted to a journal for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09706 2025-09-15 cs.CR cs.AI cs.CL 86%

Differential Robustness in Transformer Language Models: Empirical Evaluation Under Adversarial Text Attacks

Taniya Gidatkar, Oluwaseun Ajao, Matthew Shardlow

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 tables, to appear in proceedings of Recent Advances in Natural Language Processing (RANLP 2025) and ACL Anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09975 2025-09-15 cs.SE 86%

Development of Automated Software Design Document Review Methods Using Large Language Models

Takasaburo Fukuda, Takao Nakagawa, Keisuke Miyazaki, Susumu Tokumoto

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments SANER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09970 2025-09-15 cs.CR cs.AI 85%

Securing LLM-Generated Embedded Firmware through AI Agent-Driven Validation and Patching

Seyed Moein Abtahi, Akramul Azim

机构 * Faculty of Engineering(工程学院) Applied Science Ontario Tech University(应用科学奥尔巴尼技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10402 2025-09-15 cs.SE 85%

Developer-LLM Conversations: An Empirical Study of Interactions and Generated Code Quality

Suzhen Zhong, Ying Zou, Bram Adams

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09928 2025-09-15 cs.CE 85%

Fraud detection and risk assessment of online payment transactions on e-commerce platforms based on LLM and GCN frameworks

RuiHan Luo, Nanxi Wang, Xiaotong Zhu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11829 2025-09-15 cs.CL cs.AI 84%

Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation

Julia Kreutzer, Eleftheria Briakou, Sweta Agrawal, Marzieh Fadaee, Kocmi Tom

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13335 2025-09-15 cs.CL 83%

Comparing Apples to Oranges: A Dataset & Analysis of LLM Humour Understanding from Traditional Puns to Topical Jokes

Tyler Loakman, William Thorne, Chenghua Lin

机构 * Department of Computer Science, The University of Sheffield, UK(谢菲尔德大学计算机科学系) Department of Computer Science, The University of Manchester, UK(曼彻斯特大学计算机科学系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09734 2025-09-15 cs.CL cs.AI cs.LG 82%

MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools

Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16708 2025-09-15 cs.CL 81%

Atomic Fact Decomposition Helps Attributed Question Answering

Zhichao Yan, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * School of Computer and Information Technology, Shanxi University(山西大学计算机与信息学院) Beijing Key Laboratory of Multimedia and Intelligent Software Technology, Beijing Institute of Artificial Intelligence, School of Information Science and Technology, Beijing University of Technology(北京人工智能研究院多媒体与智能软件技术重点实验室,北京理工大学信息科学技术学院) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) ILCC, School of Informatics, University of Edinburgh(爱丁堡大学信息学院ILCC)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10151 2025-09-15 cs.LG cs.AI 81%

BenchECG and xECG: a benchmark and baseline for ECG foundation models

Riccardo Lunelli, Angus Nicolson, Samuel Martin Pröll, Sebastian Johannes Reinstadler, Axel Bauer, Clemens Dlaska

机构 * Digital Cardiology Lab, University Clinic of Internal Medicine III(数字心脏病学实验室,内科第三临床学院) Medical University Innsbruck(因斯布鲁克医学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 32 pages, 4 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09704 2025-09-15 cs.CL cs.AI cs.CY 81%

Temporal Preferences in Language Models for Long-Horizon Assistance

Ali Mazyaki, Mohammad Naghizadeh, Samaneh Ranjkhah Zonouzaghi, Hossein Setareh

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10278 2025-09-15 cs.CV 78%

Detecting Text Manipulation in Images using Vision Language Models

Vidit Vidit, Pavel Korshunov, Amir Mohammadi, Christophe Ecabert, Ketan Kotwal, Sébastien Marcel

机构 * IDIAP Research Institute(IDIAP研究 institute)

专题命中 评测与基准 :language model(title,abstract)

Comments Accepted in Synthetic Realities and Biometric Security Workshop BMVC-2025. For paper page see https://www.idiap.ch/paper/textvlmdet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10010 2025-09-15 cs.CL cs.HC 77%

Multi-Intent Recognition in Dialogue Understanding: A Comparison Between Smaller Open-Source LLMs

Adnan Ahmad, Philine Kowol, Stefan Hillmann, Sebastian Möller

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03897 2025-09-15 cs.CV cs.CL 77%

SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation

Xiaofu Chen, Israfel Salazar, Yova Kementchedjhieva

机构 * MBZUAI University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18889 2025-09-15 cs.CL 77%

Are LLMs Better than Reported? Detecting Label Errors and Mitigating Their Effect on Model Performance

Omer Nahum, Nitay Calderon, Orgad Keller, Idan Szpektor, Roi Reichart

机构 * Technion - Institute of Technology(技术学院-理工学院) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09728 2025-09-15 cs.CL cs.LG stat.AP 76%

A meta-analysis on the performance of machine-learning based language models for sentiment analysis

Elena Rohde, Jonas Klingwort, Christian Borgs

机构 * Institute of Sociology, Faculty of Social Sciences University of Duisburg-Essen(杜伊斯堡-埃森大学社会学院) Department of Research & Development, Statistics Netherlands (CBS)(荷兰统计局(CBS)研究与发展部门) IT.NRW – Statistical Office of NRW(北莱茵-威斯特法伦统计局)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12405 2025-09-15 cs.CL cs.AI 76%

The power of text similarity in identifying AI-LLM paraphrased documents: The case of BBC news articles and ChatGPT

Konstantinos Xylogiannopoulos, Petros Xanthopoulos, Panagiotis Karampelas, Georgios Bakamitsos

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09735 2025-09-15 cs.CL 70%

Discrimination by LLMs: Cross-lingual Bias Assessment and Mitigation in Decision-Making and Summarisation

Willem Huijzer, Jieying Chen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10899 2025-09-15 cs.LG 70%

A Dataset for Distilling Knowledge Priors from Literature for Therapeutic Design

Haydn Thomas Jones, Natalie Maus, Josh Magnus Ludan, Maggie Ziyu Huan, Jiaming Liang, Marcelo Der Torossian Torres, Jiatao Liang, Zachary Ives, Yoseph Barash, Cesar de la Fuente-Nunez, Jacob R. Gardner, Mark Yatskar

专题命中 评测与基准 :LLM(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17310 2025-09-15 cs.CR cs.ET 67%

Advancing Security with Digital Twins: A Comprehensive Survey

Blessing Airehenbuwa, Touseef Hasan, Souvika Sarkar, Ujjwal Guin

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09722 2025-09-15 cs.CV cs.CL cs.LG 62%

Improving MLLM Historical Record Extraction with Test-Time Image

Taylor Archibald, Tony Martinez

机构 * Brigham Young University

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11528 2025-09-15 cs.RO cs.AI cs.LG 62%

LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation

Yuhang Huang, Jiazhao Zhang, Shilong Zou, Xinwang Liu, Ruizhen Hu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09772 2025-09-15 cs.LG stat.AP 57%

Hybrid Adaptive Conformal Offline Reinforcement Learning for Fair Population Health Management

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, Rajaie Batniji

机构 * Waymark, San Francisco, CA, USA(Waymark) San Francisco General Hospital, University of California San Francisco, San Francisco, CA, USA(旧金山通用医院,加州大学旧金山分校) University of California San Francisco, San Francisco, CA, USA(加州大学旧金山分校) University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.LG

Comments 10 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏