arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-18 至 2025-08-18 共收录 108 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 22 篇

2508.11305 2025-08-18 cs.SE 80%

Defects4Log: Benchmarking LLMs for Logging Code Defect Detection and Reasoning

Xin Wang, Zhenhao Li, Zishuo Ding

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11067 2025-08-18 cs.CY 78%

Bias is a Math Problem, AI Bias is a Technical Problem: 10-year Literature Review of AI/LLM Bias Research Reveals Narrow [Gender-Centric] Conceptions of 'Bias', and Academia-Industry Gap

Sourojit Ghosh, Kyra Wilson

专题命中 推理与问题求解 :LLM(title,abstract)

Comments Upcoming Publication, AIES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17593 2025-08-18 cs.HC cs.AI 77%

JELAI: Integrating AI and Learning Analytics in Jupyter Notebooks

Manuel Valle Torre, Thom van der Velden, Marcus Specht, Catharine Oertel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted for AIED 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09630 2025-08-18 cs.LG cs.AI 73%

TimeMKG: Knowledge-Infused Causal Reasoning for Multivariate Time Series Modeling

Yifei Sun, Junming Liu, Yirong Chen, Xuefeng Yan, Ding Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03807 2025-08-18 cs.AI cs.CL cs.RO 73%

Tool-Planner: Task Planning with Clusters across Multiple Tools

Yanming Liu, Xinyue Peng, Jiannan Cao, Yuwei Zhang, Xuhong Zhang, Sheng Cheng, Xun Wang, Jianwei Yin, Tianyu Du

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ICLR 2025 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11429 2025-08-18 cs.CL 70%

HumorPlanSearch: Structured Planning and HuCoT for Contextual AI Humor

Shivam Dubey

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11260 2025-08-18 cs.CL 70%

UNVEILING: What Makes Linguistics Olympiad Puzzles Tricky for LLMs?

Mukund Choudhary, KV Aditya Srivatsa, Gaurja Aeron, Antara Raaghavi Bhattacharya, Dang Khoa Dang Dinh, Ikhlasul Akmal Hanif, Daria Kotova, Ekaterina Kochmar, Monojit Choudhury

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学) IIT Gandhinagar(印度加尔各答理工学院) Harvard University(哈佛大学) VinUniversity(文大学) Universitas Indonesia(印度尼西亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11027 2025-08-18 cs.CL 70%

Hell or High Water: Evaluating Agentic Recovery from External Failures

Andrew Wang, Sophia Hager, Adi Asija, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(abstract);language agent(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11021 2025-08-18 cs.CV cs.CL 70%

Can Multi-modal (reasoning) LLMs detect document manipulation?

Zisheng Liang, Kidus Zewde, Rudra Pratap Singh, Disha Patil, Zexi Chen, Jiayu Xue, Yao Yao, Yifei Chen, Qinzhe Liu, Simiao Ren

机构 * Duke University(杜克大学) Indian Institute of Technology, Roorkee(印度理工学院,罗尔基) New York University(纽约大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Columnbia University(哥伦比亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2503.20084

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16502 2025-08-18 cs.CL 70%

RULEBREAKERS: Challenging LLMs at the Crossroads between Formal Logic and Human-like Reasoning

Jason Chan, Robert Gaizauskas, Zhixue Zhao

机构 * University of Sheffield, Sheffield, UK(谢菲尔德大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10833 2025-08-18 cs.CV 67%

UI-Venus Technical Report: Building High-performance UI Agents with RFT

Zhangxuan Gu, Zhengwen Zeng, Zhenyu Xu, Xingran Zhou, Shuheng Shen, Yunfei Liu, Beitong Zhou, Changhua Meng, Tianyu Xia, Weizhi Chen, Yue Wen, Jingya Dou, Fei Tang, Jinzhen Lin, Yulin Liu, Zhenlin Guo, Yichen Gong, Heng Jia, Changlong Gao, Yuan Guo, Yong Deng, Zhenyu Guo, Liang Chen, Weiqiang Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 30 篇

2506.06371 2025-08-18 cs.CL 89%

Relationship Detection on Tabular Data Using Statistical Analysis and Large Language Models

Panagiotis Koletsis, Christos Panagiotopoulos, Georgios Th. Papadopoulos, Vasilis Efthymiou

机构 * Harokopio University(哈罗科波斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08688 2025-08-18 cs.CL cs.AI 89%

The Fellowship of the LLMs: Multi-Model Workflows for Synthetic Preference Optimization Dataset Generation

Samee Arif, Sualeha Farid, Abdul Hameed Azeemi, Awais Athar, Agha Ali Raza

机构 * Lahore University of Management Sciences(拉合尔管理科学大学) University of Michigan - Ann Arbor(密歇根大学安娜堡分校) EMBL European Bioinformatics Institute(欧洲生物信息学研究所) Strategize Inc(Strategize公司)

专题命中 评测与基准 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10922 2025-08-18 cs.CV 88%

A Survey on Video Temporal Grounding with Multimodal Large Language Model

Jianlong Wu, Wei Liu, Ye Liu, Meng Liu, Liqiang Nie, Zhouchen Lin, Chang Wen Chen

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 20 pages,6 figures,survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18013 2025-08-18 cs.CL cs.AI 86%

A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems

Zihao Yi, Jiarui Ouyang, Zhe Xu, Yuwen Liu, Tianhao Liao, Haohao Luo, Ying Shen

机构 * Sun Yat-Sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 35 pages, 10 figures, ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11061 2025-08-18 cs.CL 85%

BIPOLAR: Polarization-based granular framework for LLM bias evaluation

Martin Pavlíček, Tomáš Filip, Petr Sosík

机构 * Institute for Research and Applications of Fuzzy Modeling, University of Ostrava(模糊建模研究与应用研究所,奥斯特拉瓦大学) Institute of Computer Science, Faculty of Philosophy and Science, Silesian University in Opava(计算机科学研究所,哲学与科学学院,奥帕瓦西里西亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11736 2025-08-18 cs.CL 85%

Personalized LLM for Generating Customized Responses to the Same Query from Different Users

Hang Zeng, Chaoyue Niu, Fan Wu, Chengfei Lv, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by CIKM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08536 2025-08-18 cs.CV 82%

SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level prompting

Pallavi Jain, Dino Ienco, Roberto Interdonato, Tristan Berchoux, Diego Marcos

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农业研究院-CIHEAM-IAMM) Inria(法国国家信息与自动化技术研究院) INRAE(法国国家农业研究咨询中心) Cirad(国际热带农业研究中心) UMR TETIS(TETIS联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract)

Comments Accepted at WACV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10927 2025-08-18 cs.CL cs.AI cs.CE cs.LG 80%

Modeling and Detecting Company Risks from News: A Case Study in Bloomberg News

Jiaxin Pei, Soumya Vadlamannati, Liang-Kang Huang, Daniel Preotiuc-Pietro, Xinyu Hua

机构 * University of Michigan(密歇根大学) Bloomberg(彭博)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref NAACL 2024: Human Language Technologies (Volume 6:Industry Track), pages 63 : 72

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11536 2025-08-18 cs.CL 79%

Language models align with brain regions that represent concepts across modalities

Maria Ryskina, Greta Tuckute, Alexander Fung, Ashley Malkin, Evelina Fedorenko

机构 * Vector Institute for AI(向量人工智能研究所) MIT(麻省理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted to COLM 2025. Code and data can be found at https://github.com/ryskina/concepts-brain-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11341 2025-08-18 cs.CV cs.CR cs.LG 79%

Semantically Guided Adversarial Testing of Vision Models Using Language Models

Katarzyna Filus, Jorge M. Cruz-Duarte

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所) University of Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL(里尔大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

Comments 12 pages, 4 figures, 3 tables. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11262 2025-08-18 cs.CV cs.AI 79%

Vision-Language Models display a strong gender bias

Aiswarya Konavoor, Raj Abhijit Dandekar, Rajat Dandekar, Sreedath Panat

机构 * Togo AI Labs(Togo人工智能实验室) Vizuara AI Labs(Vizuara人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10972 2025-08-18 cs.CV cs.AI cs.HC 79%

Not There Yet: Evaluating Vision Language Models in Simulating the Visual Perception of People with Low Vision

Rosiana Natalie, Wenqian Xu, Ruei-Che Chang, Rada Mihalcea, Anhong Guo

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10541 2025-08-18 cs.LG q-bio.QM 79%

Driving Accurate Allergen Prediction with Protein Language Models and Generalization-Focused Evaluation

Brian Shing-Hei Wong, Joshua Mincheol Kim, Sin-Hang Fung, Qing Xiong, Kelvin Fu-Kiu Ao, Junkang Wei, Ran Wang, Dan Michelle Wang, Jingying Zhou, Bo Feng, Alfred Sze-Lok Cheng, Kevin Y. Yip, Stephen Kwok-Wing Tsui, Qin Cao

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

Comments 59 pages, 5 main figures, 15 supplementary figures, 2 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09346 2025-08-18 cs.CV cs.AI 79%

B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions

Hao Zhang, Wenqi Shao, Hong Liu, Yongqiang Ma, Ping Luo, Yu Qiao, Nanning Zheng, Kaipeng Zhang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Osaka University(大阪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Accepted by IEEE Transactions on Information Forensics & Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11383 2025-08-18 cs.CL cs.AI 79%

When Punctuation Matters: A Large-Scale Comparison of Prompt Robustness Methods for LLMs

Mikhail Seleznyov, Mikhail Chaichuk, Gleb Ershov, Alexander Panchenko, Elena Tutubalina, Oleg Somov

机构 * AIRI Skoltech(斯克里普切尔技术大学) Yandex MIPT(莫斯科理工学院) HSE University(俄罗斯高等经济大学) Sber AI ISP RAS Research Center for Trusted AI(俄罗斯科学院信息与系统问题研究所可信AI研究中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11310 2025-08-18 cs.CL cs.AI cs.IR 79%

SGSimEval: A Comprehensive Multifaceted and Similarity-Enhanced Benchmark for Automatic Survey Generation Systems

Beichen Guo, Zhiyuan Wen, Yu Yang, Peng Gao, Ruosong Yang, Jiaxing Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) China Mobile (Hong Kong) Innovation and Research Institute(中国移动(香港)创新与研究院) Lingnan University(岭南大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to The 21st International Conference on Advanced Data Mining and Applications (ADMA2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11317 2025-08-18 cs.CV cs.MM 78%

Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models

Yuchen Zhou, Jiayu Tang, Shuo Yang, Xiaoyan Xiao, Yuqin Dai, Wenhao Yang, Chao Gou, Xiaobo Xia, Tat-Seng Chua

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10906 2025-08-18 cs.CL 77%

PersonaTwin: A Multi-Tier Prompt Conditioning Framework for Generating and Evaluating Personalized Digital Twins

Sihan Chen, John P. Lalor, Yi Yang, Ahmed Abbasi

机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) Human-centered Analytics Lab, University of Notre Dame(诺特大学人本分析实验室) Department of IT, Analytics, and Operations, University of Notre Dame(诺特大学信息技术、分析与运营部门) Department of Information Systems, Business Statistics and Operations Management, HKUST(香港科技大学信息系统、商业统计与运营管理部门)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Presented at the Generation, Evaluation & Metrics (GEM) Workshop at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05147 2025-08-18 cs.CR cs.LG 77%

Pr$εε$mpt: Sanitizing Sensitive Prompts for LLMs

Amrita Roy Chowdhury, David Glukhov, Divyam Anshumaan, Prasad Chalasani, Nicolas Papernot, Somesh Jha, Mihir Bellare

机构 * University of Michigan, Ann Arbor(密歇根大学安阿伯分校) University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Langroid Incorporated(Langroid公司) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏