arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-14 至 2026-01-14 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2601.08785 2026-01-14 cs.AI 89%

Uncovering Political Bias in Large Language Models using Parliamentary Voting Records

利用议会投票记录揭示大型语言模型中的政治偏见

Jieying Chen, Karen de Jong, Andreas Poole, Jan Burakowski, Elena Elderson Nosti, Joep Windt, Chendi Wang

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Oslo(奥斯陆大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文通过分析议会投票记录,揭示大型语言模型中的政治偏见,发现其左倾倾向及对右翼保守党的负面偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 88%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17899 2026-01-14 cs.CL 88%

Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation

大语言模型能识别隐含的自杀念头吗?一项实证评估

Tong Li, Shu Yang, Junchao Wu, Jiyao Wei, Lijie Hu, Mengdi Li, Derek F. Wong, Joshua R. Oltmanns, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology(卡瓦尔大学科学与技术大学) Washington University in St.Louis(圣路易斯华盛顿大学) University of Macau(澳门大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了大语言模型在识别隐含自杀念头和提供支持性回应方面的能力,发现现有模型存在显著局限,需更复杂的方法来改进心理健康应用。

Comments Dataset: https://huggingface.co/datasets/babytreecc/Implicit-suicide-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08107 2026-01-14 cs.LG cs.AI cs.SY eess.SY 86%

STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order

STO-RL:通过LLM引导的子目标时间顺序实现稀疏奖励下的离线RL

Chengyang Gu, Yuxin Pan, Hui Xiong, Yize Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 STO-RL通过LLM生成子目标时间顺序,结合潜在奖励塑造,提升稀疏奖励下离线RL的性能与稳定性。

Comments Accepted at International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 86%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08516 2026-01-14 cs.SD cs.CY eess.AS 86%

Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances

基于大语言模型时代的稳健CAPTCHA:从评估到进展

Ziqi Ding, Yunfeng Wan, Wei Song, Yi Liu, Gelei Deng, Nan Sun, Huadong Mo, Jingling Xue, Shidong Pan, Yuekang Li

专题命中 评测与基准 :language model(title,abstract);large language model(title)

AI总结 本文提出了一种基于音频 illusion 的新型CAPTCHA方法,通过利用人类听觉机制,有效对抗大语言模型和自动语音识别模型的攻击,显著提升CAPTCHA的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08196 2026-01-14 cs.CL cs.AI cs.CR cs.LO cs.SE 84%

Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis

通过逻辑引导合成评估LLM工具调用中的隐式监管合规性

Da Song, Yuheng Huang, Boqi Chen, Tianshuo Cong, Randy Goebel, Lei Ma, Foutse Khomh

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiSafetyGen框架,通过逻辑引导合成评估LLM在工具调用中的隐式监管合规性,揭示大模型在安全约束上的不足。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08176 2026-01-14 cs.CL cs.AI 82%

Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering

基于提示的清晰度评估与政治问答主题检测

Lavanya Prahallad, Sai Utkarsh Choudarypally, Pragna Prahallad, Pranathi Prahallad

机构 * Research Spark Hub Inc. Emerald High School

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于提示的清晰度评估与政治问答主题检测,发现思维链提示显著提升清晰度和主题识别准确性,但细粒度逃避检测仍具挑战性。

Comments 6 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11966 2026-01-14 cs.CL cs.AI cs.LG stat.ML 82%

On the Entropy Calibration of Language Models

对语言模型熵校准的研究

Steven Cao, Gregory Valiant, Percy Liang

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了语言模型的熵校准问题,发现随着模型规模增大,校准误差缓慢改善,但截断方法会增加对数损失,理论证明在假设可预测文本熵的情况下,可以减少熵而不增加对数损失。

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08464 2026-01-14 cs.CV cs.AI 79%

CoMa: Contextual Massing Generation with Vision-Language Models

CoMa:基于视觉-语言模型的上下文体量生成

Evgenii Maslov, Valentin Khrulkov, Anastasia Volkova, Anton Gusarov, Andrey Kuznetsov, Ivan Oseledets

机构 * FusionBrain Lab(融合大脑实验室) Innopolis University(因诺普里斯大学) Institute of Numerical Mathematics(数值数学研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 CoMa提出基于视觉-语言模型的自动化框架,生成基于功能需求和场地背景的建筑体量,引入CoMa-20K数据集并验证了VLMs在生成上下文敏感体量选项中的潜力。

Comments Code and dataset will be released later

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08283 2026-01-14 cs.IR cs.LG 79%

AgriLens: Semantic Retrieval in Agricultural Texts Using Topic Modeling and Language Models

AgriLens:利用主题建模和语言模型进行农业文本的语义检索

Heba Shakeel, Tanvir Ahmad, Tanya Liyaqat, Chandni Saxena

机构 * 3 Dept. of Computer Science \& Applications, Sharda University, Greater Noida, Uttar Pradesh, India 4 The Chinese University of Hong Kong, Hong Kong SAR, China

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 AgriLens通过主题建模和语言模型实现农业文本的可解释语义检索,提供零样本主题标注和高效检索能力。

Comments 8 Pages, 1st workshop on Democratizing GenAI and Scalable NLP with HiPC for Societal Impact; 32nd IEEE International Conference on High Performance Computing, Data, & Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23742 2026-01-14 cs.SE cs.AI 79%

AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization

AgenticTCAD: 基于LLM的多智能体框架用于自动TCAD代码生成与器件优化

Guangxi Fan, Tianliang Ma, Xuguang Sun, Xun Wang, Kain Lu Low, Leilai Shao

机构 * State Key Laboratory of Micro-nano Engineering Science(微纳工程科学国家重点实验室) Micro-nano Engineering Sciences Research Center(微纳工程科学研究中心) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.AI

AI总结 AgenticTCAD通过基于LLM的多智能体框架实现自动TCAD代码生成与器件优化,显著提升设计效率。

Comments Accepted by DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09838 2026-01-14 cs.CV cs.AI 79%

ClimateIQA: A New Dataset and Benchmark to Advance Vision-Language Models in Meteorology Anomalies Analysis

ClimateIQA: 一种新的数据集和基准,以推进气象异常分析中的视觉-语言模型

Jian Chen, Peilin Zhou, Yining Hua, Dading Chong, Meng Cao, Yaowei Li, Wei Chen, Bing Zhu, Junwei Liang, Zixuan Yuan

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能研究所,香港科学与技术大学(广州)) Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析研究所,香港科学与技术大学(广州)) Harvard University(哈佛大学) Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ClimateIQA通过引入SPOT算法和新型数据集,提升视觉-语言模型在气象异常分析中的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18058 2026-01-14 eess.IV cs.CV 78%

A Pre-trained Foundation Model Framework for Multiplanar MRI Classification of Extramural Vascular Invasion and Mesorectal Fascia Invasion in Rectal Cancer

一种用于直肠癌外侵血管侵袭和腹膜脂肪囊侵袭的多平面MRI分类的预训练基础模型框架

Yumeng Zhang, Shruti Atul Mali, Danial Khan, Sina Amirrajab, Eduardo Ibor-Crespo, Ana Jimenez-Pastor, Gloria Ribas, Silvia Flor-Arnal, Marta Zerunian, Christophe Aube, Luis Marti-Bonmati, Zohaib Salahuddin, Philippe Lambin

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出一种基于预训练基础模型的框架,通过频域谐振和多平面融合技术,实现了对直肠癌外侵血管侵袭和腹膜脂肪囊侵袭的自动MRI分类,展示了跨机构的高泛化性能。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08331 2026-01-14 cs.CL 77%

CLaS-Bench: A Cross-Lingual Alignment and Steering Benchmark

CLaS-Bench: 一种跨语言对齐与引导基准

Daniil Gurgurov, Yusser Al Ghussin, Tanja Baeumel, Cheng-Ting Chou, Patrick Schramowski, Marius Mosbach, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心(CERTAIN)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) TU Darmstadt(德累斯顿技术大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所(Mila)) McGill University(麦吉尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 CLaS-Bench是首个多语言引导基准,通过评估32种语言中的语言强制行为,验证了残差基于DiffMean方法在跨语言引导中的有效性。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06477 2026-01-14 cs.CL cs.CY cs.SI 77%

IndRegBias: A Dataset for Studying Indian Regional Biases in English and Code-Mixed Social Media Comments

IndRegBias:一个用于研究印度地区偏见的英文及混合语言社交媒体评论数据集

Debasmita Panda, Akash Anil, Neelesh Kumar Shukla

机构 * Department of Data Science and Engineering, Indian Institute of Science Education and Research(数据科学与工程系,印度科学教育与研究学院) Oracle Industries AI, Oracle Corporation(Oracle人工智能部,Oracle公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IndRegBias数据集,用于研究印度地区偏见,通过多级标注策略评估LLM和ILM在检测地区偏见及严重性方面的性能。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05371 2026-01-14 cs.LG stat.ME 77%

The Kernel Manifold: A Geometric Approach to Gaussian Process Model Selection

核流形:一种基于核的高斯过程模型选择的几何方法

Md Shafiqul Islam, Shakti Prasad Padhy, Douglas Allaire, Raymundo Arróyave

机构 * organization= Department of Materials Science Engineering, Texas A\&M University , city= College Station , postcode= 77843 , state= TX , country= USA organization= J. Mike Walker '66 Department of Mechanical Engineering, Texas A\&M University , city= College Station , postcode= 77843 , state= TX , country= USA

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于核几何的贝叶斯优化框架,通过多维标度嵌入实现核空间的高效探索,提升高斯过程模型的预测准确性和不确定性校准。

Comments Included a subsection named "Budgetary impact of inline kernel optimization during BO", and corrected label of a figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09243 2026-01-14 cs.CL cs.AI 76%

CrisiText: A dataset of warning messages for LLM training in emergency communication

CrisiText: 一个用于LLM训练的紧急通讯警示信息数据集

Giacomo Gonella, Gian Maria Campedelli, Stefano Menini, Marco Guerini

机构 * Fondazione Bruno Kessler(布雷诺克瑟拉基金会) University of Trento(特伦托大学)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 CrisiText是首个大规模危机警示信息数据集,通过生成13种危机场景下的警示信息,提升LLM在紧急通讯中的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23824 2026-01-14 cs.SE 75%

SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation

SolContractEval: 一个用于评估合同级Solidity代码生成的基准

Zhifan Ye, Jiachi Chen, Zhenzhe Shao, Lingfeng Bao, Xiaohu Yang, Zhongxin Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SolContractEval是一个用于评估Solidity代码生成的合同级基准,发现Claude-3.7-Sonnet在整体表现最佳,但模型在复杂逻辑和Solidity特定功能上仍有不足。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 75%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08634 2026-01-14 cs.CL cs.AI 73%

Moral Lenses, Political Coordinates: Towards Ideological Positioning of Morally Conditioned LLMs

道德透镜,政治坐标:迈向道德条件化大语言模型的意识形态定位

Chenchen Yuan, Bolei Ma, Zheyu Zhang, Bardh Prenkaj, Frauke Kreuter, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过道德条件化大语言模型,探索道德价值观与政治倾向之间的因果关系,揭示道德取向对政治坐标的影响,并提出更社会化的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08509 2026-01-14 cs.AI cs.CL 73%

What If TSF: A Benchmark for Reframing Forecasting as Scenario-Guided Multimodal Forecasting

如果TSF:一个用于将预测重新框架化为基于场景的多模态预测的基准

Jinkwan Jang, Hyunbin Jin, Hyungjin Park, Kyubyung Chae, Taesup Kim

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 What If TSF是一个用于评估模型是否能根据上下文文本,特别是未来场景,进行多模态预测的基准。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10326 2026-01-14 cs.AI cs.GT cs.LG cs.MA 73%

VGC-Bench: Towards Mastering Diverse Team Strategies in Competitive Pokémon

VGC-Bench: 向掌握多样化团队策略的竞技宝可梦迈进

Cameron Angliss, Jiaxun Cui, Jiaheng Hu, Arrasy Rahman, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VGC-Bench通过提供标准化评估和人类对战数据集,研究如何让AI代理在多样化团队策略的竞技宝可梦中实现稳健适应与泛化。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 70%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07972 2026-01-14 cs.CL 70%

Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs

知晓而不做:在大语言模型中收敛的道德与发散的行为

Jen-tse Huang, Jiantong Qin, Xueli Qiu, Sharon Levy, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) Rutgers University(罗格斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型在价值对齐训练下仍存在知识与行为之间的不一致,通过ValAct-15k数据集发现模型在情境决策上高度一致,但自我报告与实际行为关联较弱。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06663 2026-01-14 cs.AI 70%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15718 2026-01-14 cs.CL 70%

Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models

超越回合制游戏:通过双工模型实现实时对话

Xinrong Zhang, Yingfa Chen, Shengding Hu, Xu Han, Zihang Xu, Yuanwei Xu, Weilin Zhao, Maosong Sun, Zhiyuan Liu

机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学、北京、中国) Quan Cheng Laboratory, Jinan, China(泉城实验室、济南、中国) Modelbest Inc.(Modelbest公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出双工模型,通过时间分割复用策略实现实时对话,提升用户与AI交互的自然度和满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00634 2026-01-14 cs.SE cs.HC 67%

Does GenAI Make Usability Testing Obsolete?

生成式AI会使可用性测试过时吗?

Ali Ebrahimi Pourasad, Walid Maalej

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 本文提出UX-LLM,一种基于大视觉语言模型的可用性问题预测工具,虽无法完全替代传统测试,但可作为补充,尤其适用于资源有限的小型团队。

Comments Accepted for publication at The 47th IEEE/ACM International Conference on Software Engineering ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08682 2026-01-14 cs.CL cs.AI 62%

Lessons from the Field: An Adaptable Lifecycle Approach to Applied Dialogue Summarization

领域经验:一种适用于应用对话摘要的可适应生命周期方法

Kushal Chawla, Chenyang Zhu, Pengshan Cai, Sangwoo Cho, Scott Novotney, Ayushman Singh, Jonah Lewis, Keasha Safewright, Alfy Samuel, Erin Babinsky, Shi-Xiong Zhang, Sambit Sahu

机构 * Capital One

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种适用于应用对话摘要的可适应生命周期方法,通过行业案例研究探讨了在动态需求下构建可靠摘要系统的挑战与解决方案。

Comments EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07309 2026-01-14 cs.CL cs.LG 62%

PIE: Performance Interval Estimation for Free-Form Generation Tasks

PIE:用于自由形式生成任务的性能区间估计

Chi-Yang Hsu, Alexander Braylan, Yiheng Su, Matthew Lease, Omar Alonso

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 PIE提出了一种用于自由形式生成任务的性能区间估计方法,通过回归实现更准确的指标评分和校准的不确定性区间。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏