Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models
Simeng Han, Howard Dai, Stephen Xia, Grant Zhang, Chen Liu, Lichang Chen, Hoang Huy Nguyen, Hongyuan Mei, Jiayuan Mao, R. Thomas McCoy
机构
*
Yale University(耶鲁大学)
;
Meta Superintelligence Labs(Meta超智能实验室)
;
Georgia Institute of Technology(佐治亚理工学院)
;
TTIC
;
Massachusetts Institute of Technology(麻省理工学院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中
评测与基准
:language model(title,abstract);large language model(abstract);分类 cs.AI
BioCoref: Benchmarking Biomedical Coreference Resolution with LLMs
Nourah M Salem, Elizabeth White, Michael Bada, Lawrence Hunter
机构
*
Computational Bioscience Program University of Colorado Anschutz Medical Campus(科学生物学程序,科罗拉多大学安舒茨医学校区)
;
Department of Pediatrics University of Chicago(儿科学系,芝加哥大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Pearl: A Foundation Model for Placing Every Atom in the Right Location
Genesis Research Team, Alejandro Dobles, Nina Jovic, Kenneth Leidal, Pranav Murugan, David C. Williams, Drausin Wulsin, Nate Gruver, Christina X. Ji, Korrawat Pruegsanusak, Gianluca Scarpellini, Ansh Sharma, Wojciech Swiderski, Andrea Bootsma, Richard Strong Bowen, Charlotte Chen, Jamin Chen, Marc André Dämgen, Benjamin DiFrancesco, J. D. Fishman, Alla Ivanova, Zach Kagin, David Li-Bland, Zuli Liu, Igor Morozov, Jeffrey Ouyang-Zhang, Frank C. Pickard, Kushal S. Shah, Ben Shor, Gabriel Monteiro da Silva, Roy Tal, Maxx Tessmer, Carl Tilbury, Cyr Vetcher, Daniel Zeng, Maruan Al-Shedivat, Aleksandra Faust, Evan N. Feinberg, Michael V. LeVine, Matteus Pan
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
Weizhi Chen, Yupeng Deng, Jin Wei, Jingbo Chen, Jiansheng Chen, Yuman Feng, Zhihao Xi, Diyou Liu, Kai Li, Yu Meng
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
;
School of Information Network Security, People’s Public Security University of China(中国人民公安大学信息网络安全学院)
MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
Yucheng Ning, Xixun Lin, Fang Fang, Yanan Cao
机构
*
Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100085, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学网络安全学院)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsThe article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
Hasan Iqbal, Yuxia Wang, Minghan Wang, Georgi Georgiev, Jiahui Geng, Iryna Gurevych, Preslav Nakov
机构
*
MBZUAI
;
Monash University(墨尔本大学)
;
Sofia University(索菲亚大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments11 pages, 4 Figures, 3 Tables, Published In Proceedings of The 2024 Conference on Empirical Methods in Natural Language Processing
Journal refIn Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 219-229, Miami, Florida, USA. Association for Computational Linguistics
机构
*
Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心)
;
Indian Institute of Technology Madras(印度理工学院马德拉斯分校)
;
IT University of Copenhagen(哥本哈根技术大学)
;
Microsoft(微软)
;
Indian Institute of Engineering, Science and Technology, Shibpur(Shibpur印度工程科学技术学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
MOPrompt: Multi-objective Semantic Evolution for Prompt Optimization
Sara Câmara, Eduardo Luz, Valéria Carvalho, Ivan Meneghini, Gladston Moreira
机构
*
Computing Department, Universidade Federal de Ouro Preto(联邦大学奥鲁普里托 computing 部门)
;
Federal Institute of Minas Gerais(巴西矿业高等学院)
;
Postgraduate Program in Computer Science, Federal University of Ouro Preto(联邦大学奥鲁普里托 计算科学研究生项目)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL