Código QR (código de barras bidimensional)

Benchmarking the Confidence of Large Language Models in Answering Clinical Questions: Cross-Sectional Evaluation Study

Abstract BackgroundThe capabilities of large language models (LLMs) to self-assess their own confidence in answering questions within the biomedical realm remain underexplored. ObjectiveThis study evaluates the confidence levels of 12 LLMs across 5 medical specialt...

ver descrição completa

Na minha lista:
Detalhes bibliográficos
Principais autores: Mahmud Omar, Reem Agbareia, Benjamin S Glicksberg, Girish N Nadkarni, Eyal Klang
Formato: Artigo
Idioma:Inglês
Publicado em: JMIR Publications 2025-05-01
coleção:JMIR Medical Informatics
Acesso em linha:https://medinform.jmir.org/2025/1/e66917
Tags: Adicionar Tag
Sem tags, seja o primeiro a adicionar uma tag!