[Expert consensus on evaluating large language models for aided diabetes diagnosis and treatment (2026 edition)].
Journal:
Zhonghua yi xue za zhi
Published Date:
Sep 8, 2026
Abstract
Large language models are being introduced into diabetes care at an accelerating pace, but their knowledge accuracy, safety boundaries, explainability, and real-world usability remains uncertain. A diabetes-specific evaluation framework is urgently needed. To address this gap, the National Clinical Research Center for Endocrine and Metabolic Diseases (Changsha) and Chinese Society of Endocrinology and Metabolism, Chinese Medical Doctor Association convened experts in diabetology, artificial intelligence, clinical research, biostatistics, medical informatics, public health, and ethics. Based on a systematic literature review and two Delphi rounds, we developed the consensus for primary use in Chinese clinical settings. This consensus is primarily intended for clinical application in China, emphasizes that physicians retain ultimate responsibility for diagnosis and treatment, and proposes a three-tier evaluation framework covering dimensions, methods, and indicators across five domains: accuracy and reliability, safety, clinical utility and value, user experience and interactivity, ethics and compliance. It provides a practical basis for the development, validation, adoption, and continuous monitoring of large language models for diabetes care.
Authors
Keywords
No keywords available for this article.