科研速览 · Science Skim继续刷下去 · Keep skimming →
◆ Frontiers in medicine2026-01-01

Evaluating LLMs in non-metastatic melanoma care: a comparative analysis.

Xizhi Wu, Wangyan Zhong, Wanli Ye, Xueying Jin, Jianqing Zhang, Lili Wu

一句话结论 · In one sentence

Leading LLMs demonstrate potential for high-quality melanoma management but exhibit inconsistent performance influenced by architecture and case complexity, with reduced reliability in advanced stages. Future tools require risk-stratified guidelines and real-world validation to improve patient outcomes.

原始摘要(英文原文)· Original abstract
BACKGROUND: Malignant melanoma is an aggressive skin cancer with rising incidence. Accurate early staging and standardized treatment are crucial for prognosis. This study evaluates seven large language models (LLMs)-including GPT-5.2, Gemini-3.1, and medically enhanced models-in assisting non-metastatic melanoma management amid clinical complexities. METHODS: Employing a prospective, simulated expert-blinded design, 59 virtual cases across TNM stages, ages, and comorbidities were assessed. Multiple senior oncologists independently evaluated model outputs using a 6-point Likert scale for staging accuracy, treatment rationality, and protocol standardization. RESULTS: GPT-5.2 (5.56 ± 1.12) and Gemini-3.1 (5.25 ± 1.3) achieved the highest staging accuracy, while AntAngelMed performed worst (2.93 ± 1.67). Performance declined significantly in complex Stage III cases. GPT-5.2 and Gemini-3.1 also led in treatment rationality, showing stability, whereas model performances converged in early stages but diverged in advanced ones. Gemini-3.1 excelled in protocol standardization (5.17 ± 0.57), though some models posed risks like insufficient surgical margin recommendations. CONCLUSION: Leading LLMs demonstrate potential for high-quality melanoma management but exhibit inconsistent performance influenced by architecture and case complexity, with reduced reliability in advanced stages. Future tools require risk-stratified guidelines and real-world validation to improve patient outcomes.
读原文 · Read the paper ↗

AI 追问PRO

登录后使用 AI 追问

讨论区

登录后参与讨论

相关论文 · Related

Evaluating LLMs in non-metastatic melanoma care: a comparative analysis. — 科研速览 Science Skim