Large language models for early childhood caries risk triage: A validation study using standardized pediatric dental vignettes.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
PURPOSE: To compare the diagnostic accuracy and public health utility of Gemini 2.5 Flash and GPT-4 for early childhood caries (ECC) risk triage in classifying presentations as high risk (warranting immediate referral) or low risk (amenable to preventive counseling). MATERIALS AND METHODS: A standardized dataset of 50 clinical vignettes (25 high risk and 25 low risk) was evaluated against both large language models via official application programming interfaces using a blinded, prospective comparative design (CONSORT-AI; TRIPOD+AI). This constitutes a vignette-based internal validation study and does not represent a clinical diagnostic accuracy study. Ground truth was established by two consultant pediatric dentists (intraclass correlation coefficient = 0.92). Performance was quantified using sensitivity, specificity, positive predictive value, negative predictive value, and false negative rate (FNR). Readability, actionability, and multilingual competence in Hindi and Tamil were additionally assessed. RESULTS: Both models exceeded the 80% accuracy threshold. GPT-4 achieved significantly higher sensitivity (92.0% vs. 80.0%; P = 0.032) and a lower FNR (8.0% vs. 20.0%), with superior readability (Flesch-Kincaid Grade Level 5.9 vs. 8.1), actionability (4.8 vs. 4.2), and cross-lingual consistency. Both models achieved 100% safety disclaimer compliance in English. CONCLUSIONS: GPT-4 demonstrates a statistically superior safety profile for ECC risk triage. As a Level 1 adjunct, it can assist pediatric dentists by prescreening caregiver-reported presentations, reducing diagnosis lag, and directing specialist capacity toward confirmed high-risk pathology without replacing clinical judgment. CLINICAL RELEVANCE: This study establishes that GPT-4 is a safer and more accessible AI triage tool than Gemini 2.5 Flash for pediatric dental screening, particularly in linguistically diverse, resource-constrained settings where specialist access is limited.
نتیجه فارسی
این مطالعه دقت مدلهای GPT-4 و Gemini 2.5 Flash را در غربالگری ریسک عفونتهای دندانپزشکی کودکان با استفاده از سناریوهای بالینی ارزیابی کرد. GPT-4 دقت بالاتری در تشخیص موارد خطر بالا داشت و خوانایی بهتری ارائه داد. هر دو مدل از آستانه دقت ۸۰٪ فراتر رفتند.
- دقت هر دو مدل (GPT-4 و Gemini 2.5 Flash) در غربالگری ریسک ECC از ۸۰٪ فراتر رفت.
- GPT-4 حساسیت بالاتری (۹۲٪) و نرخ خطای منفی کمتر (۸٪) نسبت به Gemini 2.5 Flash داشت.
- GPT-4 خوانایی و کاربردپذیری بهتری نسبت به Gemini 2.5 Flash ارائه داد.
- این مطالعه یک مطالعه اعتبارسنجی داخلی مبتنی بر سناریو است و نه یک مطالعه دقت تشخیصی بالینی.
ترجمه فارسی چکیده
هدف: مقایسه دقت تشخیصی و کاربرد بهداشت عمومی مدلهای زبانی بزرگ (Gemini 2.5 Flash و GPT-4) برای غربالگری ریسک عفونتهای دندانپزشکی کودکان (ECC) در طبقهبندی موارد به عنوان خطر بالا (نیاز به ارجاع فوری) یا خطر پایین (قابل درمان با مشاوره پیشگیرانه). روشها: یک مجموعه داده استاندارد از ۵۰ سناریوی بالینی (۲۵ مورد خطر بالا و ۲۵ مورد خطر پایین) در برابر هر دو مدل ارزیابی شد. نتایج: هر دو مدل از آستانه دقت ۸۰٪ فراتر رفتند. GPT-4 دقت بالاتری در حساسیت (۹۲٪ در مقابل ۸۰٪) و نرخ خطای منفی کمتر (۸٪ در مقابل ۲۰٪) داشت و خوانایی و کاربردپذیری بهتری نیز ارائه داد. نتیجهگیری: GPT-4 یک پروفایل ایمنی بهتر برای غربالگری ریسک ECC نشان میدهد و میتواند به عنوان یک ابزار کمکی، به دندانپزشکان کمک کند.
روش پژوهش
دادهها شامل ۵۰ سناریوی بالینی استاندارد (۲۵ مورد خطر بالا و ۲۵ مورد خطر پایین) بود. دقت هر دو مدل با استفاده از حساسیت، ویژگیهای مثبت و منفی و نرخ خطای منفی (FNR) سنجیده شد. خوانایی و کاربردپذیری نیز ارزیابی شد.
محدودیتها
این مطالعه یک مطالعه اعتبارسنجی داخلی مبتنی بر سناریو است و نه یک مطالعه بالینی. دقت مدلها در سناریوهای واقعی بیماران باید در مطالعات آتی بررسی شود.
نمای PICO و پیامدها
- جمعیت
- کودکان مبتلا به عفونتهای دندانپزشکی (ECC)
- مداخله/مواجهه
- مدلهای زبانی بزرگ (Gemini 2.5 Flash و GPT-4)
- مقایسه
- مدل زبانی بزرگ Gemini 2.5 Flash
- حجم نمونه
- ۵۰ سناریوی بالینی
متن کامل اصلی
برای بررسی دسترسی کتابخانهای یا خرید، رکورد اصلی را باز کنید.
رفتن به منبع اصلی