Accuracy, Self-Reported Confidence, and Overconfidence of Large Language Models in Endodontics: An Evaluation Using National Specialty Examination Questions.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND This study aimed to evaluate the accuracy, confidence, and overconfidence behavior of large language models (LLMs) in endodontics using questions derived from a national specialty entrance examination. MATERIAL AND METHODS A total of 123 text-based endodontic questions from the Turkish Dental Specialty Examination (2017-2026) were included after excluding annulled and image-based questions. Three LLMs (ChatGPT, Claude, and Gemini) were assessed. Each model answered all questions using a standardized prompt and provided a confidence score (0%-100%). Accuracy was recorded as correct/incorrect. Overconfidence was defined as incorrect responses with ≥90% confidence. Statistical analyses were performed using Cochran's Q test, Friedman test, and post hoc pairwise comparisons with Bonferroni correction. RESULTS Accuracy rates were 89.4% for ChatGPT, 76.4% for Claude, and 90.2% for Gemini, with significant differences among models (χ²(2)=21.00, P<0.001). Confidence scores differed significantly (c2(2)=213.40, P<0.001), with Gemini demonstrating highest confidence (99.51±1.49), followed by ChatGPT (90.88±9.19) and Claude (80.22±11.10). Overconfidence rates were 9.8% for Gemini and 5.7% for ChatGPT, while no overconfident responses were observed for Claude (χ²(2)=14.53, P=0.001). Despite similar accuracy between ChatGPT and Gemini, confidence patterns differed markedly, demonstrating that comparable accuracy does not necessarily reflect comparable reliability. CONCLUSIONS LLMs demonstrated high accuracy in answering text-based endodontic examination questions; however, significant differences were observed in confidence behavior and overconfidence patterns. The presence of high-confidence incorrect responses suggests that accuracy alone may be insufficient to fully evaluate model reliability. These findings highlight the importance of considering confidence-related behavior alongside accuracy when assessing LLM performance in examination-style endodontic tasks.
نتیجه فارسی
این مطالعه دقت، اعتماد به نفس و بیشاعتمادی سه مدل زبان بزرگ (ChatGPT، Claude و Gemini) را در پاسخگویی به سوالات دندانپزشکی ریشهای بررسی کرد. نتایج نشان داد که دقت مدلها بالا بود، اما الگوهای اعتماد به نفس و نرخ بیشاعتمادی بین آنها متفاوت بود. این یافتهها حاکی از آن است که دقت به تنهایی برای ارزیابی کامل عملکرد مدل کافی نیست.
- سه مدل LLM (ChatGPT، Claude و Gemini) بر روی ۱۲۳ سوال آزمون تخصصی دندانپزشکی ارزیابی شدند.
- دقت ChatGPT ۸۹.۴٪، Claude ۷۶.۴٪ و Gemini ۹۰.۲٪ بود.
- Gemini بالاترین اعتماد به نفس (۹۹.۵۱٪) و نرخ بیشاعتمادی (۹.۸٪) را نشان داد.
- Claude هیچ پاسخ بیشاعتمادی نداشت، هرچند دقت پایینتری داشت.
- دقت قابل مقایسه لزوماً به معنای قابلیت اطمینان قابل مقایسه نیست.
ترجمه فارسی چکیده
این مطالعه هدف داشت دقت، اعتماد به نفس و رفتار بیشاعتمادی مدلهای زبان بزرگ (LLM) را در دندانپزشکی ریشهای با استفاده از سوالات استخراجشده از آزمون ورودی تخصصی ملی ارزیابی کند. ۱۲۳ سوال متنی دندانپزشکی ریشهای از آزمون تخصصی دندانپزشکی ترکیه (۲۰۱۷-۲۰۲۶) پس از حذف سوالات لغوشده و مبتنی بر تصویر وارد شدند. سه مدل LLM (ChatGPT، Claude و Gemini) ارزیابی شدند. هر مدل با استفاده از یک دستورالعمل استاندارد به تمام سوالات پاسخ داد و امتیاز اعتماد به نفس (۰ تا ۱۰۰٪) ارائه کرد. دقت به عنوان درست/غلط ثبت شد. بیشاعتمادی به پاسخهای غلط با اعتماد به نفس ≥۹۰٪ تعریف شد. تحلیلهای آماری با استفاده از آزمون کوکران Q، آزمون فریدمن و مقایسههای جفتبهجفت پس از آزمون با اصلاح Bonferroni انجام شد. نرخهای دقت برای ChatGPT ۸۹.۴٪، برای Claude ۷۶.۴٪ و برای Gemini ۹۰.۲٪ بود که تفاوتهای معناداری بین مدلها مشاهده شد (χ²(2)=۲۱.۰۰، P<0.001). امتیازات اعتماد به نفس تفاوت معناداری داشتند (c2(2)=۲۱۳.۴۰، P<0.001)، با نشان دادن بالاترین اعتماد به نفس توسط Gemini (۹۹.۵۱±۱.۴۹)، به دنبال آن ChatGPT (۹۰.۸۸±۹.۱۹) و Claude (۸۰.۲۲±۱۱.۱۰). نرخهای بیشاعتمادی برای Gemini ۹.۸٪ و برای ChatGPT ۵.۷٪ بود، در حالی که برای Claude هیچ پاسخ بیشاعتمادی مشاهده نشد (χ²(2)=۱۴.۵۳، P=0.001). با وجود دقت مشابه بین ChatGPT و Gemini، الگوهای اعتماد به نفس به طور قابل توجهی متفاوت بودند که نشان میدهد دقت قابل مقایسه لزوماً به معنای قابلیت اطمینان قابل مقایسه نیست. مدلهای LLM دقت بالایی در پاسخگویی به سوالات آزمون دندانپزشکی ریشهای متنی نشان دادند؛ با این حال، تفاوتهای معناداری در رفتار اعتماد به نفس و الگوهای بیشاعتمادی مشاهده شد. وجود پاسخهای غلط با اعتماد به نفس بالا نشان میدهد که دقت به تنهایی ممکن است برای ارزیابی کامل قابلیت اطمینان مدل کافی نباشد. این یافتهها اهمیت در نظر گرفتن رفتار مرتبط با اعتماد به نفس در کنار دقت را هنگام ارزیابی عملکرد LLM در وظایف دندانپزشکی ریشهای با سبک آزمون برجسته میکنند.
روش پژوهش
این مطالعه یک مطالعه ارزیابیکننده با استفاده از سوالات استاندارد شده از آزمون تخصصی ملی بود. تحلیلهای آماری شامل آزمون کوکران Q، آزمون فریدمن و مقایسههای جفتبهجوست.
محدودیتها
محدودیتهای گزارششده شامل حذف سوالات لغوشده و مبتنی بر تصویر است. همچنین، استفاده از سوالات یک آزمون خاص (ترکیه) ممکن است تعمیمپذیری را محدود کند.
نمای PICO و پیامدها
- جمعیت
- سوالات متنی دندانپزشکی ریشهای از آزمون تخصصی دندانپزشکی ترکیه (۲۰۱۷-۲۰۲۶).
- مداخله/مواجهه
- ارزیابی سه مدل زبان بزرگ (ChatGPT، Claude و Gemini) با استفاده از یک دستورالعمل استاندارد.
- مقایسه
- هیچ مقایسهکنندهای در متن گزارش نشده است.
- حجم نمونه
- ۱۲۳ سوال.
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل