Accuracy and Error Patterns of References Generated by Large Language Models in Endodontics: The Role of Prompt Design and Model Selection.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND Large language models (LLMs) are increasingly used in healthcare; concerns persist regarding the accuracy of generated bibliographic references. The effect of prompt design on reference reliability has not been clearly established. This comparative experimental study evaluated the impact of prompt specificity on LLM-generated reference accuracy in endodontics and compared model performance. MATERIAL AND METHODS We used ChatGPT 5 and Claude Sonnet 4.6. Ten predefined endodontic queries were combined with 3 prompt types of increasing specificity. Each model generated 5 references per query-prompt combination (total: 300 references). References were verified using PubMed, Google Scholar, and CrossRef. Accuracy was classified as fabricated (0), partially accurate (1; existing references containing ≥1 bibliographic inaccuracy), or fully accurate (2). Digital object identifier (DOI) accuracy was assessed separately. Statistical analyses were performed using mixed-effects models and Pearson's chi-square test or Fisher's exact test. RESULTS Accuracy scores tended to increase with greater prompt specificity (P=0.249). Claude demonstrated significantly higher accuracy than ChatGPT (mean score: 1.79 vs 1.25; P<0.001). DOI accuracy did not differ among prompt groups (P=0.338); it was significantly higher for Claude than for ChatGPT (90.0% vs 35.3%; P<0.001). ChatGPT produced significantly more title, journal, and DOI errors (P<0.001); author and year errors were similar between models. CONCLUSIONS Prompt specificity had limited effects on reference accuracy; model selection played a greater role. DOI accuracy was strongly model-dependent and largely unaffected by prompt design under the test conditions, highlighting the need for external verification of LLM-generated references.
نتیجه فارسی
این مطالعه اثر طراحی پرامپت و انتخاب مدل بر دقت ارجاعات تولید شده توسط LLM در دندانپزشکی درمانی را بررسی کرد. Claude دقت کلی و دقت DOI بالاتری نسبت به ChatGPT داشت. ویژگی خاص پرامپت اثر محدودی بر دقت داشت.
- Claude دقت ارجاعات (۱.۷۹) و دقت DOI (۹۰٪) را بهطور معناداری بالاتر از ChatGPT (۱.۲۵ و ۳۵.۳٪) نشان داد.
- دقت ارجاعات با افزایش ویژگی خاص پرامپت افزایش یافت، اما این اثر معنادار نبود (P=0.249).
- ChatGPT خطاهای بیشتری در عنوان، مجله و DOI تولید کرد.
- دقت DOI تحت شرایط آزمایش بهطور کلی تحت تأثیر طراحی پرامپت قرار نگرفت.
ترجمه فارسی چکیده
مدلهای زبانی بزرگ (LLM) در حال افزایش در مراقبتهای بهداشتی استفاده میشوند، اما نگرانیهایی در مورد دقت ارجاعات کتابشناختی تولید شده وجود دارد. اثر طراحی پرامپت بر قابلیت اطمینان ارجاعات به طور واضح مشخص نشده است. این مطالعه تجربی مقایسهای اثر ویژگیهای خاص پرامپت بر دقت ارجاعات LLM در دندانپزشکی درمانی را ارزیابی کرد و عملکرد مدلها را مقایسه نمود. از ChatGPT 5 و Claude Sonnet 4.6 استفاده شد. ده پرسش دندانپزشکی پیشتعریف شده با ۳ نوع پرامپت با افزایش ویژگی خاص ترکیب شدند. هر مدل ۵ ارجاع برای هر ترکیب پرسش-پرامپت تولید کرد (مجموع: ۳۰۰ ارجاع). ارجاعات با استفاده از PubMed، Google Scholar و CrossRef تأیید شدند. دقت به عنوان جعلی (۰)، بهطور جزئی دقیق (۱؛ ارجاعات موجود شامل ≥۱ خطای کتابشناختی) یا کاملاً دقیق (۲) طبقهبندی شد. شناسه شیء دیجیتال (DOI) به طور جداگانه ارزیابی شد. تحلیلهای آماری با استفاده از مدلهای اثرات مخلوط و آزمون کای-مربع پیرسون یا آزمون دقیق فیشر انجام شد. امتیازات دقت با افزایش ویژگی خاص پرامپت افزایش یافت (P=0.249). Claude دقت بهطور معناداری بالاتری نسبت به ChatGPT نشان داد (امتیاز میانگین: ۱.۷۹ در برابر ۱.۲۵؛ P<0.001). دقت DOI بین گروههای پرامپت تفاوتی نداشت (P=0.338)؛ اما برای Claude بهطور معناداری بالاتر از ChatGPT بود (۹۰.۰٪ در برابر ۳۵.۳٪؛ P<0.001). ChatGPT خطاهای بیشتری در عنوان، مجله و DOI تولید کرد (P<0.001)؛ خطاهای نویسنده و سال بین مدلها مشابه بود. نتیجهگیری: ویژگی خاص پرامپت اثر محدودی بر دقت ارجاعات داشت؛ انتخاب مدل نقش بیشتری ایفا کرد. دقت DOI به شدت به مدل وابسته بود و تحت شرایط آزمایش بهطور کلی تحت تأثیر طراحی پرامپت قرار نگرفت، که نیاز به تأیید خارجی ارجاعات LLM را برجسته میکند.
روش پژوهش
این مطالعه تجربی مقایسهای با استفاده از ChatGPT 5 و Claude Sonnet 4.6 انجام شد. ده پرسش دندانپزشکی با ۳ نوع پرامپت ترکیب شدند و هر مدل ۵ ارجاع تولید کرد (مجموع ۳۰۰ ارجاع). ارجاعات با PubMed، Google Scholar و CrossRef تأیید شدند.
محدودیتها
محدودیتهای متن کامل در دسترس نیستند.
نمای PICO و پیامدها
- جمعیت
- ارجاعات کتابشناختی مرتبط با دندانپزشکی درمانی.
- مداخله/مواجهه
- تولید ارجاعات توسط LLM با استفاده از پرامپتهای مختلف.
- مقایسه
- مقایسه عملکرد ChatGPT 5 و Claude Sonnet 4.6.
- حجم نمونه
- ۳۰۰ ارجاع تولید شده.
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل