Fine-grained Chinese dish recognition on CNFOOD-241: A discriminative learning approach for improving category-level discrimination.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
Accurate recognition of food images is essential for image-based dietary assessment, nutritional tracking, and digital health applications. However, closed-set Chinese dish recognition remains challenging because many categories in the CNFOOD-241 dataset exhibit strong visual similarity, substantial intra-class variation, and subtle inter-class differences. In this study, we present an integrated discriminative training strategy for fine-grained Chinese dish recognition using RegNetY-32GF as the student backbone. Rather than proposing a new backbone architecture, the study focuses on improving category-level discrimination under a fixed convolutional architecture by combining teacher-guided knowledge distillation, margin-based classification, triplet-based embedding regularization, and mixed-sample augmentation. Across five random seeds, the proposed full model achieved 84.37 + /- 0.29% Top-1 accuracy, 97.66 + /- 0.11% Top-5 accuracy, 83.41 + /- 0.57% macro-F1, and 84.27 + /- 0.30% weighted-F1. Paired bootstrap analysis showed a positive Top-1 improvement of 0.651 percentage points over the baseline, with a 95% confidence interval of [0.491, 0.817], and the mean class-wise Delta F1 across five seeds was significantly greater than zero according to the Wilcoxon signed-rank test (p = 0.017803). These findings suggest that the proposed framework provides a modest improvement in category-level discrimination on CNFOOD-241, with statistically supported evidence at the dataset level, although the magnitude of improvement varies across individual categories. The training code, evaluation scripts, derived result files, and trained model weights are publicly available at the project repository and GitHub Release.
نتیجه فارسی
این مطالعه یک استراتژی آموزش ترکیبی برای تشخیص دقیق غذاهای چینی با استفاده از RegNetY-32GF ارائه میدهد. مدل پیشنهادی بر بهبود تشخیص سطح دسته با ترکیب دانشگیری از معلم و نرمالسازی جعبهای تمرکز دارد. نتایج نشاندهنده بهبود معنادار آماری در دقت Top-1 نسبت به پایه است.
- استفاده از RegNetY-32GF به عنوان ستون فقرات دانشجو.
- ترکیب دانشگیری از معلم، طبقهبندی مبتنی بر حاشیه و نرمالسازی جعبهای سهگانه.
- دقت Top-1 84.37% و Top-5 97.66% در پنج بذر تصادفی.
- بهبود معنادار آماری در دقت Top-1 نسبت به پایه (p = 0.017803).
ترجمه فارسی چکیده
تشخیص دقیق تصاویر غذا برای ارزیابی رژیم غذایی مبتنی بر تصویر، ردیابی تغذیه و کاربردهای سلامت دیجیتال ضروری است. با این حال، تشخیص غذاهای چینی در مجموعه داده بستهبندی شده CNFOOD-241 همچنان چالشبرانگیز است زیرا بسیاری از دستهها شباهت بصری قوی، تغییرات درونکلاسی قابل توجه و تفاوتهای بینکلاسی ظریفی دارند. در این مطالعه، یک استراتژی آموزش ترکیبی برای تشخیص دقیق غذاهای چینی با استفاده از RegNetY-32GF به عنوان ستون فقرات دانشجو ارائه شده است. به جای پیشنهاد معماری ستون فقرات جدید، مطالعه بر بهبود تشخیص سطح دسته در یک معماری کانولوشنی ثابت با ترکیب دانشگیری از معلم، طبقهبندی مبتنی بر حاشیه و نرمالسازی جعبهای سهگانه و تقویت نمونههای مخلوط تمرکز دارد. مدل پیشنهادی در پنج بذر تصادفی، دقت Top-1 84.37 ± 0.29%، دقت Top-5 97.66 ± 0.11%، F1 ماکرو 83.41 ± 0.57% و F1 وزنی 84.27 ± 0.30% را به دست آورد. تحلیل بوتاسترپ جفتشده نشان داد بهبود مثبت 0.651 درصدی در دقت Top-1 نسبت به پایه، با فاصله اطمینان 95% [0.491، 0.817] و میانگین Delta F1 طبقهای در پنج بذر به طور معناداری بزرگتر از صفر بود (p = 0.017803). این یافتهها نشان میدهند که چارچوب پیشنهادی بهبود جزئی در تشخیص سطح دسته در CNFOOD-241 ارائه میدهد، با شواهد آماری پشتیبانی شده در سطح مجموعه داده، هرچند اندازه بهبود در دستههای فردی متفاوت است.
روش پژوهش
استفاده از RegNetY-32GF به عنوان ستون فقرات دانشجو. ترکیب دانشگیری از معلم، طبقهبندی مبتنی بر حاشیه، نرمالسازی جعبهای سهگانه و تقویت نمونههای مخلوط. ارزیابی در پنج بذر تصادفی.
محدودیتها
مطالعه بر یک مجموعه داده خاص (CNFOOD-241) متمرکز است. اندازه بهبود در دستههای فردی متفاوت است. نتایج ممکن است به طور مستقیم به سایر مجموعههای داده غذا اعمال نشوند.
نمای PICO و پیامدها
- جمعیت
- غذاهای چینی در مجموعه داده CNFOOD-241.
- مداخله/مواجهه
- استراتژی آموزش ترکیبی شامل دانشگیری از معلم، طبقهبندی مبتنی بر حاشیه، نرمالسازی جعبهای سهگانه و تقویت نمونههای مخلوط.
- مقایسه
- مدل پایه (Baseline) بدون این استراتژیهای ترکیبی.
- حجم نمونه
- پنج بذر تصادفی (Random seeds).
متن کامل اصلی
برای بررسی دسترسی کتابخانهای یا خرید، رکورد اصلی را باز کنید.
رفتن به منبع اصلی