روند فنی و متدولوژی اجرای پروژه

این پروژه با هدف مدل‌سازی و پیش‌بینی سه متغیر خروجی حیاتی در فرایند تولید بیوهیدروژن شامل بازدهی هیدروژن (Hydrogen Yield)، نرخ تولید (Hydrogen Production Rate) و درصد خلوص (Hydrogen Content) پیاده‌سازی شده است.

مراحل اصلی متدولوژی:

  • پیش‌پردازش و مهندسی داده: حذف متغیرهای فاقد ارزش، پرکردن داده‌های مفقودی متغیرهای کته‌گوریکال با مد (Mode) و متغیرهای عددی با میانگین (Mean).
  • الگوریتم اختصاصی پاک‌سازی داده‌های ساختگی: پیاده‌سازی متدولوژی هوشمند برای تشخیص فرکانس غیرطبیعی مقادیر ثابت (Fake Constants) در ویژگی‌های پیوسته مثل pH، دما و tCOD که موجب حذف داده‌های گمراه‌کننده گردید.
  • شناسایی داده‌های پرت: بهره‌گیری از آستانه‌گذاری‌های فیزیکی و مدل چندمتغیره IsolationForest جهت حذف نویزها.
  • رمزنگاری و مقیاس‌دهی: ادغام گروه‌های نادر پساب‌ها در دسته ‘else’، تبدیل متغیرها با One-Hot Encoding و استانداردسازی با StandardScaler.
  • مدل‌سازی و بهینه‌سازی: آموزش و ارزیابی ۷ الگوریتم پیشرفته شامل KNN, SVR, Decision Tree, Random Forest, Gradient Boosting, XGBoost و Ridge Regression با استفاده از GridSearchCV و اعتبارسنجی متقابل ۵‌تایی (5-Fold CV).
  • تفسیرپذیری مدل‌ها (XAI): تحلیل پراهمیت‌ترین ویژگی‌های عملیاتی با استفاده از نمودارهای Feature Importance و تحلیل‌های متکی بر SHAP (SHapley Additive exPlanations).

نتایج

دستاوردها و نتایج عددی نهایی

پس از ارزیابی مدل‌ها روی داده‌های آزمایشی مستمر، نتایج کلیدی زیر برای هر متغیر هدف به دست آمد:

  • بازدهی هیدروژن (Target 1): مدل Random Forest با ضریب تبیین R² = 0.7663 و خطای مطلق MAE = 1.5991 برترین عملکرد را ثبت کرد.
  • نرخ تولید هیدروژن (Target 2): الگوریتم XGBoost با دستیابی به R² = 0.6369 و MAE = 42.9711 بهترین قدرت پیش‌بینی را نشان داد.
  • درصد خلوص هیدروژن (Target 3): مدل‌های Decision Tree و KNN عملکرد فوق‌العاده‌ای داشتند که Decision Tree با R² = 0.9175 و MAE = 1.1800 در صدر قرار گرفت.

نتایج به دست آمده پایه‌ای دقیق برای کنترل و بهینه‌سازی هوشمند پارامترهای عملیاتی نظیر pH، دما و زمان ماند در راکتورهای زیستی فراهم می‌سازد.