روند فنی و متدولوژی اجرای پروژه
این پروژه با هدف مدلسازی و پیشبینی سه متغیر خروجی حیاتی در فرایند تولید بیوهیدروژن شامل بازدهی هیدروژن (Hydrogen Yield)، نرخ تولید (Hydrogen Production Rate) و درصد خلوص (Hydrogen Content) پیادهسازی شده است.
مراحل اصلی متدولوژی:
- پیشپردازش و مهندسی داده: حذف متغیرهای فاقد ارزش، پرکردن دادههای مفقودی متغیرهای کتهگوریکال با مد (Mode) و متغیرهای عددی با میانگین (Mean).
- الگوریتم اختصاصی پاکسازی دادههای ساختگی: پیادهسازی متدولوژی هوشمند برای تشخیص فرکانس غیرطبیعی مقادیر ثابت (Fake Constants) در ویژگیهای پیوسته مثل pH، دما و tCOD که موجب حذف دادههای گمراهکننده گردید.
- شناسایی دادههای پرت: بهرهگیری از آستانهگذاریهای فیزیکی و مدل چندمتغیره
IsolationForestجهت حذف نویزها. - رمزنگاری و مقیاسدهی: ادغام گروههای نادر پسابها در دسته ‘else’، تبدیل متغیرها با One-Hot Encoding و استانداردسازی با
StandardScaler. - مدلسازی و بهینهسازی: آموزش و ارزیابی ۷ الگوریتم پیشرفته شامل KNN, SVR, Decision Tree, Random Forest, Gradient Boosting, XGBoost و Ridge Regression با استفاده از
GridSearchCVو اعتبارسنجی متقابل ۵تایی (5-Fold CV). - تفسیرپذیری مدلها (XAI): تحلیل پراهمیتترین ویژگیهای عملیاتی با استفاده از نمودارهای Feature Importance و تحلیلهای متکی بر
SHAP (SHapley Additive exPlanations).
نتایج
دستاوردها و نتایج عددی نهایی
پس از ارزیابی مدلها روی دادههای آزمایشی مستمر، نتایج کلیدی زیر برای هر متغیر هدف به دست آمد:
- بازدهی هیدروژن (Target 1): مدل Random Forest با ضریب تبیین R² = 0.7663 و خطای مطلق MAE = 1.5991 برترین عملکرد را ثبت کرد.
- نرخ تولید هیدروژن (Target 2): الگوریتم XGBoost با دستیابی به R² = 0.6369 و MAE = 42.9711 بهترین قدرت پیشبینی را نشان داد.
- درصد خلوص هیدروژن (Target 3): مدلهای Decision Tree و KNN عملکرد فوقالعادهای داشتند که Decision Tree با R² = 0.9175 و MAE = 1.1800 در صدر قرار گرفت.
نتایج به دست آمده پایهای دقیق برای کنترل و بهینهسازی هوشمند پارامترهای عملیاتی نظیر pH، دما و زمان ماند در راکتورهای زیستی فراهم میسازد.