هیچ لرزهای به اندام یک مدیر شبکه ترسناکتر از ریست شدن ناگهانی سرور آن هم در اوج ترافیک کاری نیست. بدتر از آن، زمانی است که به سراغ لاگها میروید و با صفحهای خالی مواجه میشوید؛ انگار که هیچ اتفاقی نیفتاده است!
پیدا کردن علت خاموش و روشن شدن خودکار سرور بدون ثبت خطا، شبیه به پیدا کردن سوزن در انبار کاه است، اما تجربه ما در اتاقهای سرور میگوید که این اتفاق هرگز بیدلیل نیست. معمولاً ریشه این مشکل یا در نوسانات میکروسکوپی ولتاژ پنهان شده، یا در باگهای مرموز فریمور (Firmware) که باعث تداخل در مدیریت انرژی میشوند. در این مقاله، قرار است از زاویه دید یک کارشناس فنی، نقاب از چهره متهمان اصلی سختافزاری برداریم و ببینیم چطور میتوانیم این پایداری از دست رفته را دوباره به رک برگردانیم.
⏲ مدت زمان تخمینی مطالعه : 13 دقیقه
فهرست موضوعات
وقتی سرور ناگهان خاموش و روشن میشود اما لاگها خالی هستند!
تصور کنید ساعت ۳ صبح است، گوشی شما با پیامکهای مانیتورینگ منفجر میشود: «سرور از دسترس خارج شد». سراسیمه وارد پنل iLO میشوید، اما در بخش Integrated Management Log (IML) هیچ ردی از خطا نیست! نه ارور ولتاژ، نه دمای بالا؛ انگار یک نفر دوشاخه را کشیده و دوباره جا زده است.
این یکی از کلافهکنندهترین تجربههای یک ادمین شبکه است. در چنین شرایطی، مشکل معمولاً «خطای گذرا» (Transient Fault) است. یعنی اختلالی در کسری از ثانیه در سطح مدارات تغذیه رخ داده که حتی فرصت ثبت شدن در لاگهای سیستم را نداشته است. در ۹۰ درصد این تجربههای شخصی، مشکل یا از نوسان لحظهای منبع تغذیه بوده یا تداخل فریمور با سختافزارهای جدیدی که تازه به شاسی اضافه کرده بودید.
علل سخت افزاری خاموش شدن ناگهانی سرور
در بسیاری از موارد ریست شدن سرورها بهصورت ناگهانی به دلیل مشکلات سختافزاری است، مثلا مشکلات منبع تغذیه. با شناسایی این علل میتوان به جلوگیری از خاموش شدن سرور کمک کرد.
منبع تغذیه (Power Supply)
پاور سرور مثل قلب تپنده است؛ اگر یک لحظه تپش نامنظم داشته باشد، مغز (CPU) برای جلوگیری از آسیب، فرمان خاموشی میدهد. گاهی اوقات مشکل از خازنهای داخلی پاور است که در ظاهر سالماند، اما تحت فشار کاری (Workload) بالا، ولتاژ را ثابت نگه نمیدارند.
تغییر رنگ چراغ پاور به قرمز یا نارنجی معمولا هشدار این مشکل است. گاهی مسئله ساده و مربوط به شل بودن کابل برق است. اما در موارد جدیتر منبع تغذیه دچار آسیب داخلی میشود. در سرورهای دارای پاور Redundant ممکن است دستگاه با یک پاور فعال بماند و خطای پاور معیوب فقط در iLO یا لاگها ثبت شود. این وضعیت میتواند زمینهساز ریست شدن ناگهانی سرور باشد. برای عیبیابی ابتدا برق ورودی را بررسی کنید. سپس لاگها را تحلیل کنید و اگر خرابی تأیید شد، بهترین راه جایگزینی پاور با نمونه اصلی است.
یک فوت کوزهگری: همیشه چک کنید که آیا پاورهای شما در حالت Balanced Mode هستند یا High Efficiency. گاهی اوقات سوئیچ شدن بین این دو حالت در لحظه پیک مصرف، باعث ریست شدن سرور میشود. اگر به سلامت پاور شک دارید، میتوانید از صفحه خرید پاور سرور HP مدلهای اصلی و جدید را بررسی کنید تا خیالتان از پایداری ولتاژ راحت شود.
نشت خازنها یا مشکلات نامرئی در مادربرد
مادربرد سرور مثل یک اتوبان چند طبقه است. نشت خازنها (Capacitor Leakage) همیشه با باد کردن و ریختن مایع همراه نیست؛ گاهی فقط «تغییر ظرفیت» میدهند. اگر سرور شما با تکان خوردن رک یا لرزشهای ریز ریست میشود، احتمالاً با یک اتصال کوتاه یا لحیم سرد (Cold Joint) در مسیر تغذیه پردازنده روی مادربرد طرف هستید. در این موارد، پیشنهاد میکنم ریسک نکنید و از خدمات تعمیر تخصصی سرور استفاده کنید تا با دستگاههای BGA تست دقیق انجام شود.
اختلال در ماژولهای رم
مشکلات رم معمولا از همان لحظه روشن شدن سرور خود را نشان میدهند. سرور بوت نمیشود یا با بوقهای هشدار متوالی متوقف میگردد. در سرورهای مدل جدید پیام خطا بهصورت واضح روی نمایشگر یا در iLO نمایش داده میشود. دلیل این وضعیت اغلب نصب اشتباه رم، فرسودگی ماژول یا استفاده از رم ناسازگار است. رعایت نکردن چیدمان درست اسلاتها نیز میتواند باعث اختلال شود. این خطاها گاهی حتی منجر به ریست شدن ناگهانی سرور میشوند. برای عیبیابی، رمها باید جداگانه تست شوند تا قطعه معیوب مشخص شود. در نهایت استفاده از رم سالم و تأییدشده، بهترین راهحل پیشنهادی است.
مشکلات هار د دیسک
خرابی دیسک از مشکلات حساس سرور است که مستقیما روی دادهها اثر میگذارد. این ایراد با کندی سیستم، کرشهای پیدرپی یا بالا نیامدن سرور خود را نشان میدهد. در سرورهای HPE تغییر رنگ چراغ هارد به نارنجی یا قرمز نشانه هشدار است. گاهی مشکل سختافزاری نیست و خطای سکتور یا اختلال RAID باعث شناسایی نشدن دیسک میشود. این وضعیت میتواند حتی باعث ریست شدن ناگهانی سرور شود. برای بررسی این وضعیت، درایو باید از طریق ابزار مدیریتی سرور کنترل شود. در صورت تأیید خرابی، دیسک معیوب با نمونه سالم و همظرفیت جایگزین میشود تا بازسازی اطلاعات بهصورت خودکار انجام گیرد.
فنهای سرور
افزایش دمای سرور یکی از تهدیدهای جدی برای سلامت سختافزار است و میتواند باعث افت سرعت یا خاموشی ناگهانی شود. اختلال در فنها با هشدارهای حرارتی در iLO یا صدای غیرعادی فنها مشخص میشود. این وضعیت میتواند به دلایل مختلف مانند گردوغبار، خرابی فن یا تهویه نامناسب رک رخ دهد. ادامه این شرایط ممکن است به ریست شدن ناگهانی سرور منجر شود. برای پیشگیری باید فنها بررسی و در صورت نیاز تمیز یا تعویض شوند. کنترل دمای داخلی از طریق پنل مدیریتی و بهبود جریان هوا در محیط نقش مهمی در پایداری سرور دارد.
مادربرد یا CPU
خرابی مادربرد یا پردازنده از سنگینترین ایرادات سختافزاری در سرورهای HPE است که از همان ابتدای بوت یا در لاگهای iLO نشانههای خود را نشان میدهد. سرور ممکن است بالا نیاید، فریز شود یا قطعات سالم را شناسایی نکند. گاهی هیچ تصویری نمایش داده نمیشود و فقط الگوی خاص چراغها هشدار میدهد. این مشکلات مادربرد میتوانند بر اثر نوسان برق، گرمای زیاد، نصب اشتباه قطعات یا استفاده از سختافزار ناسازگار ایجاد شوند. در چنین شرایطی حتی با وجود سالم بودن رم و هارد، سرور راهاندازی نمیشود. برای بررسی، قطعات متصل به مادربرد مانند رم، کارتها یا هارد جدا میشوند تا سیستم به حداقل حالت برسد. اگر باز هم واکنشی دیده نشود، احتمال خرابی مادربرد یا CPU بالاست. تشخیص نهایی نیاز به تست تخصصی دارد و در بیشتر موارد تنها راه مطمئن، تعویض قطعه معیوب با نمونه سازگار است.
خمیر سیلیکون خشک شده و داغ کردن لحظهای CPU
خیلیها فکر میکنند خمیر سیلیکون تا ابد کار میکند. اما در محیطهای صنعتی، خمیر بعد از ۲ سال مثل گچ سفت میشود. نتیجه؟ پردازنده در عرض ۳ ثانیه از دمای ۵۰ به ۹۵ درجه میرسد و پیش از آنکه فنها فرصت کنند دور خود را بالا ببرند، سیستم برای نجات جان CPU، برق را قطع میکند.
اگر دور فنهای شما بدون دلیل بالا میرود، یعنی یک جای کار میلنگد. بهتر است پیش از سوختن قطعات، کولینگ سرور و وضعیت فن و تجهیزات خنککننده سرور خود را بررسی کرده و از سلامت سنسورهای محیطی مطمئن شوید.
پیشنهاد مطالعه بیشتر: خطاهای سرور hp و راه حل های آن
علل نرم افزاری ریست شدن ناگهانی سرور
گاهی خاموش شدن ناگهانی سرورهای HP به مشکلات فریمور و تنظیمات نرمافزاری برمیگردد. نسخههای قدیمی iLO یا BIOS میتوانند باگهای پنهان داشته باشند. این خطاها بدون هشدار سیستم را ریست یا خاموش میکنند. تنظیمات مدیریت انرژی هم نقش مهمی دارند. بعضی وابستگیهای سیستمعامل یا اجرای تسکهای زمانبندیشده چنین رفتاری را فعال میکند. حتی ممکن است هیچ لاگی ثبت نشود. بهروزرسانی System ROM و اصلاح تنظیمات پاور بسیاری از این ایرادها را برطرف میکند. در نتیجه با آپدیت اصولی میتوان از ریست شدن ناگهانی سرور جلوگیری کرد.
ایرادهای iLO/BIOS/System ROM
نسخههای قدیمی System ROM و iLO گاهی ناپایدار هستند و میتوانند بدون ثبت خطا باعث خاموشی یا ریست ناگهانی سرور شوند. این مشکل بهدلیل باگهای پنهان در فریمور رخ میدهد. بهروزرسانی System ROM به نسخههای جدیدتر میتواند این خاموشیهای غیرمنتظره را رفع میکند. همچنین فریمورهای قدیمی iLO به هنگام فلش دچار اختلال میشوند و کنترلر را قفل میکنند. آپدیت منظم فریمور راهکاری ساده برای افزایش پایداری سرور و جلوگیری از قطعی ناخواسته است.
تنظیمات مربوط به OS و مدیریت مصرف انرژی
برخی تنظیمات داخلی سیستمعامل مثل تسکهای زمانبندیشده یا مدیریت مصرف انرژی در ویندوز سرور و Hyper-V میتوانند بدون هشدار باعث خاموشی یا ریست سرور شوند. این اتفاق در سطح OS رخ میدهد و به همین دلیل در iLO هیچ گزارشی ثبت نمیشود. حتی قابلیتهایی مانند ASR بهصورت خودکار سرور را ریست میکنند و در ترکیب با تنظیمات BIOS رفتارهای غیرمنتظرهای ایجاد میشود. با تغییر تنظیمات سیستمعامل و هماهنگی آن با BIOS میتوانید از این خاموشیهای ناگهانی سرور جلوگیری کنید.
فریمور (Firmware)؛ حلقهی گمشده در ریستهای بیدلیل
بسیاری از مدیران شبکه فریمور را جدی نمیگیرند، اما فریمور در واقع دستورالعمل رفتار سختافزار است.
- باگهای iLO: نسخههای قدیمی iLO (مثلاً در سرورهای G9) باگی داشتند که باعث میشد سرویس مدیریت از راه دور به اشتباه دستور Cold Reset صادر کند.
- تداخل BIOS: وقتی یک کارت شبکه یا SSD جدید (Non-HP) روی سرور میبندید، اگر BIOS قدیمی باشد، نمیتواند مصرف برق آن را مدیریت کند و سیستم ریست میشود.
برای اینکه بفهمید در لحظه ریبوت چه اتفاقی افتاده، حتماً باید آموزش کار با پنل iLO و نحوه اتصال سرور به iLO را بلد باشید تا بتوانید لاگهای سطح پایین مثل AHS را استخراج کنید.
چطور بفهمیم مشکل از سختافزار است یا نرمافزار؟
- استفاده از Stress Test: با ابزارهایی مثل Prime95 یا ابزار تست داخلی HP، سیستم را زیر فشار ببرید. اگر در لحظه فشار ریست شد، شک نکنید که پاور یا مادربرد مشکل دارد.
- بررسی IML و SEL: این لاگها حتی اگر سیستمعامل بالا نیاید، ثبت میشوند. پیامهایی مثل Power Overload یا CPU IERR کلید حل معما هستند.
ابزارهای تشخیصی لاگ ها
برای جلوگیری از ریست شدن ناگهانی سرورهای HP، بررسی دقیق لاگهای iLO، مانند Integrated Management Log (IML) و Active Health System (AHS)، اهمیت زیادی دارد. این لاگها معمولا پیامهایی مانند Unexpected Shutdown and Restart ثبت میکنند که بدون خطای مشخص در سیستمعامل ظاهر میشوند و ناشی از مشکلات Firmware یا سختافزار هستند. بهروزرسانی System ROM و استفاده از ابزارهای تشخیصی مثل Embedded Diagnostics و SmartStart میتواند این مسائل را برطرف کند. همچنین AHS حتی بدون قرارداد سرویس، اطلاعاتی از فشارهای سختافزاری و دمای سرور ارائه میدهد و زمان وقوع خاموشی را مشخص میکند. دنبال کردن راهنمای رسمی HPE و نمودارهای تصمیمگیری آن برای جریانهای Power-On، POST و Boot به مدیران IT کمک میکند تا سریعتر مشکل اصلی را شناسایی و رفع کنند.
چک لیست خاموش شدن ناگهانی سرور HP
برای جلوگیری از ریست شدن ناگهانی سرورهای HP، بهتر است یک روند مرحلهای دنبال شود. در ادامه به چک لیست این مراحل میپردازیم.
بررسی منبع برق: دکمه پاور، کابلها و پریز را چک کنید. وضعیت LED پاور و PSU باید طبیعی باشد. در صورت مشکل در منبع تغذیه آن را با نمونه سالم تست کنید.
ایجاد حالت حداقلی در سرور: تمام قطعات غیرضروری سرور را جدا کنید. هر بار یک قطعه را اضافه و سرور را روشن کنید تا عامل خاموشی مشخص شود.
بهروزرسانی فریمور و BIOS: نصب آخرین نسخه iLO، System ROM و درایورها با SPP یا Smart Update Manager، بسیاری از ریستها و خاموشیهای ناگهانی را برطرف میکند.
سلامت PSU یا منبع تغذیه: خطاهای عمومی پاور نشانه خرابی هستند. جابهجایی PSU با اسلات دیگر یا تعویض آن راه تشخیص سریع است.
ریست تنظیمات NVRAM و CMOS: استفاده از سوییچهای Maintenance یا قطع باتری و پاور برای چند دقیقه خطاهای پنهان تنظیماتی را برطرف میکند.
تعویض قطعات حساس: باتری RAID ضعیف، کنترلر معیوب یا مادربرد خراب میتوانند باعث خاموشی بدون هشدار شوند. در صورت نیاز قطعه را تعویض کنید.
قابلیت ASR: اگر ریبوت خودکار بدون دلیل رخ میدهد، غیرفعالسازی ASR در BIOS کمک میکند رفتار واقعی سرور مشخص شود.
پیشنهاد مطالعه بیشتر: Power Capping در سرورهای HPE
جمع بندی
واقعیت این است که ریست شدن ناگهانی سرور، فریادِ کمکِ سختافزار شماست. همانطور که دیدیم، این مشکل میتواند از یک باگِ ساده در نسخه iLO شروع شود و به نشتیِ خازنهای مادربرد یا افت ولتاژ در پاورهای فرسوده ختم شود. به عنوان کسی که سالها در دیتاسنترها با این غولهای فلزی سروکله زدهام، توصیهام به شما این است: هیچ ریبوتِ بدون دلیلی را نادیده نگیرید. حتی اگر سرور دوباره بالا آمد و هفتهها بدون مشکل کار کرد، آن خطا مثل یک بمب ساعتی در دل سیستم شما باقی مانده است.
عیبیابی اصولی یعنی حرکت از راهحلهای ارزان و نرمافزاری (مثل آپدیت فریمور و چک کردن دمای اتاق سرور) به سمت بررسیهای دقیقتر سختافزاری. اگر چکلیستهای این مقاله را دنبال کردید و هنوز منشأ مشکل مثل یک معما باقی مانده، نگران نباشید؛ گاهی تشخیص نهایی نیاز به ابزارهای پیشرفته تستر و تجربه کارگاهی دارد.
ما در تجارت سرور پارسه، نبض سرورهای HP را میشناسیم. اگر پایداری شبکه شما به خطر افتاده، تیم فنی ما آماده است تا با تستهای استرسِ پیشرفته و تأمین قطعات ۱۰۰٪ اورجینال، آرامش را به اتاق سرور شما برگرداند. فراموش نکنید، پیشگیری با یک سرویس دورهای ساده یا تعویض یک قطعه مشکوک، بسیار ارزانتر از بازیابی اطلاعات از دست رفته پس از یک سوختگی ناگهانی است.
سوالات متداول
✔ آیا ضعیف شدن باتری RAID Controller میتواند باعث ریست سرور شود؟
خیر، معمولاً باعث ریست نمیشود. وقتی باتری ضعیف شود، کنترلر برای جلوگیری از خطر از دست رفتن داده، Cache را غیرفعال میکند و همین موضوع باعث کاهش شدید سرعت سرور میشود. اما اگر خود کارت RAID دچار خرابی فیزیکی شود، ممکن است سرور فریز کند یا ریست شود.
✔ اگر سرور فقط زیر بار ترافیکی سنگین ریست میشود، مشکل از کجاست؟
در چنین شرایطی، اولین مظنون پاور است؛ زیرا ممکن است نتواند آمپر موردنیاز را تأمین کند. دومین عامل مهم، دمای پردازنده است. اگر سیستم خنککاری درست کار نکند یا خمیر حرارتی خشک شده باشد، پردازنده برای محافظت از خود باعث ریست سیستم میشود.
✔ آیا پاورهای Redundant همیشه جلوی خاموشی سرور را میگیرند؟
نه همیشه! پاورهای Redundant فقط زمانی مفیدند که مشکل از خرابی یا قطع شدن یک پاور باشد. اگر نوسان یا مشکل روی بکپلین (Backplane) مادربرد یا مدار تغذیه داخلی باشد، حتی داشتن دو پاور هم کمکی نمیکند و ممکن است سرور همچنان خاموش یا ریست شود.
