การทำความเข้าใจกับเอาต์พุต smartctl -a


13

ฉันมี 6 ไดรฟ์ในกล่อง NAS สองคนคือ Seagates และพวกเขากลับ RAW_VALUES สูงสำหรับข้อผิดพลาด; ดูด้านล่าง

ไดรฟ์อื่นของฉันแสดงค่าที่ต่ำกว่ามาก

นี่เป็นสาเหตุของการเตือนหรือไม่ หรือวิธีรายงานของซีเกท?

ดูRaw_Read_Error_RateและSeek_Error_Rate:

# smartctl -a /dev/ada1
=== START OF INFORMATION SECTION ===
Device Model:     ST3000DM001-9YN166
Serial Number:    W1F09S26
LU WWN Device Id: 5 000c50 0456076fc
Firmware Version: CC4C
User Capacity:    3,000,592,982,016 bytes [3.00 TB]
Sector Sizes:     512 bytes logical, 4096 bytes physical
Device is:        Not in smartctl database [for details use: -P showall]
ATA Version is:   8
ATA Standard is:  ATA-8-ACS revision 4
Local Time is:    Sat Aug 18 17:34:24 2012 EDT
SMART support is: Available - device has SMART capability.
SMART support is: Enabled

=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED

General SMART Values:
Offline data collection status:  (0x82) Offline data collection activity
                    was completed without error.
                    Auto Offline Data Collection: Enabled.
Self-test execution status:      ( 249) Self-test routine in progress...
                    90% of test remaining.
Total time to complete Offline 
data collection:        (  575) seconds.
Offline data collection
capabilities:            (0x7b) SMART execute Offline immediate.
                    Auto Offline data collection on/off support.
                    Suspend Offline collection upon new
                    command.
                    Offline surface scan supported.
                    Self-test supported.
                    Conveyance Self-test supported.
                    Selective Self-test supported.
SMART capabilities:            (0x0003) Saves SMART data before entering
                    power-saving mode.
                    Supports SMART auto save timer.
Error logging capability:        (0x01) Error logging supported.
                    General Purpose Logging supported.
Short self-test routine 
recommended polling time:    (   1) minutes.
Extended self-test routine
recommended polling time:    ( 255) minutes.
Conveyance self-test routine
recommended polling time:    (   2) minutes.
SCT capabilities:          (0x3085) SCT Status supported.

SMART Attributes Data Structure revision number: 10
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000f   111   099   006    Pre-fail  Always       -       34053632
  3 Spin_Up_Time            0x0003   093   092   000    Pre-fail  Always       -       0
  4 Start_Stop_Count        0x0032   100   100   020    Old_age   Always       -       32
  5 Reallocated_Sector_Ct   0x0033   100   100   036    Pre-fail  Always       -       0
  7 Seek_Error_Rate         0x000f   060   055   030    Pre-fail  Always       -       21480133713
  9 Power_On_Hours          0x0032   097   097   000    Old_age   Always       -       2696
 10 Spin_Retry_Count        0x0013   100   100   097    Pre-fail  Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   020    Old_age   Always       -       32
183 Runtime_Bad_Block       0x0032   100   100   000    Old_age   Always       -       0
184 End-to-End_Error        0x0032   100   100   099    Old_age   Always       -       0
187 Reported_Uncorrect      0x0032   100   100   000    Old_age   Always       -       0
188 Command_Timeout         0x0032   100   100   000    Old_age   Always       -       0
189 High_Fly_Writes         0x003a   100   100   000    Old_age   Always       -       0
190 Airflow_Temperature_Cel 0x0022   064   061   045    Old_age   Always       -       36 (Min/Max 34/38)
191 G-Sense_Error_Rate      0x0032   100   100   000    Old_age   Always       -       0
192 Power-Off_Retract_Count 0x0032   100   100   000    Old_age   Always       -       28
193 Load_Cycle_Count        0x0032   100   100   000    Old_age   Always       -       63
194 Temperature_Celsius     0x0022   036   040   000    Old_age   Always       -       36 (0 19 0 0)
197 Current_Pending_Sector  0x0012   100   100   000    Old_age   Always       -       0
198 Offline_Uncorrectable   0x0010   100   100   000    Old_age   Offline      -       0
199 UDMA_CRC_Error_Count    0x003e   200   200   000    Old_age   Always       -       0
240 Head_Flying_Hours       0x0000   100   253   000    Old_age   Offline      -       43748536879750
241 Total_LBAs_Written      0x0000   100   253   000    Old_age   Offline      -       2867098636991
242 Total_LBAs_Read         0x0000   100   253   000    Old_age   Offline      -       17478042509157

SMART Error Log Version: 1
No Errors Logged

SMART Self-test log structure revision number 1
Num  Test_Description    Status                  Remaining  LifeTime(hours)  LBA_of_first_error
# 1  Extended offline    Self-test routine in progress 90%      2696         -

SMART Selective self-test log data structure revision number 1
 SPAN  MIN_LBA  MAX_LBA  CURRENT_TEST_STATUS
    1        0        0  Not_testing
    2        0        0  Not_testing
    3        0        0  Not_testing
    4        0        0  Not_testing
    5        0        0  Not_testing
Selective self-test flags (0x0):
  After scanning selected spans, do NOT read-scan remainder of disk.
If Selective self-test is pending on power-up, resume after 0 minute delay.

คำตอบ:


4

Seagate ใช้ SER (Seek_Error_Rate) เพื่อเขียนโค้ดตัวนับสองตัวที่แตกต่างกัน: 16 บิตน้ำหนักสูงใช้สำหรับ Seek Error Count และ 32 บิตน้ำหนักต่ำที่ใช้สำหรับจำนวน Seek คุณต้องการแสดงเลขฐานสิบหกเพื่อความสะดวกในการอ่านของคุณสองเคาน์เตอร์ (6 nibbles = 2 สำหรับการนับข้อผิดพลาด + 4 สำหรับการค้นหานับ)

RRER (Raw_Read_Error_Rate) ไม่แสดงตัวนับที่เพิ่มขึ้น แต่ผลลัพธ์ของบางอย่างเช่น-10 บันทึก (จำนวนเซ็กเตอร์ที่ผิดพลาด / บิตทั้งหมดบนดิสก์)ซึ่งอธิบายว่ามีนาทีและสูงสุด อยู่ใกล้กับจุดสูงสุดจะดีกว่า

คำอธิบายเพิ่มเติมเกี่ยวกับเรื่องนี้ที่นี่: http://www.users.on.net/~fzabkar/HDD/Seagate_SER_RRER_HEC.html


3

ไดรฟ์ซีเกททุกตัวที่ฉันเคยเห็นรายงานค่าดิบที่แปลกประหลาดสำหรับทั้งสองฟิลด์

สิ่งหนึ่งที่คุณสามารถทำได้คือสิ่งเดียวกันที่ยูทิลิตี้ (และไดรฟ์) ทำภายใน: ตรวจสอบค่าปกติกับค่าขีด จำกัด เมื่อค่าลดลงถึงขีด จำกัด แอตทริบิวต์จะรายงานว่าล้มเหลว (หรือล้มเหลว)

อีกสิ่งที่คุณสามารถทำได้คือไม่เคยซื้อไดรฟ์ Seagate อีก ฉันไปเส้นทางนี้และฉันจะไม่ซื้ออีกจนกว่าพวกเขาจะเรียนรู้การเขียนเฟิร์มแวร์


3

ฉันพบว่าผลการทดสอบตัวเองนั้นน่าเชื่อถือมากและพวกเขาอธิบายตนเองได้ (ไม่ว่าการทดสอบครั้งสุดท้ายที่ผ่านมาล้มเหลวหรือผ่านไปแล้ว)

คุณลักษณะเฉพาะของผู้จัดจำหน่ายที่หลากหลายเป็นเพียงแค่นั้น อันที่จริงไม่มีวิธีมาตรฐานในการตีความพวกเขา (ซึ่งเป็นเหตุผลที่เครื่องมือ smartmon รักษาฐานข้อมูลไดรฟ์ที่มีการตีความค่าเหล่านั้น) คุณสามารถดูคำอธิบายความหมายของหลาย ๆ คนได้ที่นี่: http://en.wikipedia.org/wiki/SMART#Known_ATA_S.MART_attributes

บรรทัดSMART overall-health self-assessment test result: PASSEDมาจากค่าที่พิมพ์ด้านล่างแปลเป็นมาตรฐานและกำหนดเกณฑ์โดยฐานข้อมูลไดรฟ์

สำหรับค่าที่ทำให้เป็นมาตรฐานนั้นต่ำกว่ามักจะดีกว่า แต่ไม่ใช่ทุกสถานะที่บ่งบอกถึงสิ่งต่าง ๆ ที่จะบ่งบอกถึงความล้มเหลวทางกล สิ่งต่าง ๆ เช่นข้อผิดพลาดในการอ่านที่ไม่สามารถแก้ไขได้ความล้มเหลวในการหมุนวนเป็นต้นเป็นตัวบ่งชี้ที่น่าจะเป็น

ไดรฟ์ของคุณดูเหมือนจะอยู่ในสภาพดีจากผลลัพธ์เหล่านั้น


1

สิ่งที่ฉันทำคือตรวจสอบการอ่าน hwecc และค้นหาอัตราข้อผิดพลาด ฉันยังตรวจสอบเพื่อให้แน่ใจว่ามีการย้ายที่อยู่หรือภาคที่ค้างอยู่ไม่อยู่ หลังจากที่ฉันได้ # # จาก 3 ตัวแรกฉันจะคัดลอกไปมาจากไดรฟ์แล้วตรวจสอบ # อีกครั้ง หากพวกเขายังไม่ได้ขึ้นไปฉันจะจับตามองไดรฟ์ ถ้าพวกเขายิงฉันเรียกผู้ขายและดูว่าจะต้องทำอย่างไรเพื่อรับ rma

ฉันมีไดรฟ์อายุ 3 ปีที่มีข้อผิดพลาดการอ่าน 23441590 206428348 ค้นหาและ 27659067 ecc นั่นคือ powerd ในชั่วโมง btw และไดรฟ์เก่า 5.5 ปีของฉันมี 0 0 687123415 ecc ความล้มเหลวอันชาญฉลาดเป็นระบบเตือนภัยล่วงหน้าที่ไม่น่าไว้วางใจ แต่สามารถใช้เพื่อเก็บแท็บบนไดรฟ์ได้ ฉันได้เห็นไดรฟ์น้อยมากที่มีความล้มเหลวที่คาดการณ์อย่างชาญฉลาดก่อนที่มันจะเกิดขึ้น fyi ของฉัน 3 ปีไดรฟ์เก่าเป็นซีเกทและ 5 ปีเป็นซัมซุงซีเกทวิ่งร้อนไป: / ทั้งหมดของซีเกทที่ทำงานอยู่ในปัจจุบันของฉันมีข้อผิดพลาดมากมายที่แบรนด์อื่น ๆ ของฉันส่วนใหญ่ไม่

สิ่งที่ต้องทำก็คือรักษามาตรฐานของไดรฟ์ของคุณเป็นครั้งคราว hdd tune เป็นตัวอย่างที่ดีสำหรับ windows หากคุณรันบนไดรฟ์ที่ไม่มีไฟล์ swap หรือบูตจากกราฟสามารถบอกคุณได้ว่ามีพื้นที่ใดบ้างที่อ่านปัญหา ไดรฟ์ที่ทันสมัยมักจะเป็นขั้นบันไดจาก 50mb + ถึง 25 หรือมากกว่านั้นอัตราการอ่าน mb หากคุณมีการลดลงอย่างกะทันหันอาจเป็นไปได้ว่ามีส่วนที่อ่อนแอหรือไม่ดีในพื้นที่นั้น หากคุณรักษามาตรฐานของไดรฟ์ทุก ๆ เดือนหรือ 3 ครั้งคุณสามารถมีความคิดที่ดีหากมีบางสิ่งที่น่าสนใจเกิดขึ้น ละติจูด D4xx เป็น exmaple ที่ดี เมื่อตัวควบคุมไดรฟ์เริ่มล้มเหลวอัตราการอ่านจะเริ่มที่ 5mb หรือมากกว่านั้นและบางครั้งก็พุ่งสูงกว่า 10mb เราได้รับไดรฟ์เหล่านั้น rma'd ตลอดเวลาเนื่องจากสิ่งนั้น คุณอาจต้องบู๊ตจากดิสก์บาร์ตหรือสิ่งที่คล้ายกันเพื่อให้แน่ใจว่าไม่มีสิ่งใดที่ใช้ไดรฟ์เมื่อคุณทำการทดสอบ

ฉันมักจะใช้ผลลัพธ์เหล่านี้รวมถึงการปรับแต่ง hdd และเพื่อให้ได้ rma's บนไดรฟ์ก่อนที่พวกเขาจะตายอย่างสมบูรณ์


ฉันต้องเพิ่มไม่ใช่ว่าผลการทดสอบตัวเองนั้นผิดเมื่อบอกว่ามันเป็นไดรฟ์ที่ล้มเหลว แต่มันก็ไม่ได้หาไดรฟ์ที่ล้มเหลวหรือเตือนล่วงหน้าเสมอไป ฉันเคยเห็นไดรฟ์ sme ในที่ทำงานผ่านการทดสอบทั้งหมด แต่คุณสามารถได้ยินเสียงคลิกหรือเครื่องหมายมาตรฐานแสดงว่ามันช้าในบางพื้นที่ หนึ่งสัปดาห์ต่อมามันก็ล้มเหลว แอปพลิเคชันที่แปลกประหลาดทั้งหมดหยุดทำงานและอื่น ๆ ในสัปดาห์นั้นสิ้นสุดลงเป็นอาการของความล้มเหลวของไดรฟ์
Kendrick

1

smartctlหน้าคนบนกล่องของฉันให้เชื่อมโยงไปยังหนึ่งในผู้เขียนของ a บทความในวารสารลินุกซ์ ; โดยเฉพาะในรายที่ 3 smartctl -aอธิบายการส่งออกของ

แม้ว่าจะมีอายุมากกว่า 10 ปี แต่เมื่ออ่านแล้วฉันพบว่ายังมีความเกี่ยวข้องและให้คำอธิบายที่เชื่อถือได้


1
คุณอาจต้องการที่จะพูดว่าเป็นส่วนหนึ่งที่นี่เพื่อที่จะทำซ้ำข้อมูลและป้องกันไม่ให้เกิดภาวะที่กลืนไม่เข้าคายไม่ออกลิงค์เสีย ;-)
JepZ
โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.