สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ทักษะข้อมูลและสถิติใดที่เป็นที่ต้องการสูงในขณะนี้และพวกเขาต้องการอะไรมาก?
โพสต์นี้เกี่ยวข้องกับเหตุการณ์ที่เปลี่ยนแปลงอย่างรวดเร็ว ฉันมีงานที่ต้องทำการวิเคราะห์ข้อมูลทางการเงิน งานปัจจุบันของฉันคือสิ่งที่ฉันไม่ได้สัมผัสกับสิ่งที่เกิดขึ้นในส่วนที่เหลือของอุตสาหกรรมของฉันหรืออุตสาหกรรมอื่น ๆ ฉันมีความรู้พอสมควรเกี่ยวกับสถิติของเบย์ ฉันต้องการทำให้ตลาดของตัวเองดังนั้นฉันอยากรู้ว่าทักษะข้อมูลและสถิติใดที่เป็นที่ต้องการสูงในขณะนี้ โลกของซอฟต์แวร์นั้นจมอยู่ใต้ข้อมูลดังนั้นฉันคาดหวังให้พวกเขาต้องการนักสถิติที่แย่มาก แต่ความประทับใจของฉันก็คือพวกเขาไม่ต้องการมากนัก เพื่อนของฉันได้แนะนำว่าอุตสาหกรรมซอฟต์แวร์ส่วนใหญ่ต้องการทักษะ "ข้อมูลขนาดใหญ่" ไม่ใช่ทักษะด้านสถิติ ทักษะข้อมูลและสถิติใดที่เป็นที่ต้องการสูงในขณะนี้และพวกเขาต้องการอะไรมาก?
9 careers 


3
ความแตกต่างระหว่างการพึ่งพาเชิงพื้นที่และความแตกต่างเชิงพื้นที่คืออะไร?
ความแตกต่างระหว่างการพึ่งพาเชิงพื้นที่และความแตกต่างเชิงพื้นที่คืออะไร? คำถามของฉันคือแรงบันดาลใจจากการอ่านในรูปแบบสเปปัญหาในเศรษฐมิติเชิงพื้นที่โดยเฉพาะอย่างยิ่งAnselin (2010)

1
เส้นประในพล็อต ACF ใน R
ฉันกำลังอ่านหนังสือ 'Introductory Time Series with R' โดย Cowpertwait และ Metcalfe ในหน้า 36 ของมันกล่าวว่าเส้นอยู่ที่:{n} ผมเคยอ่านที่นี่ฟอรั่ม Rว่าสายอยู่ที่{n} - 1 / n ± 2 /n--√−1/n±2/n-1/n \pm 2/\sqrt{n}± 1.96 /n--√±1.96/n\pm 1.96/\sqrt{n} ฉันรันรหัสต่อไปนี้: b = c(3,1,4,1) acf(b) และผมเห็นว่าเส้นที่มีลักษณะที่จะปรากฏเป็นที่{4} เห็นได้ชัดว่าหนังสือผิด หรือฉันกำลังอ่านสิ่งที่เขียนผิด? ผู้เขียนกำลังพูดถึงสิ่งที่แตกต่างกันเล็กน้อยหรือไม่?± 1.96 /4-√±1.96/4\pm 1.96/\sqrt{4} * หมายเหตุฉันไม่สนใจข้อแตกต่างของรายละเอียดเล็กน้อย 1.96 กับ 2 ฉันคิดว่านี่เป็นเพียงผู้เขียนที่ใช้กฏของ thumb ของ 2 sd เทียบกับ …
9 r  time-series 

1
วิธีการคำนวณ
ฉันพยายามที่จะแก้ปัญหาสำหรับวิทยานิพนธ์ของฉันและฉันไม่เห็นวิธีที่จะทำ ฉันมีการสังเกต 4 ครั้งสุ่มจากการแจกแจงแบบสม่ำเสมอฉันต้องการที่จะคำนวณความน่าจะเป็นที่{(3)} เป็นสถิติลำดับที่หนึ่ง (ฉันรับสถิติการสั่งซื้อเพื่อให้การสังเกตของฉันถูกจัดอันดับจากน้อยที่สุดไปหามากที่สุด) ฉันได้แก้ไขมันเพื่อกรณีที่ง่ายกว่า แต่ที่นี่ฉันหลงทางไปแล้วว่าจะทำอย่างไร(0,1)(0,1)(0,1)3X(1)≥X(2)+X(3)3X(1)≥X(2)+X(3)3 X_{(1)}\ge X_{(2)}+X_{(3)}X(i)X(i)X_{(i)} ยินดีต้อนรับทุกความช่วยเหลือ

2
ANOVA แบบแยกส่วนที่มีสองปัจจัยเหมือนกับ ANOVA แบบสองทางที่มีการวัดซ้ำในปัจจัยเดียวหรือไม่
ANOVA แบบ "แยกส่วน" ที่มีสองปัจจัยเหมือนกับ ANOVA แบบสองทางที่มีการวัดซ้ำในปัจจัยเดียวหรือไม่ ถ้าไม่ความแตกต่างคืออะไร?

2
ประเมินค่าสูงสุดของอนุกรมเวลาของข้อมูลสัญญาณมือถือ
ฉันกำลังวัดการมีอยู่ของการตอบสนองในการวัดสัญญาณของเซลล์ สิ่งที่ฉันทำคือการใช้อัลกอริทึมที่ปรับให้เรียบ (Hanning) กับอนุกรมเวลาของข้อมูลจากนั้นตรวจจับจุดสูงสุด สิ่งที่ฉันได้คือ: ถ้าฉันต้องการให้การตรวจจับการตอบสนองมีวัตถุประสงค์มากกว่า "คุณเห็นการลดลงอย่างต่อเนื่อง" อะไรคือวิธีที่ดีที่สุด มันคือการหาระยะทางของยอดเขาจากพื้นฐานที่กำหนดโดยการถดถอยเชิงเส้นหรือไม่? (ฉันเป็นงูใหญ่และไม่มีความเข้าใจในสถิติ) ขอบคุณ

3
นักมายากลผู้มีชื่อเสียง
คุณอาจรู้เคล็ดลับในหนังThe Prestige : [MOVIE SPOILER]นักมายากลพบเคล็ดลับมายากลที่น่าประทับใจ: เขาเข้าไปในเครื่องปิดประตูแล้วหายไปและปรากฏขึ้นอีกครั้งในอีกด้านหนึ่งของห้อง แต่เครื่องจักรนั้นไม่สมบูรณ์แบบ: แทนที่จะเพียงแค่เคลื่อนย้ายเขามันซ้ำซ้อน นักมายากลอยู่ที่ที่เขาอยู่และสำเนาจะถูกสร้างขึ้นที่ด้านอื่น ๆ ของห้อง จากนั้นนักมายากลในเครื่องจะตกลงไปในถังเก็บน้ำอย่างระมัดระวังใต้พื้นและจมน้ำ แก้ไข:ความน่าจะเป็นของสำเนาใหม่ของนักมายากลที่ถูกจมน้ำตายคือ 1/2 (ในคำอื่น ๆ สำเนาใหม่มีโอกาส 1/2 ของการถูกจมน้ำและ 1/2 โอกาสที่จะโผล่เข้ามาในห้อง) ยิ่งไปกว่านั้นถังเก็บน้ำไม่เคยล้มเหลวและมีโอกาส 1 ที่นักมายากลตกลงในถังจะตาย นักมายากลจึงไม่ชอบทำเคล็ดลับนี้เพราะ "คุณไม่เคยรู้ว่าคุณจะอยู่ที่ไหนในอีกด้านหนึ่งของห้องหรือจมน้ำตาย" ทีนี้ความขัดแย้งดังต่อไปนี้: ลองจินตนาการว่านักมายากลทำกลอุบาย 100 ครั้ง โอกาสในการอยู่รอดของเขาคืออะไร แก้ไขคำถามเพิ่มเติม: โอกาสของนักมายากลในการรักษาสมองทางกายภาพของเขาและไม่มีใหม่ได้อย่างไร การวิเคราะห์อย่างรวดเร็ว: มือข้างหนึ่งมีนักมายากลคนหนึ่งมีชีวิตอยู่และนักมายากลจมน้ำ 100 คนดังนั้นโอกาสของเขาคือ 1 จาก 100 ในทางกลับกันทุกครั้งที่เขาทำเคล็ดลับเขามีโอกาส 1/2 ของการมีชีวิตอยู่ดังนั้นโอกาสของเขาคือ ( 1 / 2)100= 1 / (2100)(1/2)100=1/(2100)(1/2)^{100}=1/(2^{100}) …

2
วิธีการค้นหาเมื่อกราฟถึงจุดสูงสุดและที่ราบสูง?
นี่อาจฟังดูธรรมดามาก แต่ฉันมีปัญหานี้: ฉันมีคิวของข้อมูลที่มีขนาดหน้าต่าง 300 ข้อมูลใหม่ถูกเพิ่มที่ปลายด้านหนึ่งค่าเก่าจะถูกลบออกจากปลายอีกด้าน ฉันคาดว่าข้อมูลคิวจะคงที่หรือมากกว่านั้นเช่น 10,12,15,10,20 จากนั้นเริ่มเพิ่มขึ้นอย่างรวดเร็ว: 15,10,20,22,25,26,28,30,32 ... ไปจนถึง 150 หรือมากกว่านั้น ข้อมูลอาจมีความผันผวนเล็กน้อยจากนั้นจะลงไปตามความลาดชันที่คล้ายกัน (120,118,116,115 ... ) ไปจนถึง 20 หรือมากกว่านั้น ฉันพยายามระบุจุดเปลี่ยนในชุดข้อมูลนี้โดยทางโปรแกรม แต่โค้ดของฉันตรวจพบจุดสูงสุดบ่อยกว่าที่ฉันต้องการ ฉันจะระบุได้อย่างไรเมื่อกราฟเพิ่มขึ้นเมื่อมาถึงจุดเปลี่ยนที่แน่นอนและเมื่อมันเริ่มลดลง ฉันควรลองดูที่อัตราการเปลี่ยนแปลงของอัตราการเปลี่ยนแปลงหรือไม่

3
วิธีตรวจสอบอัตราความผิดพลาดต่ำมาก
ฉันเผชิญกับการพยายามสาธิตผ่านการทดสอบอัตราความผิดพลาดต่ำมากสำหรับเซ็นเซอร์ (ไม่เกิน 1 ข้อผิดพลาดใน 1,000,000 ครั้ง) เรามีเวลา จำกัด ในการดำเนินการทดสอบดังนั้นเราคาดว่าจะไม่สามารถได้รับมากกว่า 4,000 ครั้ง ฉันเห็นว่าไม่มีปัญหาในการแสดงเซ็นเซอร์ไม่เป็นไปตามข้อกำหนดเนื่องจากแม้แต่ข้อผิดพลาดเพียงครั้งเดียวในความพยายาม 4,000 ครั้งจะให้ช่วงความมั่นใจ 95% สำหรับอัตราข้อผิดพลาดที่มีขีด จำกัด ล่างมากกว่า 0.000001 แสดงว่ามันเป็นไปตามข้อกำหนด แต่เป็นปัญหาเนื่องจากแม้แต่ 0 ข้อผิดพลาดในความพยายาม 4,000 ครั้งยังคงส่งผลให้ขอบเขตล่างมากกว่า 0.000001 ข้อเสนอแนะใด ๆ ที่จะได้รับการชื่นชมอย่างมาก.

1
ประมาณช่วงความมั่นใจของค่าเฉลี่ยโดยวิธี bootstrap t หรือเพียงแค่โดย bootstrap?
เมื่อประเมินช่วงความมั่นใจของค่าเฉลี่ยฉันคิดว่าทั้งวิธี bootstrap t และวิธี bootstrap แบบ nonparametric นั้นสามารถใช้ได้ แต่วิธีแรกนั้นต้องใช้การคำนวณมากกว่าเล็กน้อย ฉันสงสัยว่าข้อดีและข้อเสียของ bootstrap ที่มากกว่า bootstrap nonparametric ปกติคืออะไร? ทำไม? มีการอ้างอิงบางอย่างสำหรับการอธิบายเรื่องนี้หรือไม่?

5
ฉันจะทำอะไรได้นอกจากความสัมพันธ์ของเพียร์สัน?
ในขณะที่ตรวจสอบเพื่อดูว่ามีตัวแปรสองตัวที่มีความสัมพันธ์กันหรือไม่ฉันสังเกตว่าการใช้ความสัมพันธ์แบบเพียร์สันให้ผลเป็นตัวเลขต่ำสุดเพียง 0.1 ซึ่งบ่งชี้ว่าไม่มีความสัมพันธ์กัน มีสิ่งใดที่ฉันสามารถทำได้เพื่อเสริมสร้างการเรียกร้องนี้? ชุดข้อมูล (ชุดย่อยเนื่องจากข้อ จำกัด การโพสต์) ฉันกำลังดูอยู่นี้: 6162.178176 0.049820046 4675.14432 0.145022261 5969.056896 0.47210138 5357.506176 0.052263122 33.796224 16.45154204 6162.178176 0.064262991 6725.448576 0.419005508 3247.656192 0.867394771 5357.506176 0.052263122 3612.97728 0.091337414 6162.178176 0.053065652 867.436416 0.129116092 556.833024 1.01107509 1517.611392 168.1484478 1517.611392 35.11570899 4675.14432 0.053902079 4182.685056 0.070289777 2808.30528 0.071929502 5969.056896 0.47193385 3247.656192 0.896646636 4387.071744 …

5
การแก้ไขการเปรียบเทียบหลายรายการจำเป็นสำหรับการเปรียบเทียบแบบหลายทาง / ไม่เป็นทางการหรือไม่?
ฉันมีคำถามเชิงปรัชญาเกี่ยวกับเมื่อจำเป็นต้องแก้ไขการเปรียบเทียบหลายรายการ ฉันกำลังวัดสัญญาณที่เปลี่ยนแปลงเวลาอย่างต่อเนื่อง (ที่จุดเวลาแบบแยก) เหตุการณ์ที่แยกต่างหากเกิดขึ้นเป็นครั้งคราวและฉันต้องการที่จะสร้างหากเหตุการณ์เหล่านี้มีผลกระทบอย่างมีนัยสำคัญต่อสัญญาณที่วัดได้ ดังนั้นฉันสามารถรับสัญญาณค่าเฉลี่ยที่ติดตามเหตุการณ์และโดยปกติฉันสามารถเห็นผลกระทบบางอย่างที่นั่นด้วยจุดสูงสุดที่แน่นอน ถ้าฉันเลือกเวลาของช่วงสูงสุดนั้นและจะพูดว่า t-test เพื่อตรวจสอบว่ามันสำคัญหรือไม่เมื่อเหตุการณ์ไม่เกิดขึ้นฉันต้องทำการแก้ไขเปรียบเทียบหลายรายการหรือไม่ แม้ว่าฉันจะทำการทดสอบหนึ่งครั้งเท่านั้น (คำนวณ 1 ค่า) ในการตรวจสอบด้วยสายตาครั้งแรกของฉันฉันเลือกสำหรับหนึ่งที่มีผลกระทบที่ใหญ่ที่สุดจาก (พูด) 15 คะแนนเวลาล่าช้าหลังการโพสต์ที่แตกต่างกันที่ฉันวางแผน ดังนั้นฉันจำเป็นต้องทำการแก้ไขเปรียบเทียบหลายรายการสำหรับการทดสอบ 15 รายการที่ฉันไม่เคยทำมาก่อนหรือไม่ หากฉันไม่ได้ใช้การตรวจสอบด้วยภาพ แต่เพิ่งทำการทดสอบที่แต่ละเหตุการณ์ล่าช้าและเลือกค่าสูงสุดฉันต้องแก้ไขให้ถูกต้อง ฉันสับสนเล็กน้อยว่าฉันต้องการหรือไม่ถ้าการเลือก 'ความล่าช้าที่ดีที่สุด' ถูกทำขึ้นโดยเกณฑ์อื่นนอกเหนือจากการทดสอบตัวเอง (เช่นการเลือกด้วยภาพค่าเฉลี่ยสูงสุด ฯลฯ )

2
การถดถอยประเภทใดที่จะใช้โดยพิจารณาหนึ่งตัวแปรที่มีขอบเขตสูงสุด?
ฉันไม่แน่ใจว่าวิธีการใดที่ใช้ในการสร้างแบบจำลองความสัมพันธ์ระหว่างตัวแปรสองตัว (และ ) ในการทดลองที่อธิบายไว้ดังต่อไปนี้:xxxYyy มี 3 ตัวแปร ได้แก่ : ,และy ที่xฉันเมตรxaimx_{aim}xxxYyy ค่าของถูกตั้งค่าเมื่อใช้งานการทดสอบ อย่างไรก็ตามและอาจไม่เท่ากันเสมอไปxฉันเมตรxaimx_{aim}xxxxaimxaimx_{aim} สัมประสิทธิ์สหสัมพันธ์ของเพียร์สันระหว่างถึงประมาณ 0.9xaimxaimx_{aim}xxx สัมประสิทธิ์สหสัมพันธ์ของเพียร์สันระหว่างและน้อยกว่ามาก: ประมาณ 0.5xxxyyy yyyมีค่าสูงสุดที่เป็นไปได้ ( ) ซึ่งไม่สามารถเกินได้ymaxymaxy_{max} แต่ละจุดข้อมูลที่จะได้รับหลังจากการตั้งค่าและการอ่านและy ที่xaimxaimx_{aim}xxxyyy แม้ว่าค่าสัมประสิทธิ์สหสัมพันธ์ของเพียร์สันระหว่างและไม่ดีดูเหมือนว่ามีแนวโน้มที่จะเพิ่มขึ้นด้วยxxxxyyyyyyxxx หลังจากทำการวิเคราะห์เชิงเส้นอย่างง่ายของและ (และแปลงหลังเป็นเพื่อที่จะแสดงบนกราฟเดียวกันเช่นเช่น) ทั้งความชัน เป็นบวก แต่ความลาดชันของเป็นมากกว่าที่ฉy=f(x)y=f(x)y=f(x)x=g(y)x=g(y)x=g(y)g−1g−1g^{-1}fffg−1g−1g^{-1}fff มันสมเหตุสมผลไหมที่จะพูดว่าหรือ ? (จะถึงก่อนหน้าในกรณีที่สอง)xmax=f−1(ymax)xmax=f−1(ymax)x_{max} = f^{-1}(y_{max})xmax=g(ymax)xmax=g(ymax)x_{max} = g(y_{max})xmaxxmaxx_{max} เมื่อพิจารณาว่าถูกผูกไว้ด้วยสิ่งใดที่สามารถพูดได้เกี่ยวกับค่าสูงสุดที่เป็นไปได้ของที่สามารถเข้าถึงได้yyyymaxymaxy_{max}xxx เท่าที่ฉันเข้าใจมันทำให้รู้สึกถึงการถดถอยเชิงเส้นของรูปแบบเมื่อเป็นตัวแปรอิสระและเป็นตัวแปรตาม อย่างไรก็ตามในบริบทนี้ฉันไม่แน่ใจว่ามันสมเหตุสมผลหรือไม่ที่จะพิจารณาว่าเป็นอิสระและขึ้นอยู่กับy=f(x)y=f(x)y=f(x)xxxyyyxxxyyy การถดถอยกำลังสองน้อยที่สุดจะเหมาะสมกว่าหรือไม่ มีวิธีอื่นในการพิจารณาว่าค่าใดของสามารถเข้าถึงได้ (และโอกาสใดที่)xmaxxmaxx_{max} (หากเป็นกรณีนี้และดูเหมือนจะไม่เป็นไปตามการแจกแจงแบบปกติเนื่องจากมีความพยายามมากขึ้นในการพยายามเข้าถึงค่าที่สูงกว่าของ )xxxyyyxxx

3
วิธีการเลือกตัวแปรที่สำคัญอย่างรวดเร็วจากชุดข้อมูลที่มีขนาดใหญ่มาก?
ฉันมีชุดข้อมูลที่มีตัวแปรไบนารีประมาณ 2,000 ตัว / 200,000 แถวและฉันพยายามที่จะทำนายตัวแปรไบนารีที่ขึ้นต่อกันเพียงตัวเดียว เป้าหมายหลักของฉันในขั้นตอนนี้ไม่ได้รับความแม่นยำในการทำนาย แต่เพื่อระบุว่าตัวแปรใดเป็นตัวทำนายที่สำคัญ ฉันอยากจะลดจำนวนตัวแปรในตัวแบบสุดท้ายของฉันลงไปประมาณ 100 มีวิธีที่รวดเร็วในการรับตัวแปรที่สำคัญที่สุดหรือไม่? ป่าสุ่มดูเหมือนจะใช้เวลานาน ฉันไม่ต้องใช้การสังเกตทั้งหมด 200,000 ครั้งดังนั้นการสุ่มตัวอย่างจึงเป็นตัวเลือกบนโต๊ะ

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.