สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
คุณจะรับมือกับการประมาณค่าไม่เสถียรในการถดถอยเชิงเส้นด้วยค่าความหลากหลายหลายค่าได้สูงโดยไม่ต้องทิ้งตัวแปรอย่างไร
ความมั่นคงเบต้าในการถดถอยเชิงเส้นที่มีความหลากหลายสูง? สมมุติว่าในการถดถอยเชิงเส้นตัวแปรและมีความหลากหลายเชิงเส้นสูง (ความสัมพันธ์มีค่าประมาณ 0.9)x 2x1x1x_1x2x2x_2 เรามีความกังวลเกี่ยวกับค่าสัมประสิทธิ์ความมั่นคงดังนั้นเราจึงต้องปฏิบัติต่อความหลากหลายเชิงซ้อนββ\beta วิธีแก้ปัญหาหนังสือเรียนคือการทิ้งหนึ่งในตัวแปร แต่เราไม่ต้องการสูญเสียข้อมูลที่เป็นประโยชน์เพียงแค่ทิ้งตัวแปร ข้อเสนอแนะใด ๆ

4
จะทำอย่างไรเมื่อค่าเฉลี่ยของสองตัวอย่างแตกต่างกันอย่างมีนัยสำคัญ แต่ความแตกต่างนั้นเล็กเกินไปที่จะสำคัญ
ฉันมีสองตัวอย่าง (ในทั้งสองกรณี) ค่าเฉลี่ยต่างกันประมาณสองเท่าของค่ามาตรฐานรวม dev ส่งผลให้มูลค่าอยู่ที่ประมาณ 10 ขณะที่มันเป็นเรื่องที่ดีที่จะได้รู้ว่าเราได้แสดงให้เห็นแน่ชัดว่าหมายถึงจะไม่เหมือนกันนี้ดูเหมือนว่าฉันจะถูกผลักดันโดย n ขนาดใหญ่ เมื่อดูที่ฮิสโตแกรมของข้อมูลฉันไม่รู้สึกว่าเช่น p-value เล็ก ๆ เป็นตัวแทนของข้อมูลจริงๆและโดยสุจริตไม่รู้สึกสะดวกสบายในการอ้างอิง ฉันอาจถามคำถามผิด สิ่งที่ฉันคิดคือ: ตกลงวิธีการที่แตกต่างกัน แต่ไม่สำคัญว่าในขณะที่การกระจายการแบ่งปันที่ทับซ้อนกันอย่างมีนัยสำคัญ?Tn≈70n≈70n \approx 70TTT นี่คือสิ่งที่การทดสอบแบบเบย์มีประโยชน์หรือไม่ ถ้าเป็นที่ที่เหมาะสำหรับการเริ่มต้น googling สักหน่อยไม่ได้ให้ประโยชน์อะไรเลย แต่ฉันอาจไม่ถามคำถามที่ถูกต้อง หากนี่เป็นสิ่งที่ผิดใครมีคำแนะนำใด ๆ หรือนี่เป็นเพียงจุดสำหรับการอภิปรายซึ่งต่างจากการวิเคราะห์เชิงปริมาณ

2
ทดสอบว่าการแจกแจงหลายตัวแปรสองตัวอย่างถูกสุ่มจากประชากรพื้นฐานเดียวกันได้อย่างไร
สมมติว่าคุณได้รับชุดข้อมูลหลายตัวแปรสองชุดกล่าวว่าชุดเก่าและชุดใหม่และควรถูกสร้างขึ้นด้วยกระบวนการเดียวกัน (ซึ่งคุณไม่มีรูปแบบ) แต่บางทีอยู่ที่ไหนสักแห่งตามแนวการรวบรวม / การสร้าง ข้อมูลมีบางสิ่งผิดพลาด คุณไม่ต้องการใช้ข้อมูลใหม่เป็นชุดการตรวจสอบความถูกต้องสำหรับข้อมูลเก่าหรือเพื่อเพิ่มลงในข้อมูลเก่า คุณสามารถทำสถิติ 1 มิติ (ต่อตัวแปร) เช่นผลรวมอันดับ Wilcoxon และลองแก้ไขการทดสอบหลาย ๆ อย่าง แต่ฉันไม่แน่ใจว่าเหมาะสมที่สุด (เพื่อจับภาพความซับซ้อนของข้อมูลหลายตัวแปรทำให้เกิดปัญหาการทดสอบหลายครั้ง) วิธีหนึ่งคือการใช้ตัวจําแนกและดูว่าคุณสามารถแยกแยะระหว่างชุดข้อมูลสองชุด (ให้ตัวจําแนกที่ดีที่สุดที่เหมาะสมที่สุด) ดูเหมือนจะใช้งานได้ แต่ยังคงเป็น a) perhpas มีวิธีที่ดีกว่า b) มันไม่ได้ถูกออกแบบมาเพื่อบอกคุณว่าทำไมมันถึงแตกต่างกัน (ถ้าไม่มีอะไรเลยมันจะใช้ตัวทำนายที่ดีที่สุดและอาจพลาด

2
LASSO เลือกตัวทำนายที่สัมพันธ์กันเมื่อใด
ฉันใช้แพ็คเกจ 'lars' ใน R ด้วยรหัสต่อไปนี้: > library(lars) > set.seed(3) > n <- 1000 > x1 <- rnorm(n) > x2 <- x1+rnorm(n)*0.5 > x3 <- rnorm(n) > x4 <- rnorm(n) > x5 <- rexp(n) > y <- 5*x1 + 4*x2 + 2*x3 + 7*x4 + rnorm(n) > x <- cbind(x1,x2,x3,x4,x5) > …

2
การค้นหาคุณสมบัติที่ดีที่สุดในรูปแบบการโต้ตอบ
ฉันมีรายการโปรตีนพร้อมค่าคุณลักษณะ ตารางตัวอย่างมีลักษณะดังนี้: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 แถวคือโปรตีนและคอลัมน์เป็นคุณสมบัติ ฉันยังมีรายการโปรตีนที่มีปฏิสัมพันธ์เช่นกัน ตัวอย่างเช่น Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 ปัญหา : สำหรับการวิเคราะห์เบื้องต้นฉันต้องการทราบว่าคุณลักษณะใดที่มีส่วนร่วมมากที่สุดสำหรับการโต้ตอบของโปรตีน ความเข้าใจของฉันคือโดยปกติต้นไม้การตัดสินใจสามารถใช้เพื่อให้ได้คุณลักษณะที่สำคัญที่สุดตามเอนโทรปี แต่ฉันไม่แน่ใจว่าจะขยายไปยังคู่โปรตีนได้อย่างไร (เช่นปฏิกิริยา) มีวิธีการสำหรับวัตถุประสงค์ดังกล่าวหรือไม่?

1
ทำไมการ squaringถึงอธิบายความแปรปรวน?
นี่อาจเป็นคำถามพื้นฐาน แต่ฉันสงสัยว่าทำไมค่าในตัวแบบการถดถอยสามารถยกกำลังสองเพื่ออธิบายความแปรปรวนที่อธิบายได้RRR ฉันเข้าใจว่าสัมประสิทธิ์สามารถให้ความแข็งแกร่งของความสัมพันธ์ แต่ฉันไม่เข้าใจว่าการยกกำลังสองค่านี้เป็นการวัดความแปรปรวนที่อธิบายได้ง่ายเพียงใดRRR มีคำอธิบายง่ายๆเกี่ยวกับเรื่องนี้หรือไม่? ขอบคุณมากที่ช่วยด้วย!

2
เหตุใดจึงใช้การแจกแจงแบบเบต้าบนพารามิเตอร์ Bernoulli สำหรับการถดถอยโลจิสติกแบบลำดับชั้น
ฉันกำลังอ่านหนังสือ "Doing Bayesian Data Analysis" ที่ยอดเยี่ยมของ Kruschke อย่างไรก็ตามบทที่เกี่ยวกับการถดถอยโลจิสติกแบบลำดับชั้น (บทที่ 20) ค่อนข้างสับสน รูปที่ 20.2 อธิบายการถดถอยโลจิสติกแบบลำดับชั้นที่พารามิเตอร์ Bernoulli ถูกกำหนดเป็นฟังก์ชันเชิงเส้นของสัมประสิทธิ์ที่ถูกแปลงผ่านฟังก์ชัน sigmoid นี่น่าจะเป็นวิธีการถดถอยโลจิสติกแบบลำดับชั้นในตัวอย่างส่วนใหญ่ที่ฉันเคยเห็นในแหล่งอื่น ๆ ทางออนไลน์เช่นกัน ตัวอย่างเช่น - http://polisci2.ucsd.edu/cfariss/code/SIMlogit02.bug อย่างไรก็ตามเมื่อตัวทำนายมีค่าน้อยที่สุดเขาจะเพิ่มเลเยอร์ในลำดับชั้น - พารามิเตอร์ Bernoulli ถูกดึงมาจากการแจกแจงแบบเบต้า (รูปที่ 20.5) ด้วยพารามิเตอร์ที่กำหนดโดย mu และ kappa โดยที่ mu คือการแปลง sigmoid ของฟังก์ชันเชิงเส้นของสัมประสิทธิ์ และคัปปาใช้แกมมามาก่อน ดูเหมือนว่าจะสมเหตุสมผลและคล้ายคลึงกับตัวอย่างการพลิกเหรียญจากบทที่ 9 แต่ฉันไม่เห็นว่าการคาดการณ์เล็กน้อยจะทำอย่างไรกับการเพิ่มการแจกแจงแบบเบต้า เหตุใดจึงไม่ทำเช่นนี้ในกรณีของตัวทำนายเมตริกและทำไมการแจกแจงเบต้าถูกเพิ่มเข้ามาสำหรับตัวทำนายที่ระบุ? แก้ไข:ชี้แจงเกี่ยวกับรูปแบบที่ฉันหมายถึง ก่อนอื่นโมเดลการถดถอยโลจิสติกพร้อมตัวทำนายเมตริก (ไม่มีเบต้าก่อน) นี่คล้ายกับตัวอย่างอื่น ๆ ของการถดถอยโลจิสติกส์แบบลำดับชั้นเช่นตัวอย่างข้อบกพร่องด้านบน: …

2
มีปัญหากับ e1071 libsvm?
ฉันมีชุดข้อมูลที่มีสองคลาสที่ทับซ้อนกันเจ็ดจุดในแต่ละชั้นคะแนนอยู่ในพื้นที่สองมิติ ใน R และฉันกำลังเรียกใช้svmจากe1071แพคเกจเพื่อสร้างการแยกไฮเปอร์เพลนสำหรับคลาสเหล่านี้ ฉันใช้คำสั่งต่อไปนี้: svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', cost = 50000) ที่xมีจุดข้อมูลของฉันและyมีป้ายกำกับของพวกเขา คำสั่งส่งกลับ svm-object ซึ่งฉันใช้ในการคำนวณพารามิเตอร์ (เวกเตอร์ปกติ) และ (สกัดกั้น) ของการแยกไฮเปอร์เพลนขwwwbbb รูปที่ (a) ด้านล่างแสดงคะแนนของฉันและไฮเปอร์เพลนที่ส่งคืนโดยsvmคำสั่ง จุดสีน้ำเงินที่มีสัญลักษณ์ O แสดงที่มาของพื้นที่เส้นประแสดงขอบระยะทางวงกลมคือจุดที่ไม่เป็นศูนย์ (ตัวแปรสแลค)ξξ\xi รูปที่ (b) แสดงไฮเปอร์เพลนอีกอันหนึ่งซึ่งเป็นการแปลแบบขนานที่ดีที่สุดด้วย 5 (b_new = b_optimal - 5) ไม่ยากที่จะเห็นว่าสำหรับไฮเปอร์เพลนนี้ฟังก์ชันวัตถุประสงค์ (ซึ่งถูกย่อโดยการจำแนกประเภท C-svm) จะมีค่าต่ำกว่าไฮเปอร์เพลนที่ดีที่สุดที่แสดงในรูป ( ก) ดังนั้นดูเหมือนว่าจะมีปัญหากับฟังก์ชั่นนี้หรือไม่? …

1
ลำดับ Halton เทียบกับลำดับ Sobol '?
จากคำตอบในคำถามก่อนหน้านี้ฉันถูกนำไปยังลำดับ Halton สำหรับการสร้างชุดของเวกเตอร์ที่ครอบคลุมพื้นที่ตัวอย่างสม่ำเสมอพอ ๆ กัน แต่หน้าวิกิพีเดียกล่าวว่าช่วงเวลาที่สูงขึ้นโดยเฉพาะอย่างยิ่งมักจะมีความสัมพันธ์สูงในช่วงต้นของซีรีส์ นี้ดูเหมือนว่าจะเป็นกรณีสำหรับคู่ใด ๆ ของช่วงเวลาที่สูงที่มีขนาดตัวอย่างที่ค่อนข้างสั้น - และแม้กระทั่งเมื่อตัวแปรไม่มีความสัมพันธ์พื้นที่ตัวอย่างที่ไม่ได้เก็บตัวอย่างสม่ำเสมอค่อนข้างมีวงดนตรีในแนวทแยงของความหนาแน่นของตัวอย่างสูงในพื้นที่ . เนื่องจากฉันใช้เวกเตอร์ที่มีความยาว 6 ขึ้นไปฉันจะต้องใช้บางช่วงเวลาซึ่งเป็นปัญหา (แม้ว่าจะไม่เลวร้ายอย่างในตัวอย่างที่ถูกกล่าวถึง) และตัวแปรบางตัวจะไม่ถูกสุ่มตัวอย่างเหมือนกัน ระนาบตัวอย่างของพวกมัน การใช้ลำดับ Sobol 'เพื่อสร้างชุดที่คล้ายกันดูเหมือนว่าฉัน (เพียงจากการดูกราฟ) เพื่อสร้างตัวอย่างระหว่างคู่ของตัวแปรที่มีการกระจายอย่างเท่าเทียมกันมากขึ้นแม้สำหรับตัวอย่างจำนวนค่อนข้างน้อย ดูเหมือนว่าจะมีประโยชน์มากกว่านี้และฉันก็สงสัยว่าเมื่อไรที่ลำดับ Halton จะมีประโยชน์มากกว่านี้ หรือว่าเป็นเพียงลำดับของ Halton ที่คำนวณได้ง่ายกว่า หมายเหตุ: การอภิปรายของลำดับความแตกต่างต่ำหลายมิติอื่น ๆ ก็ยินดีต้อนรับ

2
ทำไมคุณสมบัติที่ได้รับมาใช้ในโครงข่ายประสาทเทียม?
ตัวอย่างเช่นหนึ่งต้องการที่จะทำนายราคาบ้านและมีสองคุณสมบัติการป้อนข้อมูลความยาวและความกว้างของบ้าน บางครั้งหนึ่งยังมีคุณสมบัติอินพุตพหุนามที่ได้มาของเช่นพื้นที่ซึ่งเป็นความกว้าง * ความยาว 1) อะไรคือจุดรวมของฟีเจอร์ที่ได้รับ? เครือข่ายประสาทไม่ควรเรียนรู้การเชื่อมต่อระหว่างความยาวความกว้างและราคาระหว่างการฝึกอบรมหรือไม่? เหตุใดคุณสมบัติที่สามพื้นที่ซ้ำซ้อนไม่ได้ นอกจากนี้บางครั้งฉันก็เห็นว่าผู้คนเรียกใช้อัลกอริทึมการคัดเลือกทางพันธุกรรมในคุณสมบัติการป้อนข้อมูลเพื่อลดจำนวนของพวกเขา 2) อะไรคือจุดลดคุณสมบัติการป้อนข้อมูลหากทุกอย่างมีข้อมูลที่มีประโยชน์ เครือข่ายประสาทควรกำหนดน้ำหนักที่เหมาะสมให้กับแต่ละคุณสมบัติอินพุตตามความสำคัญหรือไม่ จุดประสงค์ของการใช้ขั้นตอนวิธีคัดเลือกพันธุกรรมคืออะไร

1
Kinect ใช้ป่าสุ่มอย่างไร
ฉันอ่านในเว็บไซต์นี้ซึ่งเห็นได้ชัดว่า Kinect ใช้อัลกอริทึมป่าสุ่มสำหรับการเรียนรู้ของเครื่องในทางใดทางหนึ่ง ใครสามารถอธิบายสิ่งที่มันใช้ป่าสุ่มสำหรับและวิธีการทำงานของพวกเขา?

2
การทำนายการถดถอยแบบเชิงปริมาณ
ฉันสนใจที่จะใช้การถดถอยเชิงปริมาณสำหรับแบบจำลองบางส่วนของฉัน แต่ต้องการที่จะชี้แจงให้ชัดเจนเกี่ยวกับสิ่งที่ฉันสามารถทำได้โดยใช้วิธีการนี้ ฉันเข้าใจว่าฉันสามารถได้รับการวิเคราะห์ที่แข็งแกร่งยิ่งขึ้นของความสัมพันธ์ IV / DV โดยเฉพาะอย่างยิ่งเมื่อต้องเผชิญกับค่าผิดปกติและ heteroscedasticity แต่ในกรณีของฉันการมุ่งเน้นไปที่การทำนาย โดยเฉพาะอย่างยิ่งฉันสนใจที่จะปรับปรุงแบบจำลองของฉันโดยไม่ต้องหันไปใช้แบบจำลองที่ไม่ใช่เชิงเส้นที่ซับซ้อนมากขึ้นหรือแม้แต่การถดถอยเชิงเส้นแบบชิ้นเล็ก ๆ ที่การทำนายมันเป็นไปได้หรือไม่ที่จะเลือกผลลัพธ์ความน่าจะเป็นที่มากที่สุดโดยใช้ค่าของตัวทำนาย? กล่าวอีกนัยหนึ่งเป็นไปได้หรือไม่ที่จะกำหนดความน่าจะเป็นแบบควอนไทล์ของผลลัพธ์ที่คาดการณ์ไว้แต่ละตัวตามค่าของตัวทำนาย

5
ทำไมมันถึงอ้างว่าตัวอย่างมักจะแม่นยำกว่าการสำรวจสำมะโนประชากร?
เมื่อเรียนรู้วิธีการสุ่มตัวอย่างฉันพบสองข้อความต่อไปนี้: 1) ข้อผิดพลาดการสุ่มตัวอย่างนำไปสู่ความแปรปรวนส่วนใหญ่ข้อผิดพลาดการสุ่มตัวอย่างจะทำให้เกิดอคติ 2) เนื่องจากข้อผิดพลาดที่ไม่ได้สุ่มตัวอย่างกลุ่มตัวอย่างจึงมักจะแม่นยำกว่า CENSUS ฉันไม่ทราบว่าจะเข้าใจข้อความทั้งสองนี้ได้อย่างไร ตรรกะพื้นฐานในการรับสองข้อความนี้คืออะไร?


4
Sidak หรือ Bonferroni
ฉันใช้โมเดลเชิงเส้นทั่วไปใน SPSS เพื่อดูความแตกต่างของจำนวนตัวหนอนเฉลี่ย (ไม่ใช่แบบปกติโดยใช้การกระจายแบบทวีด) ในพืช 16 ชนิดที่แตกต่างกัน ฉันต้องการเรียกใช้การเปรียบเทียบหลายรายการ แต่ฉันไม่แน่ใจว่าควรใช้การทดสอบการแก้ไข Sidak หรือ Bonferroni ความแตกต่างระหว่างการทดสอบทั้งสองคืออะไร? ดีกว่าอีกไหม?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.