สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ใช้ lm สำหรับการทดสอบสัดส่วนตัวอย่าง 2 ตัวอย่าง
ฉันใช้แบบจำลองเชิงเส้นเพื่อทำการทดสอบสัดส่วนตัวอย่าง 2 ระยะเวลาหนึ่ง แต่ได้ตระหนักว่าอาจไม่ถูกต้องสมบูรณ์ ปรากฏว่าการใช้ตัวแบบเชิงเส้นแบบทั่วไปกับลิงค์แบบทวินาม + ตระกูลนั้นให้ผลการทดสอบสัดส่วนตัวอย่าง 2 ตัวอย่าง อย่างไรก็ตามการใช้โมเดลเชิงเส้น (หรือ glm กับตระกูล Gaussian) จะให้ผลลัพธ์ที่แตกต่างออกไปเล็กน้อย ฉันหาเหตุผลเข้าข้างตนเองว่านี่อาจเป็นเพราะ R แก้ไข glm สำหรับตระกูลทวินามและตระกูลเกาส์ แต่อาจมีสาเหตุอื่นได้หรือไม่ ## prop.test gives pooled 2-sample proportion result ## glm w/ binomial family gives unpooled 2-sample proportion result ## lm and glm w/ gaussian family give unknown result library(dplyr) library(broom) …

1
สัญชาตญาณความเป็นอิสระของลาซโซ
Zou และคณะ "ใน" องศาอิสระ "ของเชือก" (2007) แสดงให้เห็นว่าจำนวนของค่าสัมประสิทธิ์ที่ไม่ใช่ศูนย์เป็นค่าประมาณที่เป็นกลางและสม่ำเสมอสำหรับองศาอิสระของเชือก ดูเหมือนว่าฉันจะต่อต้านได้ง่าย สมมติว่าเรามีรูปแบบการถดถอย (โดยที่ตัวแปรมีค่าเฉลี่ยเป็นศูนย์) y=βx+ε.y=βx+ε.y=\beta x + \varepsilon. สมมติว่า OLS ไม่ จำกัด ประเมินของเป็นβ O L S = 0.5 มันอาจตรงกับประมาณการ LASSO ที่ประมาณβสำหรับความรุนแรงที่ต่ำมากββ\betaβ^OLS=0.5β^OLS=0.5\hat\beta_{OLS}=0.5ββ\beta สมมติต่อไปว่าประมาณการเชือกสำหรับความเข้มโทษโดยเฉพาะอย่างยิ่งเป็นβ L S S O , λ * = 0.4 ตัวอย่างเช่นλ ∗อาจเป็น "ดีที่สุด" λสำหรับชุดข้อมูลที่อยู่ในมือโดยใช้การตรวจสอบข้าม λ∗λ∗\lambda^*β^LASSO,λ∗=0.4β^LASSO,λ∗=0.4\hat\beta_{LASSO,\lambda^*}=0.4λ∗λ∗\lambda^*λλ\lambda หากฉันเข้าใจอย่างถูกต้องทั้งสองกรณีระดับความเป็นอิสระเท่ากับ 1 เนื่องจากทั้งสองครั้งมีค่าสัมประสิทธิ์การถดถอยที่ไม่ใช่ศูนย์ คำถาม: มาได้อย่างไรองศาอิสระในทั้งสองกรณีจะเหมือนกันแม้ว่าβ L S S …

1
จะรู้ได้อย่างไรว่าเส้นโค้งการเรียนรู้จากตัวแบบ SVM ทนทุกข์จากความเอนเอียงหรือความแปรปรวน?
ฉันสร้างเส้นโค้งการเรียนรู้นี้และฉันต้องการที่จะรู้ว่ารุ่น SVM ของฉันมีปัญหาเรื่องอคติหรือความแปรปรวนหรือไม่? ฉันจะสรุปได้อย่างไรจากกราฟนี้

4
เดิมพันของ Blackwell
ฉันได้อ่านเกี่ยวกับความขัดแย้งเดิมพัน Blackwell เกี่ยวกับการไม่ได้ผลตู้เสื้อผ้า นี่คือบทสรุป: คุณจะมีสองซองจดหมายและE_yซองจดหมายมีจำนวนเงินสุ่ม แต่คุณไม่รู้อะไรเลยเกี่ยวกับการกระจายเกี่ยวกับเงิน คุณเปิดหนึ่งตรวจสอบจำนวนเงินที่มี ( ) และต้องเลือก: ใช้ซองจดหมายหรือ ?E y x E x E yExExE_xEyEyE_yxxxExExE_xEyEyE_y Futility Closet หมายถึงนักคณิตศาสตร์ชื่อ Leonard Wapner:“ โดยไม่คาดคิดมีบางสิ่งที่คุณสามารถทำได้โดยไม่เปิดซองอื่นเพื่อให้ตัวเองดีกว่าโอกาสที่จะทำให้ถูกต้อง” ความคิดซึ่งดูเหมือนว่าผิดที่ฉันจะเป็นดังนี้: เลือกจำนวนสุ่มdหากใช้E_xถ้าเลือกE_yd &lt; x E x d &gt; x E ydddd&lt; xd&lt;xd < xExExE_xd&gt;xd&gt;xd > xEyEyE_y Wapner:“ ถ้า d อยู่ระหว่าง x และ y การทำนายของคุณ (ตามที่ระบุโดย d) …

3
ตัวอย่างของความสัมพันธ์อันหลากหลายที่สมบูรณ์แบบคืออะไร?
ตัวอย่างของ collinearity ที่สมบูรณ์แบบในแง่ของเมทริกซ์การออกแบบคืออะไรXXX ฉันต้องการตัวอย่างที่ไม่สามารถประมาณได้เพราะไม่สามารถย้อนกลับได้β^=(X′X)−1X′Yβ^=(X′X)−1X′Y\hat \beta = (X'X)^{-1}X'Y(X′X)(X′X)(X'X)

6
Brexit: สำคัญคือ“ ลา” อย่างมีนัยสำคัญทางสถิติหรือไม่ [ปิด]
ปิด คำถามนี้เป็นคำถามความคิดเห็นตาม ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้สามารถตอบข้อเท็จจริงและการอ้างอิงได้โดยแก้ไขโพสต์นี้ ปิดให้บริการใน3 ปีที่ผ่านมา ในบทความนี้เราถามคำถามเกี่ยวกับปรากฏการณ์ธรรมชาติที่เรียกว่ามนุษย์พยายามที่จะหาการตัดสินใจด้วยคะแนนเสียงนับ เหตุการณ์ที่เกิดขึ้นที่เฉพาะเจาะจงของปรากฏการณ์ธรรมชาติดังกล่าวว่าคำถามนี้เป็นเรื่องเกี่ยวกับกรณีของBrexit หมายเหตุ:คำถามไม่ได้เกี่ยวกับการเมือง เป้าหมายคือการพยายามพูดคุยปรากฏการณ์ทางธรรมชาติดังกล่าวจากมุมมองทางสถิติตามการสังเกต คำถามเฉพาะคือ: คำถาม:อะไรคะแนนเสียง Brexit จะออกหมายถึง? เช่นนี้หมายความว่าประชาชนต้องการออกจากสหภาพยุโรปหรือไม่ หมายความว่าประชาชนไม่แน่ใจและต้องการเวลาในการคิดเพิ่มขึ้นหรือไม่ หรือมันเป็นอย่างอื่น?51.9 %51.9%51.9\% ข้อสมมติฐานที่ 1:ไม่มีข้อผิดพลาดในกระบวนการลงคะแนน

2
การทดลองซ้ำส่วนใดที่จะมีขนาดผลภายในช่วงความมั่นใจ 95% ของการทดสอบครั้งแรก
มายึดติดกับสถานการณ์ในอุดมคติด้วยการสุ่มตัวอย่างประชากรเกาส์เซียนความแปรปรวนที่เท่าเทียมกันไม่มีการแฮ็ค P เป็นต้น ขั้นตอนที่ 1 คุณเรียกใช้การทดลองพูดเปรียบเทียบค่าเฉลี่ยตัวอย่างสองค่าและคำนวณช่วงความมั่นใจ 95% สำหรับความแตกต่างระหว่างค่าเฉลี่ยประชากรสองค่า ขั้นตอนที่ 2 คุณเรียกใช้การทดลองอื่น ๆ อีกมากมาย (หลักพัน) ความแตกต่างระหว่างค่าเฉลี่ยจะแตกต่างจากการทดสอบไปจนถึงการทดสอบเนื่องจากการสุ่มตัวอย่าง คำถาม: ส่วนต่างของค่าเฉลี่ยจากการรวบรวมการทดลองในขั้นตอนที่ 2 จะอยู่ในช่วงความมั่นใจของขั้นตอนที่ 1 ไม่สามารถตอบได้ ทุกอย่างขึ้นอยู่กับสิ่งที่เกิดขึ้นในขั้นตอนที่ 1 หากการทดสอบขั้นตอนที่ 1 นั้นผิดปกติมากคำตอบของคำถามอาจต่ำมาก ลองจินตนาการว่าทั้งสองขั้นตอนซ้ำหลายครั้ง (ด้วยขั้นตอนที่ 2 ซ้ำหลายครั้ง) ตอนนี้มันน่าจะเป็นไปได้แล้วฉันคิดว่าจะเกิดความคาดหวังว่าการทดลองซ้ำ ๆ โดยเฉลี่ยจะมีขนาดผลภายในช่วงความมั่นใจ 95% ของการทดลองครั้งแรก ดูเหมือนว่าคำตอบสำหรับคำถามเหล่านี้จำเป็นต้องเข้าใจเพื่อประเมินความสามารถในการทำซ้ำของการศึกษาซึ่งเป็นพื้นที่ร้อนแรงในขณะนี้

2
ความหมายที่แท้จริงของวงรีความมั่นใจ
การอ่านเกี่ยวกับความหมายที่แท้จริงของวงรีความมั่นใจ 95% ฉันมักจะเจอ 2 คำอธิบาย: วงรีที่มี 95% ของข้อมูล ไม่ใช่ด้านบน แต่เป็นวงรีที่อธิบายความแปรปรวนของข้อมูล ฉันไม่แน่ใจว่าฉันเข้าใจถูกต้อง แต่พวกเขาดูเหมือนว่าถ้ามีจุดข้อมูลใหม่เข้ามามีโอกาส 95% ที่ความแปรปรวนใหม่จะยังคงอยู่ในวงรี คุณช่วยส่องแสงได้ไหม?

1
ช่วงความมั่นใจถูกคำนวณสำหรับฟังก์ชัน ACF อย่างไร
ตัวอย่างเช่นใน R ถ้าคุณเรียกใช้acf()ฟังก์ชันมันจะทำการคำนวณ correlogram ตามค่าเริ่มต้นและดึงช่วงความมั่นใจ 95% ดูรหัสถ้าคุณโทรplot(acf_object, ci.type="white")คุณจะเห็น: qnorm((1 + ci)/2)/sqrt(x$n.used) เป็นขีด จำกัด สูงสุดของประเภทสัญญาณรบกวนสีขาว บางคนสามารถอธิบายทฤษฎีเบื้องหลังวิธีนี้ได้หรือไม่? ทำไมเราถึงได้ค่า qnorm เท่ากับ 1 + 0.95 แล้วหารด้วย 2 และหลังจากนั้นหารด้วยจำนวนการสังเกต

3
ผลรวมของตัวแปรไม่ต่อเนื่องและตัวแปรสุ่มต่อเนื่องต่อเนื่องหรือผสมกันหรือไม่?
ถ้าเป็นต่อเนื่องและเป็นตัวแปรสุ่มต่อเนื่องแล้วสิ่งที่เราสามารถพูดเกี่ยวกับการกระจายของ ? มันต่อเนื่องหรือผสมกันY X + YXXXYYYX+ YX+YX+Y แล้วผลิตภัณฑ์ล่ะ?XYXYXY

1
การเลือกตัวแปรเทียบกับการเลือกรุ่น
ฉันเข้าใจว่าการเลือกตัวแปรเป็นส่วนหนึ่งของการเลือกแบบจำลอง แต่การเลือกแบบจำลองนั้นประกอบด้วยอะไรบ้าง? มันเป็นมากกว่าต่อไปนี้: 1) เลือกการกระจายสำหรับรุ่นของคุณ 2) เลือกตัวแปรอธิบาย? ฉันถามสิ่งนี้เพราะฉันกำลังอ่านบทความBurnham &amp; Anderson: AIC กับ BICที่พวกเขาพูดคุยเกี่ยวกับ AIC และ BIC ในการเลือกรูปแบบ การอ่านบทความนี้ฉันรู้ว่าฉันกำลังคิดถึง 'การเลือกแบบจำลอง' เป็น 'การเลือกตัวแปร' (อ้างอิงความคิดเห็นBIC พยายามค้นหาแบบจำลองที่แท้จริงหรือไม่ ) ข้อความที่ตัดตอนมาจากบทความที่พวกเขาพูดคุยเกี่ยวกับ 12 รุ่นที่มีระดับ "ทั่วไป" ที่เพิ่มขึ้นและโมเดลเหล่านี้แสดง "เอฟเฟกต์การเรียว" (รูปที่ 1) เมื่อ KL-Information ถูกพล็อตกับ 12 โมเดล: ปรัชญาและรุ่นเป้าหมายที่แตกต่าง ... แม้ว่าเป้าหมายของ BIC จะเป็นรูปแบบทั่วไปมากกว่าแบบเป้าหมายสำหรับ AIC แต่แบบจำลองที่เลือกโดย BIC ส่วนใหญ่มักจะน้อยกว่ารุ่น 7 ยกเว้นว่าnมีขนาดใหญ่มาก มันอาจจะเป็นแบบ 5 …

2
ICC ตามความคาดหวังความสัมพันธ์ระหว่างหน่วยสุ่มสองหน่วยที่อยู่ในกลุ่มเดียวกัน
ในการสร้างแบบจำลองหลายระดับความสัมพันธ์ intraclass มักจะได้รับการคำนวณจากการสุ่มผลกระทบ ANOVA yij=γ00+uj+eijyij=γ00+uj+eij y_{ij} = \gamma_{00} + u_j + e_{ij} โดยที่เป็นค่าระดับ 2 และเป็นค่าระดับ 1 จากนั้นเราจะได้รับการประมาณและสำหรับความแปรปรวนของและตามลำดับและเสียบเข้ากับสมการต่อไปนี้:ujuju_jeijeije_{ij}σ^2uσ^u2\hat{\sigma}_u^2σ^2eσ^e2\hat{\sigma}_e^2ujuju_jeijeije_{ij} ρ=σ^2uσ^2u+σ^2eρ=σ^u2σ^u2+σ^e2 ρ = \frac{\hat{\sigma}_u^2}{\hat{\sigma}_u^2 +\hat{\sigma}_e^2} Hox (2002) เขียนบน p15ที่ ความสัมพันธ์ภายใน intraclass ρยังสามารถตีความได้ว่าเป็นความสัมพันธ์ที่คาดหวังระหว่างหน่วยสุ่มสองหน่วยที่อยู่ในกลุ่มเดียวกัน มีคำถามอยู่ที่นี่ซึ่งถามคำถามขั้นสูง (เพราะเหตุใดมันจึงมีค่าเท่ากับนี้แทนที่จะเท่ากับโดยประมาณ) และได้รับคำตอบขั้นสูง อย่างไรก็ตามฉันต้องการถามคำถามที่ง่ายกว่านี้มาก คำถาม:การพูดคุยเกี่ยวกับความสัมพันธ์ระหว่างหน่วยสุ่มสองหน่วยที่อยู่ในกลุ่มเดียวกันหมายความว่าอย่างไร ฉันมีความเข้าใจพื้นฐานเกี่ยวกับความจริงที่ว่าความสัมพันธ์ภายในอินทราเน็ตทำงานในกลุ่มและไม่ได้อยู่ในข้อมูลที่จับคู่ อย่างไรก็ตามฉันยังไม่เข้าใจว่าสามารถคำนวณความสัมพันธ์ได้อย่างไรหากเรามีหน่วยสุ่มสองกลุ่มจากกลุ่มเดียวกัน ถ้าฉันดูจุดแปลงในหน้า Wikipedia สำหรับ ICCเช่นเรามีหลายกลุ่มและหลายจุดภายในแต่ละกลุ่ม

4
จะปรับอัตราการเรียนรู้อย่างเป็นระบบโดยใช้ Gradient Descent เป็นเครื่องมือเพิ่มประสิทธิภาพได้อย่างไร
คนนอกถึงฟิลด์ ML / DL; เริ่มหลักสูตร Udacity Deep Learning ซึ่งมีพื้นฐานจาก Tensorflow; ทำงานที่ได้รับมอบหมาย 3 ปัญหา 4; พยายามปรับอัตราการเรียนรู้ด้วยการกำหนดค่าต่อไปนี้: ชุดขนาด 128 จำนวนขั้นตอน: เพียงพอที่จะเติม 2 epochs ขนาดของเลเยอร์ที่ซ่อนอยู่: 1024, 305, 75 การกำหนดค่าเริ่มต้นน้ำหนัก: ตัดปกติด้วย std ส่วนเบี่ยงเบนของ sqrt (2 / n) โดยที่ n คือขนาดของเลเยอร์ก่อนหน้า ความน่าจะเป็นที่จะออกกลางคัน: 0.75 การทำให้เป็นมาตรฐาน: ไม่ได้ใช้ อัลกอริทึมอัตราการเรียนรู้: การสลายตัวแบบเลขชี้กำลัง เล่นกับพารามิเตอร์อัตราการเรียนรู้; ดูเหมือนว่าพวกเขาจะไม่มีผลในกรณีส่วนใหญ่; รหัสที่นี่ ; ผล: Accuracy learning_rate decay_steps …

1
Tribble จะไม่มีความสุขใน Oz หรือไม่?
นี่คือปัญหาที่ทำให้นักเรียนรู้สึกตลก แม้ว่าในตอนแรกมันถูกใช้ถ้อยคำในแง่ของการทำลายล้างกระสุนปืนที่ยิงด้วยปืนเป็นประจำ แต่ฉันคิดว่าคุณน่าจะสนุกกับการนำเสนอที่สงบสุขกว่า ในโลกที่ไม่มีที่สิ้นสุดของออซถนนอิฐสีเหลืองเริ่มต้นในใจกลางเมืองมรกตผ่อนคลายไปทั่วชนบท ในตอนเที่ยงของแต่ละวันกระเทยหนุ่มกระเทยตัวหนึ่งที่มีกำลังวังชาจะออกเดินทางไปตามถนนสายนี้ด้วยความเร็วที่เลือกอย่างสุ่มสูงถึงหนึ่งกิโลเมตรต่อวัน ตลอดการเดินทางจะยังคงหมุนด้วยความเร็วเท่าเดิมไม่หยุด แต่ถ้ามี Tribble หนึ่งแซงอีกคนอยู่บนท้องถนนแต่ละคนก็จะรับรู้เนื้อคู่ของมันและทั้งสองก็ย่อตัวลงด้านข้าง (สันนิษฐานได้ว่าจะทำซ้ำและในที่สุดก็ส่ง Tribbles กลับบ้าน) ดังที่คุณทราบการเกิดขึ้นเช่นนี้มักเกิดขึ้นเนื่องจากโอกาสของ Tribbles สองตัวที่หมุนด้วยความเร็วเท่ากันนั้นเป็นศูนย์ โอ้ Tribbles มีความสุข! แต่ชีวิตรับประกันว่าจะดีสำหรับพวกเขาทั้งหมดหรือไม่ โอกาสที่อย่างน้อยหนึ่ง Tribble จะดำเนินต่อไปตลอดกาลไม่เคยแซงหรือถูกครอบงำ?

4
ตรวจจับจำนวนของจุดสูงสุดในการบันทึกเสียง
ฉันกำลังพยายามหาวิธีตรวจสอบจำนวนพยางค์ในคลังเสียงของการบันทึกเสียง ฉันคิดว่าพร็อกซีที่ดีอาจเป็นจุดสูงสุดในไฟล์ wave นี่คือสิ่งที่ฉันลองด้วยไฟล์ที่ฉันพูดเป็นภาษาอังกฤษ (กรณีการใช้งานจริงของฉันคือ Kiswahili) หลักฐานของการบันทึกตัวอย่างนี้คือ: "นี่คือฉันพยายามใช้ฟังก์ชั่นตัวตั้งเวลาฉันกำลังดูหยุดชั่วคราวการเปล่งเสียง" ในบทนี้มีทั้งหมด 22 พยางค์ ไฟล์ wav: https://www.dropbox.com/s/koqyfeaqge8t9iw/test.wav?dl=0 seewaveแพคเกจในการวิจัยเป็นสิ่งที่ดีและมีฟังก์ชั่นที่มีศักยภาพหลาย ก่อนอื่นให้นำเข้าไฟล์คลื่น library(seewave) library(tuneR) w &lt;- readWave("YOURPATHHERE/test.wav") w # Wave Object # Number of Samples: 278528 # Duration (seconds): 6.32 # Samplingrate (Hertz): 44100 # Channels (Mono/Stereo): Stereo # PCM (integer format): TRUE # Bit (8/16/24/32/64): …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.