สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
มีใครบ้างที่ใช้ขั้นตอน Marascuilo เพื่อเปรียบเทียบหลายสัดส่วน?
กระบวนการ Marascuilo ตามที่อธิบายไว้ที่นี่ดูเหมือนจะเป็นการทดสอบที่เน้นปัญหาของการเปรียบเทียบหลายอย่างสำหรับสัดส่วนเมื่อคุณต้องการทดสอบว่าสัดส่วนใดที่เฉพาะเจาะจงแตกต่างจากกันหลังจากปฏิเสธโมฆะในการทดสอบไคสแควร์โดยรวม อย่างไรก็ตามฉันไม่คุ้นเคยกับการทดสอบนี้มากนัก ดังนั้นคำถามของฉัน: ความแตกต่าง (ถ้ามี) ที่ฉันควรกังวลเมื่อใช้การทดสอบนี้คืออะไร? ฉันรู้วิธีการอื่นอย่างน้อยสองวิธี (ดูด้านล่าง) เพื่อแก้ไขปัญหาเดียวกัน การทดสอบแบบไหนดีกว่า: กำลังดำเนินการกับคำสั่งนี้โดย @Brett Magill การใช้วิธีHolm – Bonferroniเพื่อปรับค่า p

7
ความสัมพันธ์ระหว่างตัวแปรสองตัวที่มีขนาดไม่เท่ากัน
ในปัญหาที่ฉันกำลังทำงานอยู่ฉันมีตัวแปรสุ่มสองตัวคือ X และ Y ฉันต้องหาว่าพวกเขาสองคนมีความสัมพันธ์กันอย่างไร แต่พวกมันมีมิติที่แตกต่างกัน อันดับของพื้นที่แถวของ X คือ 4350 และอันดับของพื้นที่แถวของ Y นั้นใหญ่ขึ้นอย่างมากในหลักหมื่น ทั้ง X และ Y มีจำนวนคอลัมน์เท่ากัน ฉันต้องการตัวชี้วัดความสัมพันธ์ระหว่างตัวแปรทั้งสองและ r ของ Pearson ต้องการ X และ Y เพื่อให้มีมิติที่เท่ากัน (อย่างน้อย R ต้องให้ rv สองตัวเป็น) ฉันมีความหวังในการสร้างความสัมพันธ์ระหว่างสองสิ่งนี้หรือไม่หรือฉันควรหาวิธีตัดการสังเกตจาก Y หรือไม่? EDIT การเพิ่มข้อมูลจากความคิดเห็นซึ่งควรอยู่ในคำถาม ฉันคิดว่าฉันลืมที่จะพูดถึงเรื่องนี้ X และ Y คือราคาหุ้น บริษัท X เปิดตัวต่อสาธารณชนในช่วงเวลาที่สั้นกว่า Y ฉันอยากจะบอกว่าราคาของ X และ Y …

1
การค้นหาความหนาแน่นส่วนต่างของ
ตามที่ชื่อบอกว่าฉันกำลังมองหาความหนาแน่นของ f(x,y)=c1−x2−y2−−−−−−−−−√,x2+y2≤1.f(x,y)=c1−x2−y2,x2+y2≤1.f (x,y) = c \sqrt{1 - x^2 - y^2}, x^2 + y^2 \leq 1. จนถึงตอนนี้ฉันได้พบ ccc เป็น 32π32π\frac{3}{2 \pi}. ฉันคิดออกว่าผ่านการแปลงf(x,y)f(x,y)f(x,y) เป็นพิกัดเชิงขั้วและรวมเข้าด้วยกัน drdθdrdθdrd\thetaซึ่งเป็นเหตุผลที่ฉันติดอยู่ในส่วนความหนาแน่นเล็กน้อย ฉันรู้แล้วฉx( x ) =∫∞- ∞ฉ( x , y) dYฉx(x)=∫-∞∞ฉ(x,Y)dYf_x(x) = \int_{-\infty}^\infty f(x,y)dyแต่ฉันไม่แน่ใจว่าจะแก้ปัญหาอย่างไรโดยไม่ได้รับอินทิกรัลยุ่งขนาดใหญ่และฉันรู้ว่าคำตอบนั้นไม่ควรจะเป็นอินทิกรัลยุ่งขนาดใหญ่ มันเป็นไปได้ที่จะหาแทนF( x , y)F(x,Y)F(x,y)แล้วจึงนำ dFdxdFdx\frac{dF}{dx} การค้นหา ฉx( x )ฉx(x)f_x(x)? ดูเหมือนจะเป็นวิธีที่ใช้งานง่าย แต่ฉันไม่สามารถหาอะไรในตำราเรียนของฉันที่ระบุความสัมพันธ์เหล่านั้นดังนั้นฉันจึงไม่ต้องการตั้งสมมติฐานที่ผิด

1
เกิดข้อผิดพลาดในการประเมินขนาดของชุดหรือไม่
สมมติว่าเรามีเซต A และเซตย่อย B หากเรารู้ว่า | A | ดังนั้นเราสามารถคำนวณ | B | โดยการค้นหาความน่าจะเป็นที่องค์ประกอบที่เลือกอย่างสุ่มจาก A นั้นเป็นของ B. เฉพาะ | A | p = | B | สมมติว่าเราสร้างองค์ประกอบ n ของ A โดยการสุ่มและใช้ข้อมูลนี้เพื่อประเมิน p (จำนวนขององค์ประกอบใน B หารด้วย n) และด้วยเหตุนี้การประมาณ | B | การประมาณนี้น่าเชื่อถือแค่ไหน คือเราจะคำนวณข้อผิดพลาดได้อย่างไร คำถามข้างเคียงมีชื่อสำหรับเทคนิคนี้หรือไม่? (ดูเหมือนว่าจะเป็นรุ่นทางคณิตศาสตร์ของเทคนิคการมาร์คและการรำลึกกลับคืน )

5
คำนวณเปอร์เซ็นต์ไทล์ของการแจกแจงแบบปกติ
ดูหน้า Wikipedia นี้: http://en.wikipedia.org/wiki/Binomial_proportion_confidence_interval#Agresti-Coull_Interval ที่จะได้รับอาเกรสติ-Coull ช่วงเวลาหนึ่งความต้องการในการคำนวณเปอร์เซ็นต์ของการกระจายปกติที่เรียกว่าZฉันจะคำนวณเปอร์เซ็นต์ไทล์ได้อย่างไร มีฟังก์ชั่นสำเร็จรูปที่ใช้ใน Wolfram Mathematica และ / หรือ Python / NumPy / SciPy หรือไม่?zzz

1
การเรียนรู้โครงสร้างของงานเสริมกำลังตามลำดับชั้น
ฉันได้เรียนรู้ปัญหาการเรียนรู้การเสริมแรงแบบลำดับชั้นและในขณะที่เอกสารจำนวนมากเสนออัลกอริทึมสำหรับการเรียนรู้นโยบายพวกเขาทั้งหมดดูเหมือนว่าพวกเขารู้ล่วงหน้าเกี่ยวกับโครงสร้างกราฟที่อธิบายลำดับชั้นของการกระทำในโดเมน ตัวอย่างเช่นวิธี MAXQ สำหรับการเรียนรู้การเสริมแรงแบบลำดับชั้นโดย Dietterich อธิบายกราฟของการกระทำและงานย่อยสำหรับโดเมนแท็กซี่ที่เรียบง่าย แต่ไม่ใช่วิธีการค้นพบกราฟนี้ คุณจะเรียนรู้ลำดับชั้นของกราฟนี้อย่างไรไม่ใช่แค่นโยบาย กล่าวอีกนัยหนึ่งโดยใช้ตัวอย่างของเอกสารหากรถแท็กซี่วิ่งไปรอบ ๆ อย่างไร้จุดหมายโดยที่มีความรู้มาก่อนเล็กน้อยเกี่ยวกับโลกและมีเพียงการกระทำแบบดั้งเดิมย้ายซ้าย / ขวา - ขวา / ฯลฯ ที่จะทำอย่างไร ไปรับส่งผู้โดยสาร? หากฉันเข้าใจกระดาษอย่างถูกต้อง (และฉันอาจไม่ใช่) มันจะเสนอวิธีการอัปเดตนโยบายสำหรับการดำเนินการระดับสูงเหล่านี้ แต่ไม่ใช่วิธีการที่พวกเขาเริ่มก่อตัวขึ้น

2
การวิเคราะห์องค์ประกอบของข้อมูล dyadic
ผู้อ่านที่ไม่ระบุชื่อโพสต์คำถามต่อไปนี้ในบล็อกของฉัน บริบท: ผู้อ่านต้องการเรียกใช้การวิเคราะห์ปัจจัยบนเครื่องชั่งจากแบบสอบถาม - แต่ข้อมูลมาจากสามีและภรรยาคู่ คำถาม: การวิเคราะห์ตัวประกอบสามารถทำงานกับข้อมูล dyadic ได้หรือไม่? ถ้าเป็นเช่นนั้นได้อย่างไร สมมติฐานความเป็นอิสระจะเก็บไว้สำหรับการวิเคราะห์ปัจจัยหรือไม่?

2
การคำนวณแบบไดนามิกของจำนวนตัวอย่างที่จำเป็นในการประมาณค่าเฉลี่ย
ฉันพยายามประเมินค่าเฉลี่ยของการกระจายแบบเกาส์มากขึ้นหรือน้อยลงผ่านการสุ่มตัวอย่าง ฉันไม่มีความรู้มาก่อนเกี่ยวกับค่าเฉลี่ยหรือความแปรปรวน แต่ละตัวอย่างมีราคาแพงที่จะได้รับ ฉันจะตัดสินใจได้อย่างไรว่าจะต้องสุ่มตัวอย่างจำนวนเท่าไรเพื่อให้ได้ระดับความเชื่อมั่น / ความแม่นยำที่แน่นอน อีกวิธีหนึ่งฉันจะรู้ได้อย่างไรว่าฉันจะหยุดรับตัวอย่างเมื่อไหร่? คำตอบสำหรับคำถามเช่นนี้ทั้งหมดที่ฉันสามารถหาได้ดูเหมือนจะเข้าใจความรู้เกี่ยวกับความแปรปรวนบางอย่าง แต่ฉันต้องค้นพบสิ่งนั้นตลอดทาง คนอื่นมุ่งไปที่การลงคะแนนและมันไม่ชัดเจนสำหรับฉัน (เริ่มต้นว่าฉัน) วิธีการที่ generalizes - ค่าเฉลี่ยของฉันไม่ w / ใน [0,1] ฯลฯ ฉันคิดว่านี่อาจเป็นคำถามง่ายๆที่มีคำตอบที่รู้จักกันดี แต่ Google-fu ของฉันกำลังทำให้ฉันล้มเหลว แม้เพียงแค่บอกฉันว่าการค้นหาจะเป็นประโยชน์

2
การคำนวณการแจกแจงสะสมของการเบิกสูงสุดของการเดินสุ่มด้วยการดริฟท์
ฉันสนใจในการแจกแจงการเบิกสูงสุดของการเดินสุ่ม: ให้โดยที่ . เบิกเงินกู้สูงสุดหลังจากงวดเป็น\ max_ {0 \ le ฉัน \ le J \ le n} (x_i - X_j) กระดาษโดยMagdon-Ismail และ อัล ให้การแจกแจงสำหรับการดรอดาวน์สูงสุดของการเคลื่อนไหวบราวน์พร้อมดริฟท์ การแสดงออกเกี่ยวข้องกับผลรวมอนันต์ซึ่งรวมถึงคำบางคำที่กำหนดไว้โดยนัยเท่านั้น ฉันมีปัญหาในการเขียนการใช้งานซึ่งมาบรรจบกัน มีใครทราบถึงการแสดงออกทางเลือกของ CDF หรือการใช้งานอ้างอิงในรหัสหรือไม่X0=0,Xi+1=Xi+Yi+1X0=0,Xi+1=Xi+Yi+1X_0 = 0, X_{i+1} = X_i + Y_{i+1}Yi∼N(μ,1)Yi∼N(μ,1)Y_i \sim \mathcal{N}(\mu,1)nnnmax0≤i≤j≤n(Xi−Xj)max0≤i≤j≤n(Xi−Xj)\max_{0 \le i \le j \le n} (X_i - X_j)

2
ผันก่อนสำหรับการแจกแจงแกมมา
ฉันจำเป็นต้องอัปเดตอัตราความล้มเหลว (ที่กำหนดเป็นตัวกำหนด) ตามอัตราความล้มเหลวใหม่เกี่ยวกับระบบเดียวกัน ฉันอ่านเกี่ยวกับคอนจูเกียร์คอนจูเกตและการแจกแจงแกมม่าเพื่อเชื่อมต่อกับกระบวนการปัวซง นอกจากนี้ฉันสามารถเทียบค่าเฉลี่ยของ Gamma dist ( ) ถึงอัตราใหม่ (เป็นค่าเฉลี่ย) แต่ฉันไม่มีข้อมูลอื่น ๆ เช่นค่าเบี่ยงเบนมาตรฐานสัมประสิทธิ์การแปรผันค่าร้อยละ 90, ... ฯลฯ มีวิธีเวทย์มนตร์ในการจัดการและหาพารามิเตอร์สำหรับ Gamma ก่อนหน้านี้หรือไม่ดังนั้นฉันจึงได้ภาพหลังที่ Gamma ด้วย?β/ αβ/α\beta/\alpha
9 bayesian 

3
ในการใช้งานของการหมุนเฉียงหลังจาก PCA
แพ็คเกจทางสถิติหลายอย่างเช่น SAS, SPSS และ R ช่วยให้คุณสามารถทำการหมุนตัวประกอบต่อไปนี้ PCA ทำไมการหมุนจึงจำเป็นหลังจาก PCA ทำไมคุณถึงใช้การหมุนแบบเอียงหลังจาก PCA เนื่องจากเป้าหมายของ PCA คือการสร้างมิติมุมฉาก

3
ความสัมพันธ์อัตโนมัติในการปรากฏตัวของที่ไม่หยุดนิ่ง?
ฟังก์ชั่น autocorrelation มีความหมายใด ๆ กับอนุกรมเวลาที่ไม่หยุดนิ่งหรือไม่? อนุกรมเวลาโดยทั่วไปจะถือว่านิ่งก่อน autocorrelation จะใช้สำหรับวัตถุประสงค์กล่องและเจนกินส์

1
คุณสมบัติที่พึงประสงค์และไม่พึงประสงค์ของสี่เหลี่ยมละตินในการทดลอง?
การค้นหาคร่าวๆพบว่าสี่เหลี่ยมละตินถูกนำมาใช้อย่างกว้างขวางในการออกแบบการทดลอง ในช่วงปริญญาเอกของฉันฉันได้ศึกษาคุณสมบัติทางทฤษฎีต่าง ๆ ของละตินสแควร์ (จาก combinatorics มุมมองของ -) แต่ไม่มีความเข้าใจอย่างลึกซึ้งว่ามันเกี่ยวกับสี่เหลี่ยมละตินที่ทำให้พวกเขาเหมาะกับการออกแบบการทดลอง ฉันเข้าใจว่าสี่เหลี่ยมลาตินนั้นดีที่ช่วยให้นักสถิติสามารถศึกษาสถานการณ์ได้อย่างมีประสิทธิภาพซึ่งมีสองปัจจัยที่แตกต่างกันใน "ทิศทาง" ที่แตกต่างกัน แต่ฉันก็ค่อนข้างมั่นใจว่าจะมีเทคนิคอื่น ๆ อีกมากมายที่สามารถใช้ได้ โดยเฉพาะอย่างยิ่งเกี่ยวกับสี่เหลี่ยมละตินที่ทำให้เหมาะกับการออกแบบการทดลองมากน้อยเพียงใดการออกแบบอื่นไม่มี นอกจากนี้ยังมีสี่เหลี่ยมละตินจำนวนหนึ่งให้เลือกดังนั้นคุณเลือกสี่เหลี่ยมละตินใด ฉันเข้าใจว่าการเลือกหนึ่งแบบสุ่มเป็นสิ่งสำคัญ แต่ก็ยังคงมีสี่เหลี่ยมจัตุรัสละตินบางอันที่ไม่เหมาะกับการเรียกใช้การทดลองมากกว่าคนอื่น ๆ (เช่นตาราง Cayley ของกลุ่มวงจร) นี่ทำให้เกิดคำถามต่อไปนี้ คุณสมบัติของสี่เหลี่ยมละตินนั้นเป็นที่ต้องการและคุณสมบัติของสี่เหลี่ยมละตินนั้นไม่เป็นที่ต้องการสำหรับการออกแบบการทดลอง

2
การวัดความดีพอดีในโมเดลที่รวมการแจกแจงสองแบบ
ฉันมีข้อมูลที่มีจุดสูงสุดสองเท่าที่ฉันพยายามทำแบบจำลองและมีการทับซ้อนกันระหว่างจุดสูงสุดที่ฉันไม่สามารถปฏิบัติกับพวกเขาได้อย่างอิสระ ฮิสโตแกรมของข้อมูลอาจมีลักษณะดังนี้: ฉันได้สร้างแบบจำลองสองแบบสำหรับสิ่งนี้: แบบหนึ่งใช้การแจกแจงแบบปัวซงสองแบบส่วนอีกแบบใช้การแจกแจงแบบทวินามลบสองตัว วิธีที่เหมาะสมในการบอกว่าแบบจำลองใดที่เหมาะสมกับข้อมูลมากขึ้น ความคิดเริ่มต้นของฉันคือฉันสามารถใช้การทดสอบ Kolmogorov-Smirnov เพื่อเปรียบเทียบแต่ละแบบจำลองกับข้อมูลจากนั้นทำการทดสอบอัตราส่วนความน่าจะเป็นเพื่อดูว่าแบบทดสอบมีความเหมาะสมดีกว่าหรือไม่ มันสมเหตุสมผลหรือไม่ ถ้าเป็นเช่นนั้นฉันไม่แน่ใจว่าจะทำการทดสอบอัตราส่วนความน่าจะเป็นอย่างไร ไคสแควร์เหมาะสมหรือไม่และฉันมีอิสระในระดับใด? หากช่วยได้รหัส R บางตัว (ง่ายมาก) สำหรับรุ่นอาจมีลักษณะดังนี้: ## inital data points a <- read.table("data") #create model data model.pois = c(rpois(1000000,200),rpois(500000,250)) model.nb = c(rnbinom(1000000,200,0.5),rnbinom(500000,275,0.5) #Kolmogorov-Smirnov test #use ks.boot, since it's count data that may contain duplicate values kpois = ks.boot(model.pois,a) knb = …

3
ขนาดผลการถดถอยเชิงเส้นเมื่อใช้ตัวแปรที่แปลงแล้ว
เมื่อดำเนินการถดถอยเชิงเส้นมักจะมีประโยชน์ในการทำการแปลงเช่นการแปลงบันทึกสำหรับตัวแปรตามเพื่อให้บรรลุโครงสร้างการกระจายปกติดีขึ้น บ่อยครั้งที่มันยังมีประโยชน์ในการตรวจสอบเบต้าจากการถดถอยเพื่อประเมินขนาดเอฟเฟกต์ / ความเกี่ยวข้องที่แท้จริงของผลลัพธ์ สิ่งนี้ทำให้เกิดปัญหาเมื่อใช้เช่นการแปลงบันทึกขนาดของเอฟเฟกต์จะอยู่ในสเกลบันทึกและฉันได้รับการบอกว่าเนื่องจากความไม่เป็นเชิงเส้นของสเกลที่ใช้แล้วการเปลี่ยนรูปกลับของเบต้าเหล่านี้จะทำให้ค่าที่ไม่มีความหมาย ไม่มีการใช้งานจริงใด ๆ จนถึงตอนนี้เรามักจะดำเนินการถดถอยเชิงเส้นด้วยตัวแปรแปลงเพื่อตรวจสอบความสำคัญแล้วจากนั้นถดถอยเชิงเส้นกับตัวแปรที่ไม่ได้เปลี่ยนรูปแบบเดิมเพื่อกำหนดขนาดของผลกระทบ มีวิธีที่ถูก / ดีกว่าในการทำเช่นนี้? ส่วนใหญ่เราทำงานกับข้อมูลทางคลินิกดังนั้นตัวอย่างชีวิตจริงจะพิจารณาว่าการสัมผัสที่แน่นอนส่งผลต่อตัวแปรเช่นความสูงน้ำหนักหรือการวัดในห้องปฏิบัติการอย่างไรและเราต้องการสรุปบางสิ่งเช่น "การเปิดรับ A มีผลกระทบ ของการเพิ่มน้ำหนัก 2 กก. "

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.