สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
วิธีการรวมผลลัพธ์ของการถดถอยโลจิสติกและฟอเรสต์แบบสุ่ม
ฉันยังใหม่กับการเรียนรู้ของเครื่อง ฉันใช้การถดถอยโลจิสติกและฟอเรสต์แบบสุ่มบนชุดข้อมูลเดียวกัน ดังนั้นฉันจึงได้รับความสำคัญของตัวแปร (สัมประสิทธิ์สัมบูรณ์สำหรับการถดถอยโลจิสติกและความสำคัญของตัวแปรสำหรับฟอเรสต์แบบสุ่ม) ฉันกำลังคิดที่จะรวมสองสิ่งนี้เข้าด้วยกันเพื่อให้ได้ตัวแปรที่มีความสำคัญขั้นสุดท้าย ใครสามารถแบ่งปันประสบการณ์ของเขา / เธอ? ฉันได้ตรวจสอบการบรรจุถุงการส่งเสริมการสร้างแบบจำลองชุด แต่ไม่ใช่สิ่งที่ฉันต้องการ พวกเขารวมข้อมูลสำหรับรุ่นเดียวกันในแบบจำลองมากกว่า สิ่งที่ฉันกำลังมองหาคือการรวมผลของหลายรุ่น

2
การเปรียบเทียบตัวแบบการถดถอยเชิงเส้นสองแบบ
ฉันต้องการเปรียบเทียบแบบจำลองการถดถอยเชิงเส้นสองแบบซึ่งเป็นตัวแทนของอัตราการลดลงของ mRNA เมื่อเวลาผ่านไปภายใต้เงื่อนไขที่แตกต่างกันสองแบบ ข้อมูลสำหรับแต่ละรุ่นรวบรวมอย่างอิสระ นี่คือชุดข้อมูล บันทึกเวลา (ชั่วโมง) (การรักษา A) บันทึก (การรักษา B) 0 2.02 1.97 0 2.04 2.06 0 1.93 1.96 2 2.02 1.91 2 2.00 1.95 2 2.07 1.82 4 1.96 1.97 4 2.02 1.99 4 2.02 1.99 6 1.94 1.90 6 1.94 1.97 6 1.86 1.88 8 1.93 …

1
เคอร์เนล k เพื่อนบ้านที่ใกล้ที่สุด
ฉันใหม่กับเมล็ดและมีอุปสรรคในขณะที่พยายาม kernelise kNN รอบคัดเลือกโซน ฉันใช้เคอร์เนลพหุนาม: K(x,y)=(1+⟨x,y⟩)dK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d Euclidean ทั่วไปของคุณใช้ตัวชี้วัดระยะทางต่อไปนี้: d(x,y)=||x−y||d(x,y)=||x−y||d(\mathbf{x}, \mathbf{y}) = \vert\vert \mathbf{x} - \mathbf{y} \vert\vert ปล่อยให้f(x)f(x)f(\mathbf{x})แม็พxx\mathbf{x}ลงในฟีเจอร์มิติที่สูงขึ้น จากนั้นสแควร์ของตัวชี้วัดระยะทางด้านบนในพื้นที่ฮิลแบร์ตสามารถแสดงได้ด้วยผลิตภัณฑ์ภายใน: d2(f(x),f(y))=K(x,x)−2K(x,y)+K(y,y)d2(f(x),f(y))=K(x,x)−2K(x,y)+K(y,y)d^2(f(x), f(y)) = K(\mathbf{x},\mathbf{x}) - 2K(\mathbf{x}, \mathbf{y}) + K(\mathbf{y} ,\mathbf{y}) โปรดทราบว่าถ้าเราปล่อยให้d=1d=1d = 1ข้างต้นจะทำให้ระยะทางแบบยุคลิดลดลง คำถาม ปัญหาหลักที่ฉันมีคือฉันไม่สามารถดูว่า kernelising kNN ให้ผลลัพธ์ที่ดีขึ้นตามที่แสดงโดยการทดลองเช่นบทความนี้ (คำเตือนลิงค์ PDF โดยตรง!)

1
การทำนาย logit สั่งใน R
ฉันพยายามทำการถดถอย logit สั่ง ฉันกำลังใช้รูปแบบเช่นนั้น (เพียงแบบจำลองโง่ ๆ ประมาณจำนวน บริษัท ในตลาดจากรายรับและมาตรการประชากร) คำถามของฉันเกี่ยวกับการทำนาย nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) เมื่อฉันใช้ทำนาย (ซึ่งฉันพยายามใช้เพื่อให้ได้ค่า y ที่คาดการณ์) ผลลัพธ์จะเป็น 0, 3, หรือ 27 ซึ่งไม่มีทางที่จะสะท้อนให้เห็นถึงสิ่งที่ควรจะเป็นคำทำนายจากค่าสัมประสิทธิ์ของฉันเองจากค่าสัมประสิทธิ์ ประมาณการและดัก ไม่มีใครรู้ว่าจะได้รับการทำนาย "ถูกต้อง" สำหรับรุ่น logit ของฉันได้อย่างไร แก้ไข เพื่อชี้แจงข้อกังวลของฉันข้อมูลการตอบสนองของฉันมีการสังเกตในทุกระดับ >head(table(y)) y 0 1 2 3 4 5 29 21 19 27 15 16 ที่ซึ่งตัวแปรทำนายของฉันดูเหมือนจะพัวพัน > head(table(pr_out)) …

2
PCA มีความโดดเด่นหรือไม่?
เมื่อฉันเรียกใช้ PCA ในชุดข้อมูลบางอย่างฉันจะได้รับโซลูชันที่ไม่ซ้ำกันหรือไม่ นั่นคือฉันได้รับชุดพิกัด 2d ตามระยะทางระหว่างจุด เป็นไปได้หรือไม่ที่จะหาจุดจัดเรียงอย่างน้อยหนึ่งจุดที่จะตรงตามข้อ จำกัด เหล่านี้? หากคำตอบคือใช่ฉันจะหาวิธีแก้ปัญหาที่แตกต่างได้อย่างไร
12 pca 

1
ความหนาแน่นของ Y = log (X) สำหรับ X ที่กระจายโดยแกมมา
คำถามนี้เกี่ยวข้องกับโพสต์นี้อย่างใกล้ชิด สมมติว่าฉันมีตัวแปรสุ่มและฉันกำหนด(X) ฉันต้องการที่จะหาสิ่งที่ฟังก์ชั่นความหนาแน่นของความน่าจะเป็นของYY = บันทึก( X ) YX∼ Gamma ( k , θ )X~แกมมา(k,θ)X \sim \text{Gamma}(k, \theta)Y= บันทึก( X)Y=เข้าสู่ระบบ⁡(X)Y = \log(X)YYY ตอนแรกฉันคิดว่าฉันจะนิยามฟังก์ชันการแจกแจงสะสมแบบ X ทำการเปลี่ยนแปลงของตัวแปรแล้วนำ "ข้างใน" ของอินทิกรัลเป็นความหนาแน่นของฉันเช่นนั้น P( X≤ c )P( Y≤ บันทึกค)= ∫ค01θk1Γ ( k )xk - 1อี- xθdx= ∫เข้าสู่ระบบ( c )เข้าสู่ระบบ( 0 )1θk1Γ ( k )ประสบการณ์( y)k - 1อี- …

1
การแบ่งประเภทแบ่งชั้นด้วยป่าสุ่ม (หรือตัวแยกประเภทอื่น)
ดังนั้นฉันจึงมีเมทริกซ์ประมาณ 60 x 1,000 ฉันมองว่ามันเป็นวัตถุ 60 ชิ้นที่มีคุณสมบัติ 1,000 รายการ วัตถุ 60 ชิ้นถูกจัดกลุ่มเป็น 3 คลาส (a, b, c) วัตถุ 20 ชิ้นในแต่ละชั้นและเรารู้การจำแนกที่แท้จริง ฉันต้องการทำการเรียนรู้ภายใต้การดูแลในชุดตัวอย่างการฝึกอบรม 60 ชุดนี้และฉันสนใจทั้งความแม่นยำของตัวจําแนก (และตัวชี้วัดที่เกี่ยวข้อง) รวมถึงการเลือกคุณสมบัติของคุณสมบัติ 1,000 รายการ ก่อนชื่อของฉันเป็นอย่างไร ตอนนี้คำถามจริง: ฉันสามารถโยนฟอเรสต์แบบสุ่มตามที่ระบุไว้หรือตัวแยกประเภทอื่น ๆ แต่มีความละเอียดอ่อน - ฉันสนใจเฉพาะความแตกต่างของคลาส c จากคลาส a และ b เท่านั้น ฉันสามารถเรียนสระว่ายน้ำ a และ b แต่มีวิธีที่ดีในการใช้ความรู้เบื้องต้นว่าวัตถุที่ไม่ใช่ c ทั้งหมดน่าจะสร้างกลุ่มที่แตกต่างกันสองกลุ่มหรือไม่? ฉันต้องการใช้ฟอเรสต์แบบสุ่มหรือตัวแปรเนื่องจากมันแสดงให้เห็นว่ามีประสิทธิภาพสำหรับข้อมูลที่คล้ายกับของฉัน แต่ฉันมั่นใจได้ว่าจะลองวิธีอื่น

2
การเลือกคุณสมบัติและการปรับพารามิเตอร์ด้วยคาเร็ตสำหรับฟอเรสต์แบบสุ่ม
ฉันมีข้อมูลที่มีฟีเจอร์ไม่กี่พันรายการและฉันต้องการทำการเลือกฟีเจอร์แบบเรียกซ้ำ (RFE) เพื่อลบข้อมูลที่ไม่ต้องการออก ฉันทำสิ่งนี้ด้วยคาเร็ตและ RFE อย่างไรก็ตามฉันเริ่มคิดว่าถ้าฉันต้องการได้รับแบบจำลองการถดถอยที่ดีที่สุด (เช่นฟอเรสต์แบบสุ่ม) ฉันควรทำการปรับพารามิเตอร์ ( mtryสำหรับ RF) เมื่อใด นั่นคือตามที่ฉันเข้าใจcaretฝึก RF ซ้ำ ๆ กันในชุดย่อยที่แตกต่างกันด้วย mtry คงที่ ฉันคิดว่าmtryควรพบสิ่งที่ดีที่สุดหลังจากการเลือกคุณสมบัติเสร็จสิ้นแล้ว แต่mtryค่าที่คาเร็ตใช้จะมีผลกับชุดย่อยของฟีเจอร์ที่เลือกหรือไม่ แน่นอนว่าการใช้คาเร็เทตกับ low mtryนั้นเร็วกว่ามาก หวังว่าใครบางคนสามารถอธิบายเรื่องนี้กับฉันได้

1
บรรทัดฐานคืออะไรและเกี่ยวข้องกับการทำให้เป็นมาตรฐานหรือไม่
ฉันได้เห็นเอกสารจำนวนมากเกี่ยวกับการนำเสนอที่กระจัดกระจายเมื่อเร็ว ๆ นี้และส่วนใหญ่ใช้บรรทัดฐานและทำการย่อเล็กสุด คำถามของฉันคืออะไรบรรทัดฐานและบรรทัดฐานแบบผสมคืออะไร และเกี่ยวข้องกับการทำให้เป็นมาตรฐานได้อย่างไรℓ p ℓ p , qℓpℓp\ell_pℓpℓp\ell_pℓp,qℓp,q\ell_{p, q} ขอบคุณ

5
ช่วงความเชื่อมั่นและความน่าจะเป็น - ข้อผิดพลาดในคำสั่งนี้อยู่ที่ไหน?
หากมีคนทำคำสั่งเช่นด้านล่าง: "โดยรวมผู้ที่ไม่สูบบุหรี่ที่สัมผัสกับควันสิ่งแวดล้อมมีความเสี่ยงสัมพัทธ์ของโรคหลอดเลือดหัวใจที่ 1.25 (ช่วงความเชื่อมั่น 95 เปอร์เซ็นต์, 1.17-1.32) เมื่อเทียบกับผู้สูบบุหรี่ที่ไม่ได้สัมผัสกับควัน" อะไรคือความเสี่ยงสัมพัทธ์ของประชากรโดยรวม? สิ่งที่เกี่ยวข้องกับโรคหลอดเลือดหัวใจ? ในหลาย ๆ สิ่งที่สามารถทดสอบได้มีเพียงไม่กี่คนเท่านั้นที่เชื่อมโยงกับโรคหลอดเลือดหัวใจดังนั้นโอกาสที่สิ่งใดก็ตามที่ถูกเลือกแบบสุ่มนั้นเชื่อมต่อกันจะหายไป ดังนั้นเราจึงสามารถพูดได้ว่าความเสี่ยงสัมพัทธ์สำหรับประชากรคือ 1 แต่ช่วงเวลาที่ยกมาไม่มีค่า 1 ดังนั้นอย่างใดอย่างหนึ่งมีการเชื่อมต่อระหว่างสองสิ่งความน่าจะเป็นที่มีขนาดเล็กหายไปหรือนี่คือหนึ่งใน 5% ของช่วงเวลาที่ไม่มีพารามิเตอร์ ในฐานะที่เป็นหลังมีโอกาสมากขึ้นกว่าในอดีตมันเป็นสิ่งที่เราควรคิด ดังนั้นข้อสรุปที่เหมาะสมคือชุดข้อมูลเกือบผิดปกติของประชากร แน่นอนถ้ามีพื้นฐานบางอย่างที่สมมติว่ามากกว่า 5% ของสิ่งต่าง ๆ เชื่อมโยงกับโรคหลอดเลือดหัวใจอาจมีหลักฐานบางอย่างในสถิติเพื่อสนับสนุนข้อเสนอแนะว่าควันสิ่งแวดล้อมเป็นหนึ่งในนั้น สามัญสำนึกแนะนำว่าสิ่งนี้ไม่น่าเป็นไปได้ อะไรคือข้อผิดพลาดในการใช้เหตุผลของพวกเขา (เนื่องจากองค์กรด้านสุขภาพทั้งหมดเห็นด้วยว่ามีวรรณกรรมสำคัญเกี่ยวกับผลกระทบที่เป็นอันตรายจากการสูบบุหรี่มือสอง) เป็นเพราะหลักฐานของพวกเขาที่ว่า "ในจำนวนที่มากของสิ่งที่สามารถทดสอบได้จริง ๆ น้อยมากที่เชื่อมต่อกับโรคหลอดเลือดหัวใจ"? ประโยคนี้อาจเป็นจริงสำหรับปัจจัยที่สุ่มเลือกใด ๆ (เช่นจำนวนสุนัขที่บุคคลหนึ่งเป็นเจ้าของที่มีความเสี่ยงต่อโรคหลอดเลือดหัวใจ) แต่ความน่าจะเป็นนิรนัยนั้นสูงกว่าการสูบบุหรี่มือสองและโรคหลอดเลือดหัวใจมากกว่าแค่ 'ปัจจัยสุ่มใด ๆ ' . นี่เป็นเหตุผลที่ถูกต้องหรือไม่? หรือมีอย่างอื่นอีกไหม


3
ความแตกต่างระหว่างเชิงเส้นและสัมพันธ์เชิงเส้นคืออะไร?
กรุณาอธิบายสิ่งที่เป็นความแตกต่างระหว่างสองตัวแปรถ้าเป็นเส้นตรงขึ้นหรือมีความสัมพันธ์เชิงเส้นตรง ฉันค้นหาบทความวิกิพีเดีย แต่ไม่ได้รับตัวอย่างที่เหมาะสม กรุณาอธิบายด้วยตัวอย่าง

4
การทดสอบทางสถิติมาตรฐานคืออะไรเพื่อดูว่าข้อมูลเป็นไปตามการแจกแจงแบบเอ็กซ์โพเนนเชียลหรือการแจกแจงปกติ?
การทดสอบทางสถิติมาตรฐานคืออะไรเพื่อดูว่าข้อมูลเป็นไปตามการแจกแจงแบบเอ็กซ์โพเนนเชียลหรือการแจกแจงปกติ?

1
การกระจายตัวแบบหลายตัวแปรปกติของสัมประสิทธิ์การถดถอย
ในขณะที่อ่านหนังสือเกี่ยวกับการถดถอยฉันพบย่อหน้าต่อไปนี้: การประมาณกำลังสองน้อยที่สุดของเวกเตอร์ของสัมประสิทธิ์การถดถอยเชิงเส้น ( ) คือββ\beta β^= ( Xเสื้อX)- 1Xเสื้อYβ^=(XtX)−1Xty \hat{\beta} = (X^{t}X)^{-1}{X^t}y ซึ่งเมื่อมองว่าเป็นฟังก์ชันของข้อมูล (พิจารณาจากตัวทำนายเป็นค่าคงที่) จะเป็นการรวมกันเชิงเส้นของข้อมูล เมื่อใช้ทฤษฎีบทขีด จำกัด กลางจะสามารถแสดงให้เห็นว่าการแจกแจงจะเป็นแบบหลายตัวแปรโดยประมาณหากขนาดตัวอย่างมีขนาดใหญ่YyyXXXββ\beta ฉันขาดอะไรบางอย่างไปจากข้อความ แต่ฉันไม่เข้าใจว่าค่าเดียวจะมีการแจกแจงได้อย่างไร ค่าหลายค่าถูกสร้างขึ้นเพื่อรับการกระจายที่อ้างถึงในข้อความอย่างไรββ\betaββ\beta

2
มันบ่งบอกอะไรเมื่อความสัมพันธ์ของสเปียร์แมนมีจำนวนที่แน่นอนน้อยกว่าเพียร์สัน?
ฉันมีชุดข้อมูลที่เกี่ยวข้องมากมาย ความสัมพันธ์ของแพร์สันระหว่างคู่ของพวกเขามักจะมีขนาดใหญ่กว่าความสัมพันธ์ของสเปียร์แมนแน่นอน นั่นแสดงให้เห็นว่าความสัมพันธ์ใด ๆ นั้นเป็นเส้นตรง แต่ใคร ๆ ก็คาดหวังว่าแม้ว่าจะมีลูกแพร์สันและสเปียร์แมนเหมือนกันก็ตาม มันหมายความว่าอย่างไรเมื่อมีช่องว่างที่ชัดเจนระหว่างเพียร์สันและสหพันธ์สเปียร์แมนกับแพร์สันนั้นใหญ่กว่า? นี่ดูเหมือนจะเป็นคุณสมบัติที่สอดคล้องกันในชุดข้อมูลของฉัน

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.