สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
กลเม็ดและเคล็ดลับในการเริ่มต้นกับการสร้างแบบจำลองทางสถิติ?
ฉันทำงานด้านการขุดข้อมูลและมีสถิติการศึกษาน้อยมาก เมื่อเร็ว ๆ นี้ฉันได้อ่านงานจำนวนมากที่มุ่งเน้นกระบวนทัศน์แบบเบย์สำหรับการเรียนรู้และการขุดซึ่งฉันพบว่าน่าสนใจมาก คำถามของฉันคือ (ในหลายส่วน) เนื่องจากปัญหามีกรอบทั่วไปที่เป็นไปได้หรือไม่ที่จะสร้างแบบจำลองทางสถิติ สิ่งแรกที่คุณทำเมื่อได้รับชุดข้อมูลที่คุณต้องการสร้างแบบจำลองกระบวนการพื้นฐานคืออะไร? มีหนังสือ / แบบฝึกหัดที่ดีที่อธิบายกระบวนการนี้หรือเป็นเรื่องของประสบการณ์หรือไม่? การอนุมานอยู่ในระดับแนวหน้าของความคิดของคุณเมื่อสร้างแบบจำลองของคุณหรือคุณต้องการที่จะอธิบายข้อมูลก่อนที่คุณจะกังวลเกี่ยวกับวิธีการใช้ในการคำนวณ? ความเข้าใจใด ๆ จะได้รับการชื่นชมอย่างมาก! ขอบคุณ

1
ความแตกต่างระหว่าง GLS และ SUR
ฉันได้อ่านเรื่อง Generalized Least Squares (GLS) บ้างแล้วและพยายามที่จะผูกมันกลับไปที่พื้นฐานทางเศรษฐศาสตร์พื้นฐานของฉัน ฉันจำได้ว่าตอนเรียนอยู่ชั้นมัธยมปลายโดยใช้ Seemingly Unrelated Regression (SUR) ซึ่งดูเหมือนจะค่อนข้างคล้ายกับ GLS กระดาษหนึ่งที่ฉันสะดุดแม้แต่เรียกว่า SUR เป็น "กรณีพิเศษ" ของ GLS แต่ฉันก็ยังไม่สามารถห่อหุ้มสมองของฉันเกี่ยวกับความคล้ายคลึงและความแตกต่าง ดังนั้นคำถาม: อะไรคือความเหมือนและความแตกต่างระหว่าง GLS และ SUR? จุดเด่นของปัญหาที่ควรใช้วิธีหนึ่งเหนืออีกวิธีคืออะไร?

1
แปล R เป็น C ++ (ท้ายที่สุดด้วย Rcpp) [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน2 ปีที่ผ่านมา ผมอยากจะเรียนรู้การใช้Rcpp ฉันอ่านเอกสารบนเว็บไซต์ CRAN ของแพ็คเกจ แต่ฉันรู้สึกว่าตัวอย่างที่ใช้งานได้จริง (การปฏิบัติที่สองโดยพิจารณา convolve3) จะเป็นประโยชน์มากกว่า ฉันเสนอรหัสต่อไปนี้จากแพ็คเกจฐานที่แข็งแกร่งเพราะมันไม่ยาวเกินไปหรือสั้นเกินไปใช้การรวมกันของประเภท R และฟังก์ชั่น R และมีหนึ่งในการคำนวณเลขคณิตเล็ก ๆ เหล่านั้นที่ช้าเกินไปในอาร์คุณจะทำอย่างไรต่อ Rcpp - มัน scaleTau2<-function (x, c1 = 4.5, c2 = 3, consistency = TRUE, mu.too = FALSE){ n <- length(x) medx <- median(x) x. <- abs(x - medx) …
10 r  c++ 

2
การทดสอบไคสแควร์เพื่อความเท่าเทียมกันของการแจกแจง: มีศูนย์กี่ตัวที่ทนได้?
ฉันกำลังเปรียบเทียบการกลายพันธุ์สองกลุ่มแต่ละกลุ่มสามารถมีฟีโนไทป์ที่แตกต่างกันเพียงหนึ่งใน 21 ชนิด ฉันต้องการดูว่าการกระจายตัวของผลลัพธ์เหล่านี้คล้ายกันระหว่างสองกลุ่มหรือไม่ ฉันพบการทดสอบออนไลน์ ที่คำนวณ "การทดสอบไคสแควร์เพื่อความเท่าเทียมของการแจกแจง" และให้ผลลัพธ์ที่น่าเชื่อถือแก่ฉัน อย่างไรก็ตามฉันมีเลขศูนย์สองสามตัวในตารางนี้ฉันสามารถใช้ไคสแควร์ในกรณีนี้ได้หรือไม่? นี่คือตารางที่มีสองกลุ่มและจำนวนฟีโนไทป์โดยเฉพาะ: 2 1 2 3 1 6 1 4 13 77 7 27 0 1 0 4 0 2 2 7 2 3 1 5 1 9 2 6 0 3 3 0 1 3 0 3 1 0 1 2 …

1
การวิเคราะห์กลุ่มตามด้วยการวิเคราะห์จำแนก
เหตุผลถ้ามีการใช้การวิเคราะห์การจำแนก (DA) ในผลลัพธ์ของอัลกอริทึมการจัดกลุ่มเช่น k- หมายถึงเท่าที่ฉันเห็นมันเป็นครั้งคราวในวรรณคดี โดยทั่วไปจะไม่แนะนำให้ทดสอบความแตกต่างของกลุ่มในตัวแปรที่ใช้ในระหว่างการสร้างคลัสเตอร์เนื่องจากพวกเขาสนับสนุนการขยายใหญ่สุด (resp. minimization) ระหว่างคลาส (resp. ภายในคลาส) ความเฉื่อย ดังนั้นฉันไม่แน่ใจว่าจะชื่นชมคุณค่าที่เพิ่มขึ้นของ DA ที่คาดการณ์ได้อย่างเต็มที่เว้นแต่เราจะพยายามฝังบุคคลในพื้นที่แฟคทอเรียลในมิติที่ต่ำกว่าและรับแนวคิด "generalizability" ของพาร์ติชันดังกล่าว แต่แม้ในกรณีนี้การวิเคราะห์กลุ่มยังคงเป็นเครื่องมือพื้นฐานดังนั้นการใช้ความเป็นสมาชิกในชั้นเรียนคำนวณด้วยวิธีนี้เพื่อให้ได้กฎการให้คะแนนที่ดูแปลก ๆ ตั้งแต่แรกเห็น คำแนะนำแนวคิดหรือพอยน์เตอร์ไปยังเอกสารที่เกี่ยวข้อง?

3
วิธีจัดการกับตัวแปรเด็ดขาดที่ไม่ใช่แบบไบนารีในการถดถอยโลจิสติก (SPSS)
ฉันต้องทำการถดถอยโลจิสติกแบบไบนารีด้วยตัวแปรอิสระจำนวนมาก ส่วนใหญ่เป็นไบนารี แต่ตัวแปรเด็ดขาดบางส่วนมีมากกว่าสองระดับ วิธีที่ดีที่สุดในการจัดการกับตัวแปรดังกล่าวคืออะไร? ตัวอย่างเช่นสำหรับตัวแปรที่มีค่าที่เป็นไปได้สามค่าฉันคิดว่าต้องสร้างตัวแปรจำลองสองตัว จากนั้นในขั้นตอนการถดถอยแบบชาญฉลาดควรทดสอบตัวแปรจำลองทั้งสองพร้อมกันหรือทดสอบแยกกัน ฉันจะใช้ SPSS แต่ฉันจำไม่ได้ดีดังนั้น: SPSS จะจัดการกับสถานการณ์นี้ได้อย่างไร ยิ่งไปกว่านั้นสำหรับตัวแปรหมวดหมู่ตามลำดับมันเป็นสิ่งที่ดีหรือไม่ที่จะใช้ตัวแปรจำลองที่สร้างสเกลตามลำดับขึ้นมาใหม่? (ตัวอย่างเช่นการใช้สามตัวแปรดัมมี่สำหรับ 4 รัฐตัวแปรลำดับใส่0-0-0ระดับ , ระดับ2 , ระดับ3และระดับ4แทน, , และสำหรับ 4 ระดับ.)1111-0-02221-1-03331-1-14440-0-01-0-00-1-00-0-1

2
ควรใช้การทดสอบแบบพาราเมตริกเมื่อใดที่จะใช้การทดสอบแบบ homoscedasticity
หากหนึ่งคือการทดสอบสมมติฐานของ homoscedasticity ตัวแปร (Bartlett ทดสอบความสม่ำเสมอของผลต่าง, bartlett.test) และไม่ใช่ตัวแปร (Figner-คิลลีนการทดสอบความสม่ำเสมอของผลต่าง, fligner.test) การทดสอบที่มีอยู่ จะบอกได้อย่างไรว่าจะใช้แบบไหน? สิ่งนี้ควรขึ้นอยู่กับความเป็นปกติของข้อมูลหรือไม่

4
การกระจายแบบไม่แสดงอาการของมัลติโนเมียล
ฉันกำลังมองหาการ จำกัด การกระจายตัวของการกระจายตัวแบบมัลติโนเมียมากกว่าผลลัพธ์ IE กระจายดังต่อไปนี้ limn→∞n−12Xnlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} โดยที่เป็นตัวแปรสุ่มค่าเวกเตอร์ที่มีความหนาแน่นf n ( x )สำหรับxเช่นนั้น∑ ฉันx ฉัน = n , x ฉัน ∈ Z , x ฉัน ≥ 0และ 0 สำหรับxอื่น ๆ ทั้งหมดโดยที่XnXn\mathbf{X_n}fn(x)fn(x)f_n(\mathbf{x})xx\mathbf{x}∑ixi=n∑ixi=n\sum_i x_i=nxi∈Z,xi≥0xi∈Z,xi≥0x_i\in \mathbb{Z}, x_i\ge 0xx\mathbf{x} fn(x)=n!∏i=1dpxiixi!fn(x)=n!∏i=1dpixixi!f_{n}(\mathbf{x})=n!\prod_{i=1}^d\frac{p_i^{x_i}}{x_i!} ฉันพบหนึ่งรูปแบบใน "ทฤษฎีทั้งหมด" ของ Larry Wasserman 14.6 หน้า 237แต่สำหรับการ จำกัด การกระจายมันให้ Normal กับเมทริกซ์ความแปรปรวนร่วมเอกพจน์ดังนั้นฉันไม่แน่ใจว่าจะทำให้มาตรฐานเป็นปกติได้อย่างไร คุณสามารถฉายเวกเตอร์สุ่มลงในช่องว่างมิติ …

2
แบนด์วิดท์เคอร์เนลในการประมาณความหนาแน่นของเคอร์เนล
ฉันกำลังทำการประมาณค่าความหนาแน่นเคอร์เนลโดยมีการตั้งค่าคะแนนถ่วงน้ำหนัก (เช่น. แต่ละตัวอย่างมีน้ำหนักที่ไม่จำเป็นต้องใช้) ในมิติ N นอกจากนี้ตัวอย่างเหล่านี้อยู่ในพื้นที่เมตริก (เช่น. เราสามารถกำหนดระยะห่างระหว่างพวกเขา) แต่ไม่มีอะไรอื่น ตัวอย่างเช่นเราไม่สามารถหาค่าเฉลี่ยของคะแนนตัวอย่างหรือค่าเบี่ยงเบนมาตรฐานหรือปรับขนาดตัวแปรหนึ่งเมื่อเทียบกับตัวแปรอื่น เคอร์เนลได้รับผลกระทบจากระยะทางนี้และน้ำหนักของตัวอย่างแต่ละตัว: ฉ( x ) = 1∑ w e i gเอชทีเอสผม* Σ W อีฉันกรัมเอชทีผมชั่วโมง∗ Ke r n e l ( dฉันs T n คอี( x , xผม)ชั่วโมง)ฉ(x)=1ΣWอีผมก.ชั่วโมงเสื้อsผม* * * *ΣWอีผมก.ชั่วโมงเสื้อผมชั่วโมง* * * *KอีRnอีล.(dผมsเสื้อanคอี(x,xผม)ชั่วโมง)f(x) = \frac{1.}{\sum weights_i} * \sum\frac{weight_i}{h} * Kernel(\frac{distance(x,x_i)}{h}) ในบริบทนี้ฉันกำลังพยายามที่จะหาการประเมินประสิทธิภาพสำหรับแบนด์วิดธ์เคอร์เนลอาจจะเป็นตำแหน่งที่แตกต่างกันและโดยเฉพาะอย่างยิ่งที่จะช่วยให้การฟื้นฟูที่ถูกต้องในการฝึกอบรมชุดxฉัน …

4
พล็อต QQ เชิงปริมาณ
qq-plot สามารถใช้เพื่อให้เห็นภาพว่าการแจกแจงสองแบบที่เหมือนกันนั้นมีความคล้ายคลึงกันอย่างไร (เช่นการแสดงภาพความคล้ายคลึงกันของการแจกแจงกับการแจกแจงแบบปกติ มีสถิติใดบ้างที่สร้างจุดประสงค์และการวัดเชิงตัวเลขที่แสดงถึงความคล้ายคลึงกันมากกว่า (ควรอยู่ในรูปแบบปกติ (0 <= x <= 1)) ค่าสัมประสิทธิ์ Gini เป็นตัวอย่างที่ใช้ในเศรษฐศาสตร์เมื่อทำงานกับเส้นโค้ง Lorenz; มีบางอย่างสำหรับแผนการ QQ

4
วิธีการมองหาหุบเขาในกราฟ?
ฉันกำลังตรวจสอบข้อมูลความครอบคลุมจีโนมซึ่งโดยทั่วไปเป็นจำนวนเต็ม (ไม่กี่ล้านค่า) ของจำนวนเต็มแต่ละคนบอกว่าตำแหน่งนี้ในจีโนมดีแค่ไหน (หรือ "ลึก") ฉันต้องการค้นหา "หุบเขา" ในข้อมูลนี้นั่นคือภูมิภาคที่ "ต่ำ" อย่างมีนัยสำคัญมากกว่าสภาพแวดล้อมโดยรอบ โปรดทราบว่าขนาดของหุบเขาที่ฉันกำลังมองหาอาจมีตั้งแต่ 50 ฐานไปจนถึงสองสามพันแห่ง คุณอยากจะแนะนำกระบวนทัศน์ประเภทใดในการค้นหาหุบเขาเหล่านั้น UPDATE ตัวอย่างกราฟิกสำหรับข้อมูล: อัพเดท 2 การกำหนดว่าหุบเขาคืออะไรแน่นอนว่าเป็นหนึ่งในคำถามที่ฉันต้องดิ้นรน นี่คือสิ่งที่ชัดเจนสำหรับฉัน: แต่มีบางสถานการณ์ที่ซับซ้อนมากขึ้น โดยทั่วไปมีหลักเกณฑ์ 3 ข้อที่ฉันพิจารณา: 1. ความครอบคลุม (โดยเฉลี่ย? สูงสุด) ในหน้าต่างที่เกี่ยวข้องกับค่าเฉลี่ยทั่วโลก 2. ความครอบคลุม (... ) ในหน้าต่างที่เกี่ยวกับบริเวณโดยรอบ 3. วิธีการที่มีขนาดใหญ่เป็นหน้าต่าง: หากฉันเห็นความคุ้มครองที่ต่ำมากสำหรับช่วงสั้น ๆ เป็นที่น่าสนใจถ้าฉันเห็นความคุ้มครองที่ต่ำมากสำหรับช่วงยาวก็ยังน่าสนใจถ้าฉันเห็นความคุ้มครองต่ำอย่างอ่อนโยนสำหรับช่วงสั้นก็ไม่น่าสนใจจริงๆ แต่ถ้าฉันเห็นการครอบคลุมที่ต่ำอย่างอ่อนโยนเป็นเวลานาน - มันคือ .. ดังนั้นมันจึงเป็นการรวมกันของความยาวของ sapn และความครอบคลุม ยิ่งฉันปล่อยให้ความคุ้มครองสูงเท่าไหร่และยิ่งคิดว่าเป็นหุบเขา ขอบคุณ เดฟ

2
การเปรียบเทียบตามยาวของการแจกแจงสองแบบ
ฉันมีผลการตรวจเลือดที่ให้กับคน 2,500 คนสี่ครั้งในช่วงเวลาหกเดือน ผลลัพธ์ส่วนใหญ่ประกอบด้วยสองมาตรการของการตอบสนองของภูมิคุ้มกัน - หนึ่งในการปรากฏตัวของแอนติเจนวัณโรคบางอย่างหนึ่งในกรณีที่ไม่มี ขณะนี้การทดสอบแต่ละครั้งประเมินว่าเป็นบวกหรือลบตามความแตกต่างระหว่างการตอบสนองของแอนติเจนและการตอบสนองแบบไม่มีศูนย์ (ด้วยแนวคิดที่ว่าถ้าระบบภูมิคุ้มกันของคุณตอบสนองต่อแอนติเจนของวัณโรคคุณอาจมีโอกาสสัมผัสกับแบคทีเรียในบางจุด ) ในสาระสำคัญการทดสอบสมมติว่าการแจกแจงแบบไม่มีการเปิดเผยของแต่ละบุคคลและการตอบสนองของวัณโรคควรเหมือนกันโดยทั่วไปในขณะที่คนที่สัมผัสกับวัณโรคจะได้รับการตอบสนองจากการกระจายวัณโรคที่แตกต่างกัน ข้อแม้: การตอบสนองเป็นอย่างมากไม่ธรรมดามากและให้คุณค่าเป็นก้อนที่พื้นธรรมชาติและเพดานที่ถูกตัดทอน อย่างไรก็ตามดูเหมือนว่าจะค่อนข้างชัดเจนในการตั้งค่าระยะยาวนี้ว่าเราได้รับ "ผลบวกปลอม" (ไม่มีมาตรฐานทองคำจริงสำหรับวัณโรคแฝงฉันกลัว) ที่เกิดจากความผันผวนของแอนติเจนและไม่มีการตอบสนอง แม้ว่านี่อาจเป็นเรื่องยากที่จะหลีกเลี่ยงในบางสถานการณ์ (คุณอาจมีโอกาสเพียงครั้งเดียวในการทดสอบใครบางคน) แต่ก็มีหลายสถานการณ์ที่ผู้คนได้รับการทดสอบวัณโรคเป็นประจำทุกปีหรือมากกว่านั้น - ในสหรัฐอเมริกา ทหารคนไร้ที่อยู่อาศัยที่พักพิงและอื่น ๆ ดูเหมือนว่าเป็นเรื่องน่าละอายที่จะเพิกเฉยต่อผลการทดสอบก่อนหน้านี้ ฉันคิดว่าสิ่งที่ฉันต้องการจะทำคือสิ่งที่ฉันคิดว่าเป็นการวิเคราะห์ส่วนผสมตามยาว เช่นเดียวกับเกณฑ์ตัดขวางฉันต้องการประเมินความน่าจะเป็นที่การตอบสนองวัณโรคและศูนย์ของแต่ละบุคคลมาจากการแจกแจงแบบเดียวกัน - แต่การประมาณนั้นรวมเอาผลการทดสอบก่อนหน้ารวมทั้งข้อมูลจากตัวอย่างเป็น ภาพรวมทั้งหมด (เช่นฉันสามารถใช้การกระจายแบบกว้างของความแปรปรวนภายในบุคคลเพื่อปรับปรุงการประมาณการของฉันเกี่ยวกับการกระจายตัวของศูนย์หรือวัณโรคที่เฉพาะเจาะจงของแต่ละบุคคลได้หรือไม่) แน่นอนว่าความน่าจะเป็นโดยประมาณนั้นจะต้องสามารถเปลี่ยนแปลงได้ตลอดเวลาเพื่อพิจารณาความเป็นไปได้ของการติดเชื้อใหม่ ฉันบิดตัวเองโดยสิ้นเชิงเมื่อพยายามคิดเกี่ยวกับสิ่งนี้ในรูปแบบที่ผิดปกติ แต่ฉันรู้สึกว่าแนวคิดนี้ดีพอ ๆ กับที่ฉันจะเกิดขึ้น หากบางสิ่งไม่สมเหตุสมผลโปรดขอคำชี้แจง หากความเข้าใจของฉันเกี่ยวกับสถานการณ์ดูเหมือนจะผิดโปรดบอกฉัน ขอบคุณมากสำหรับความช่วยเหลือของคุณ. ในการตอบสนองต่อ Srikant: เป็นกรณีของการจำแนกประเภทแฝง (ติดเชื้อวัณโรคหรือไม่) โดยใช้ผลการทดสอบสองอย่างต่อเนื่อง (แต่ไม่ใช่แบบปกติและแบบตัดปลาย) ตอนนี้การจัดหมวดหมู่นั้นทำได้โดยใช้ cutoff (ในรูปแบบที่เรียบง่าย TB - nil> …

6
แนะนำหนังสือ / บทความ / คำแนะนำเพื่อป้อนการวิเคราะห์เชิงทำนายไหม
สื่อการเรียนรู้แบบไหนที่คุณจะแนะนำสำหรับนักคณิตศาสตร์ CS person / นักสามเณร / สามเณรที่จะเข้าสู่การวิเคราะห์เชิงทำนาย


1
ตัวอย่างของกระบวนการที่เป็นลำดับที่ 2 นิ่ง แต่ไม่หยุดนิ่งอย่างเคร่งครัด
มีใครบ้างที่เป็นตัวอย่างที่ดีของกระบวนการสโทแคสติกที่เป็นอันดับ 2 ซึ่งอยู่นิ่ง แต่ไม่หยุดนิ่งอย่างเคร่งครัดหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.