สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
SVM ที่มีขนาดกลุ่มไม่เท่ากันในข้อมูลการฝึกอบรม
ฉันกำลังพยายามสร้าง SVM จากข้อมูลการฝึกอบรมซึ่งมีกลุ่มหนึ่งแสดงมากกว่ากลุ่มอื่น อย่างไรก็ตามกลุ่มจะถูกนำเสนออย่างเท่าเทียมกันในข้อมูลการทดสอบในที่สุด ดังนั้นฉันต้องการใช้class.weightsพารามิเตอร์ของe1071ส่วนต่อประสาน R libsvmเพื่อความสมดุลระหว่างอิทธิพลของทั้งสองกลุ่มในข้อมูลการฝึกอบรม เนื่องจากฉันไม่แน่ใจว่าจะระบุน้ำหนักเหล่านี้ได้อย่างไรฉันจึงทำการทดสอบเล็กน้อย: สร้างข้อมูลที่มีค่าว่างบางส่วน (คุณสมบัติแบบสุ่มอัตราส่วน 2: 1 ระหว่างป้ายกำกับกลุ่ม) พอดี svm ด้วยclass.weightsชุดพารามิเตอร์ ทำนายชุดข้อมูลว่างใหม่จำนวนหนึ่งและดูสัดส่วนของคลาส ทำซ้ำกระบวนการทั้งหมดหลายครั้งสำหรับชุดการฝึกอบรมแบบ null ที่แตกต่างกัน นี่คือรหัส R ที่ฉันใช้: nullSVM <- function(n.var, n.obs) { # Simulate null training data vars = matrix(rnorm(n.var*n.obs), nrow=n.obs) labels = rep(c('a', 'a', 'b'), length.out=n.obs) data = data.frame(group=labels, vars) # Fit SVM …

2
อินทิกรัลประมาณโดยใช้การจำลองมอนติคาร์โลใน R
ฉันจะประมาณอินทิกรัลต่อไปนี้โดยใช้การจำลอง MC ได้อย่างไร ∫1−1∫1−1|x−y|dxdy∫−11∫−11|x−y|dxdy \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y ขอบคุณ! แก้ไข (บางบริบท): ฉันกำลังพยายามเรียนรู้วิธีใช้การจำลองเพื่อการอินทิเกรตโดยประมาณและฉันได้รับการฝึกฝนเมื่อฉันประสบปัญหาบางอย่าง แก้ไข 2 + 3 : อย่างใดฉันก็สับสนและคิดว่าฉันต้องแยกอินทิกรัลเป็นส่วนแยก ดังนั้นฉันคิดออกจริง: n <- 15000 x <- runif(n, min=-1, max=1) y <- runif(n, min=-1, max=1) mean(4*abs(x-y))

4
การอ้างอิงสำหรับนักสถิติให้คำปรึกษาเพื่อเสนอลูกค้าของพวกเขา
คำถามนี้แสดงให้เห็นถึงความยากลำบากของบุคคลที่มีความเชี่ยวชาญด้านสถิติและความน่าจะเป็นด้วยตนเองเมื่อเผชิญกับทรัพยากรที่มีการพัฒนาน้อยเช่นวิกิพีเดีย มันเกิดขึ้นกับฉันว่านักสถิติให้คำปรึกษาและมีบางอย่างที่นี่เป็นประจำอาจเผชิญกับความท้าทายในการอธิบายแนวคิดและวิธีการบางอย่างให้กับลูกค้า นี่คือด้านพลิกของเหรียญการสอน เมื่อมีความเชี่ยวชาญในแนวความคิดมันอาจทำให้รู้สึกถึงวิธีการวิเคราะห์โดยเฉพาะ แต่การอ้างอิงของบุคคลนั้นอาจไม่เหมาะสมหรือยากที่จะแบ่งปันกับลูกค้า ดังนั้นมีแหล่งข้อมูลทั่วไปที่ให้คำปรึกษานักสถิติชอบที่จะแนะนำให้กับลูกค้าของพวกเขา? (ดูอัปเดต # 1 เกี่ยวกับหัวข้อขั้นสูงหรือหัวข้อพิเศษเพิ่มเติม) ฉันนึกถึงหนังสือสองสามเล่มที่อาจมีประโยชน์ แต่ฉันสงสัยว่าลูกค้าจำนวนมากจะไปค้นหาเว็บอย่างที่นักพัฒนาทำและจะเจอกับเนื้อหาที่ไม่มีสาระในวิกิพีเดีย ในคำตอบของฉันสำหรับผู้พัฒนาฉันแนะนำNIST Handbookเป็นข้อมูลอ้างอิงหนึ่งที่สามารถใช้ได้ มีอะไรอีกบ้าง? อัปเดต 1: ตามที่Peter Flom ได้ชี้ให้เห็นสำหรับวัสดุขั้นสูงหรือการแสวงหาที่แคบกว่ามันอาจไม่ใช่เรื่องง่ายที่จะเสนอจุดอ้างอิงเดียว นี้ถูกต้องและฉันควรจะถามคำถามที่แตกต่างกันสำหรับกรณีเหล่านั้น ในกรณีเช่นนี้ที่ปรึกษาจะค้นหาและแบ่งปันการอ้างอิงที่เข้าถึงได้อย่างไร ฉันเชื่อว่าที่ปรึกษาจำนวนมากจะใช้เวลาเขียนสิ่งใหม่เพื่ออธิบายสิ่งต่าง ๆ กับลูกค้าของพวกเขา แต่นั่นไม่ใช่การอ้างอิงที่ถูกค้นพบและแบ่งปัน ความคิดบางอย่าง: แบบฝึกหัดที่เขียนโดยที่ปรึกษาหรือคนอื่น ๆ กรณีศึกษาหรือการวิเคราะห์จากโครงการที่แสดงแนวคิดเดียวกัน ข้อความที่ตัดตอนมาจากหนังสือ (ตามที่ฉันแนะนำในคำตอบของฉันสำหรับ Developer) ซึ่งอธิบายแนวคิด มีอะไรอีกบ้างที่อาจเป็นแหล่งข้อมูลหรือคุณจะไปหาแหล่งอ้างอิงดังกล่าวอีกครั้งอย่างไร ฉันรู้ว่านี่เป็นคำถามปลายเปิด แต่คำตอบของฉันสำหรับผู้พัฒนาแสดงให้เห็นถึงวิธีการที่ฉันจัดการกับปัญหานี้ ฉันไม่ได้ตั้งใจจะถามถึงวิธีการทั้งหมดที่เราสามารถแก้ไขปัญหานี้ได้ แต่จากประสบการณ์ของตัวเองคุณมักจะให้แหล่งข้อมูลที่อธิบายได้อย่างไร

2
แบบจำลองพารามิเตอร์ของความแปรปรวนของข้อมูลการนับ
ฉันกำลังมองหาแบบจำลองข้อมูลบางอย่าง แต่ฉันไม่แน่ใจว่าแบบจำลองชนิดใดที่ฉันสามารถใช้ได้ ฉันมีข้อมูลนับและฉันต้องการรูปแบบที่จะให้การประมาณค่าพารามิเตอร์ของทั้งค่าเฉลี่ยและความแปรปรวนของข้อมูล นั่นคือฉันมีปัจจัยการทำนายที่หลากหลายและฉันต้องการตรวจสอบว่ามีปัจจัยใดที่ส่งผลต่อความแปรปรวน (ไม่ใช่แค่ค่าเฉลี่ยของกลุ่ม) ฉันรู้ว่าการถดถอยของปัวซองจะไม่ทำงานเพราะความแปรปรวนเท่ากับค่าเฉลี่ย สมมติฐานนี้ไม่ถูกต้องในกรณีของฉันดังนั้นฉันรู้ว่ามีการกระจายเกินจริง อย่างไรก็ตามโมเดลทวินามลบเชิงลบจะสร้างพารามิเตอร์ overdispersion เดียวเท่านั้นไม่ใช่แบบจำลองฟังก์ชันของตัวทำนายในโมเดล รูปแบบใดที่สามารถทำได้ นอกจากนี้การอ้างอิงถึงหนังสือหรือกระดาษที่กล่าวถึงรูปแบบและ / หรือแพคเกจ R ซึ่งใช้รูปแบบจะได้รับการชื่นชม

4
ตัวอย่างผลที่ตามมาราคาแพงจากการใช้เครื่องมือทางสถิติอย่างไม่เหมาะสม
ฉันสงสัยว่าผู้ใช้เครื่องมือทางสถิติส่วนใหญ่เป็นผู้ใช้เสริม (ผู้ที่มีการฝึกอบรมด้านสถิติอย่างเป็นทางการจนถึงไม่มีการฝึกอบรมเล็กน้อย) มันเป็นเรื่องดึงดูดสำหรับนักวิจัยและผู้เชี่ยวชาญด้านอื่น ๆ ที่จะใช้วิธีการทางสถิติกับข้อมูลของพวกเขาเพียงเพราะพวกเขาเห็นว่า "ทำมาก่อน" ในเอกสารที่ผ่านการตรวจสอบโดยผู้เขียนบทความวรรณกรรมสีเทาเว็บหรือการประชุม อย่างไรก็ตามการทำเช่นนั้นโดยไม่มีความเข้าใจที่ชัดเจนเกี่ยวกับสมมติฐานที่ต้องการและข้อ จำกัด ของเครื่องมือทางสถิติสามารถนำไปสู่ผลลัพธ์ที่ผิดพลาดได้ - ข้อผิดพลาดมักไม่ได้รับการยอมรับ! ฉันพบว่านักศึกษาระดับปริญญาตรี (โดยเฉพาะอย่างยิ่งในสังคมศาสตร์และวิทยาศาสตร์ธรรมชาติ) เป็นทั้งที่ไม่รู้ถึงความผิดพลาดทางสถิติหรือพบข้อผิดพลาดที่ไม่แน่นอนเหล่านี้ (ซึ่งส่วนใหญ่เป็นกรณีหลัง) แม้ว่าตัวอย่างของการใช้เครื่องมือทางสถิติอย่างไม่เหมาะสมสามารถพบได้ในหนังสือตำราระดับเบื้องต้นหลายเล่มเว็บหรือ StackExchange แต่ฉันมีเวลายากที่จะหาตัวอย่างในโลกแห่งความจริงที่มีผลลัพธ์ที่เป็นอันตราย (เช่นค่าใช้จ่ายในดอลลาร์ผลกระทบต่อชีวิตและอาชีพสูญหาย) . ด้วยเหตุนี้ฉันกำลังมองหาตัวอย่างในโลกแห่งความจริงที่เน้นการใช้วิธีการทางสถิติที่ผิด: วิธีการทางสถิติที่ใช้มักจะกล่าวถึงในหลักสูตรสถิติเบื้องต้น (เช่นสถิติเชิงอนุมานการถดถอย ฯลฯ ... ) ผลลัพธ์ที่ได้มีผลกระทบค่าใช้จ่าย (ดอลลาร์หายไปชีวิตได้รับผลกระทบอาชีพแตก ฯลฯ ... ) ข้อมูลที่มีความพร้อมสำหรับการใช้งานเป็นตัวอย่างการทำงานในหลักสูตร (มีวัตถุประสงค์เพื่อให้นักเรียนทำงานผ่านตัวอย่างจริงของโลกที่มีผลกระทบโลกแห่งความจริง.) ตัวอย่างที่ไม่ใช่ทางสถิติอย่างหนึ่งที่ฉันต้องการนำมาให้นักเรียนเมื่อพูดคุยถึงความสำคัญของการกำหนดหน่วยในโครงการวิจัยอย่างถูกต้องคือ“ mishap metric”ที่นำไปสู่การสูญเสียดาวเทียม $ 125M! สิ่งนี้มักจะเรียกใช้: - ปัจจัยจากนักเรียนและดูเหมือนว่าจะมีความประทับใจยาวนาน (อย่างน้อยตลอดช่วงชีวิตการศึกษาสั้น ๆ )

5
ฉันสามารถใช้ PCA เพื่อทำการเลือกตัวแปรสำหรับการวิเคราะห์กลุ่มได้หรือไม่
ฉันต้องลดจำนวนของตัวแปรเพื่อดำเนินการวิเคราะห์กลุ่ม ตัวแปรของฉันมีความสัมพันธ์อย่างมากดังนั้นฉันจึงคิดว่าจะทำการวิเคราะห์ปัจจัย PCA (การวิเคราะห์องค์ประกอบหลัก) อย่างไรก็ตามถ้าฉันใช้คะแนนผลลัพธ์กลุ่มของฉันไม่ถูกต้อง (เทียบกับการจำแนกประเภทก่อนหน้านี้ในวรรณคดี) คำถาม: ฉันสามารถใช้เมทริกซ์การหมุนเพื่อเลือกตัวแปรที่มีโหลดมากที่สุดสำหรับแต่ละส่วนประกอบ / ตัวประกอบและใช้เฉพาะตัวแปรเหล่านี้สำหรับการจัดกลุ่มของฉันได้หรือไม่ การอ้างอิงบรรณานุกรมใด ๆ ก็จะมีประโยชน์เช่นกัน ปรับปรุง: clarifiations บาง: เป้าหมายของฉัน: ฉันต้องเรียกใช้การวิเคราะห์กลุ่มด้วยอัลกอริทึมแบบสองขั้นตอนโดย SPSS แต่ตัวแปรของฉันไม่ได้เป็นอิสระดังนั้นฉันจึงคิดถึงการทิ้งบางอย่าง ชุดข้อมูลของฉัน: ฉันทำงานกับพารามิเตอร์สเกลาร์ 15 รายการ (ตัวแปรของฉัน) จำนวน 100,000 ราย ตัวแปรบางตัวมีความสัมพันธ์กันอย่างมาก ( Pearson)>0.9>0.9>0.9 ข้อสงสัยของฉัน: เนื่องจากฉันต้องการเพียงตัวแปรอิสระฉันจึงคิดว่าจะทำการวิเคราะห์องค์ประกอบหลัก (ขออภัย: ฉันพูดถึงการวิเคราะห์ปัจจัยในคำถามเดิมของฉันผิดพลาด) และเลือกเฉพาะตัวแปรที่มีการโหลดมากที่สุดสำหรับแต่ละองค์ประกอบ ฉันรู้ว่ากระบวนการ PCA นำเสนอบางขั้นตอนโดยพลการ แต่ฉันพบว่าการเลือกนี้คล้ายกับ " วิธี B4 " ที่เสนอโดย IT Jolliffe (1972 & 2002) …

3
การอ่านเพียงสองในสามคอลัมน์ด้วย read.csv
ล็อคแล้ว คำถามและคำตอบของคำถามนี้ถูกล็อคเนื่องจากคำถามอยู่นอกหัวข้อ แต่มีความสำคัญทางประวัติศาสตร์ ขณะนี้ไม่ยอมรับคำตอบหรือการโต้ตอบใหม่ ฉันมีชุดข้อมูล ascii ซึ่งประกอบด้วยสามคอลัมน์ แต่มีเพียงสองชุดสุดท้ายเท่านั้นที่เป็นข้อมูลจริง ตอนนี้ผมต้องการที่จะสร้าง dotchart read.csv(file = "result1", sep= " ")ของข้อมูลโดยใช้ R อ่านทั้งสามคอลัมน์ ฉันจะหลีกเลี่ยงสิ่งนี้ได้อย่างไร
12 r 

2
ความแตกต่างระหว่าง t-test และ ANOVA ในการถดถอยเชิงเส้น
ฉันสงสัยว่าความแตกต่างระหว่าง t-test และ ANOVA ในการถดถอยเชิงเส้นคืออะไร t-test เพื่อทดสอบว่าหนึ่งในความชันและการสกัดกั้นใดมีค่าเป็นศูนย์หรือไม่ในขณะที่ ANOVA เพื่อทดสอบว่าความชันทั้งหมดมีค่าเป็นศูนย์หรือไม่ นี่เป็นข้อแตกต่างระหว่างพวกเขาเหรอ? ในการถดถอยเชิงเส้นอย่างง่ายนั่นคือมีตัวแปรตัวทำนายเพียงตัวเดียวเท่านั้น t-test และ ANOVA มีความเทียบเท่าหรือไม่และถ้าใช่วิธีการที่พวกเขาใช้สถิติที่แตกต่างกัน (t-test ใช้ t-statistic และ ANOVA ใช้ F-statistic)?

4
การพยากรณ์อนุกรมเวลาไบนารี
ฉันมีซีรี่ย์เวลาแบบไบนารี่ด้วย 1 เมื่อรถไม่เคลื่อนที่และ 0 เมื่อรถเคลื่อนที่ ฉันต้องการพยากรณ์ล่วงหน้าเป็นเวลานานถึง 36 ชั่วโมงและทุกชั่วโมง วิธีแรกของฉันคือใช้ Naive Bayes โดยใช้ข้อมูลต่อไปนี้: t-24 (ทุกวันตามฤดูกาล), t-48 (ฤดูกาลประจำสัปดาห์), ชั่วโมงของวัน อย่างไรก็ตามผลลัพธ์ไม่ดีมาก คุณแนะนำบทความหรือซอฟต์แวร์ใดสำหรับปัญหานี้

4
เครื่องมือประมาณการสำหรับการแจกแจงแบบทวินาม
เราจะกำหนดตัวประมาณสำหรับข้อมูลที่มาจากการแจกแจงทวินามได้อย่างไร สำหรับเบอนูลลี่ฉันสามารถคิดถึงตัวประมาณค่าพารามิเตอร์ p แต่สำหรับทวินามฉันไม่สามารถดูพารามิเตอร์ที่จะประมาณได้เมื่อเรามีการแจกแจงคุณสมบัติ ปรับปรุง: โดยตัวประมาณฉันหมายถึงฟังก์ชันของข้อมูลที่สังเกตได้ ตัวประมาณจะใช้ในการประมาณค่าพารามิเตอร์ของการแจกแจงที่สร้างข้อมูล


2
จะระบุความแตกต่างที่เฉพาะเจาะจงสำหรับการวัด ANOVA ซ้ำโดยใช้รถยนต์ได้อย่างไร
ฉันพยายามเรียกใช้มาตรการ Anova ใน R ซ้ำแล้วตามด้วยความแตกต่างเฉพาะบนชุดข้อมูลนั้น ฉันคิดว่าวิธีที่ถูกต้องน่าจะใช้ Anova()จากแพ็คเกจรถ ช่วยให้แสดงคำถามของฉันพร้อมตัวอย่างที่นำมาจากการ?Anovaใช้ OBrienKaiserข้อมูล (หมายเหตุ: ฉันสรุปปัจจัยทางเพศจากตัวอย่าง): เรามีการออกแบบที่มีปัจจัยหนึ่งระหว่างวิชาการรักษา (3 ระดับ: การควบคุม A, B) และซ้ำ 2 - วัด (ภายในวิชา) ปัจจัยระยะ (3 ระดับ: แบบทดสอบก่อนเรียนหลังการติดตาม) และชั่วโมง (5 ระดับ: 1 ถึง 5) ตาราง ANOVA มาตรฐานมอบให้โดย (แตกต่างจากตัวอย่าง (Anova) ฉันเปลี่ยนเป็น Type 3 Sums of Squares นั่นคือสิ่งที่สาขาของฉันต้องการ): require(car) phase <- factor(rep(c("pretest", "posttest", "followup"), …

1
การคำนวณช่วงความเชื่อมั่นผ่าน bootstrap จากการสังเกต
bootstrap ในรูปแบบมาตรฐานสามารถใช้ในการคำนวณช่วงความเชื่อมั่นของสถิติโดยประมาณหากการสังเกตนั้นเป็น iid I. Visser และคณะ ใน " Confidence Intervals สำหรับพารามิเตอร์ Markov Model ที่ซ่อนอยู่ " ใช้ bootstrap แบบพารามิเตอร์เพื่อคำนวณ CIs สำหรับพารามิเตอร์ HMM อย่างไรก็ตามเมื่อเราใส่ HMM ตามลำดับการสังเกตเราได้สันนิษฐานไว้แล้วว่าการสังเกตนั้นขึ้นอยู่กับ (ในทางตรงกันข้ามกับโมเดลผสม) ฉันมีสองคำถาม: สมมติฐาน iid ทำอะไรกับ bootstrap? เราสามารถเพิกเฉยต่อข้อกำหนดของ id ใน bootstrap แบบพารามิเตอร์ได้หรือไม่? Visser และคณะ วิธีการสั้น ๆ ดังนี้: สมมติเรามีลำดับสังเกตผลมาจากการสุ่มตัวอย่างอืมกับชุดจริง แต่ไม่รู้จักของพารามิเตอร์\Y=o1,o2,...,onY=o1,o2,...,onY=o_1,o_2,...,o_nθ=θ1,θ2,...,θlθ=θ1,θ2,...,θl\theta=\theta_1,\theta_2,...,\theta_l พารามิเตอร์สามารถประมาณได้โดยใช้อัลกอริทึม EM:θ^=θ^1,θ^2,...,θ^lθ^=θ^1,θ^2,...,θ^l\hat{\theta}=\hat{\theta}_1,\hat{\theta}_2,...,\hat{\theta}_l ใช้ HMM โดยประมาณเพื่อสร้างตัวอย่าง bootstrap ขนาด :nnnY∗=o∗1,o∗2,...,o∗nY∗=o1∗,o2∗,...,on∗Y^*=o^*_1,o^*_2,...,o^*_n …

2
การวาดกราฟแท่งหลายอันบนกราฟใน R [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน4 ปีที่แล้ว ฉันต้องการพล็อตกราฟแท่งสี่แท่งบนกราฟเดี่ยวในอาร์ฉันใช้รหัสต่อไปนี้ ในที่นี้จะรักษาตำนานไว้บนกราฟได้อย่างไรโดยเฉพาะตำนานควรอยู่ระหว่าง 2 และ 3 barplots ฉันลองด้วยpar(mar=c(4.1,4.1,8.1,4.1)แต่ก็ไม่ประสบความสำเร็จ ยิ่งไปกว่านั้นฉันยังพยายามวิ่งlegend()ตามบาร์ปล็อตที่สอง แต่ไม่มีประโยชน์ ตำนานสำหรับทั้งสี่ barplots โปรดช่วยฉันในเรื่องนี้ par(mfrow=c(1,4)) barplot(t(A), beside=T, ylim=c(-100,100),..) barplot(t(B), beside=T, ylim=c(-100,100),..) barplot(t(C), beside=T, ylim=c(-100,100),..) barplot(t(D), beside=T, ylim=c(-100,100),..) legend(...)

1
การกำหนดปริมาณในตัวอย่างน้ำหนัก
ฉันมีตัวอย่างถ่วงน้ำหนักซึ่งฉันต้องการคำนวณปริมาณ 1 จะเป็นการดีที่น้ำหนักเท่ากัน (ไม่ว่าจะ = 1 หรืออื่น ๆ ) ผลจะสอดคล้องกับพวกและอาร์เอสscipy.stats.scoreatpercentile()quantile(...,type=7) วิธีการง่ายๆวิธีหนึ่งคือ "คูณออก" ตัวอย่างโดยใช้ตุ้มน้ำหนักที่ให้ ที่ให้ ecdf "แบน" ในพื้นที่ได้อย่างมีประสิทธิภาพในพื้นที่น้ำหนัก> 1 ซึ่งดูเหมือนว่าวิธีการที่ไม่ถูกต้องโดยสัญชาตญาณเมื่อตัวอย่างเป็นตัวอย่างย่อย โดยเฉพาะมันหมายความว่าตัวอย่างที่มีน้ำหนักทั้งหมดเท่ากับ 1 มีควอนไทล์ที่แตกต่างกันมากกว่าหนึ่งที่มีน้ำหนักทั้งหมดเท่ากับ 2 หรือ 3 (หมายเหตุอย่างไรก็ตามกระดาษที่อ้างถึงใน [1] จะใช้วิธีการนี้) http://en.wikipedia.org/wiki/Percentile#Weighted_percentileเป็นสูตรทางเลือกสำหรับเปอร์เซ็นไทล์แบบถ่วงน้ำหนัก มันไม่ชัดเจนในการกำหนดนี้ว่าตัวอย่างที่อยู่ติดกันที่มีค่าเหมือนกันควรนำมารวมกันก่อนและรวมน้ำหนักและในกรณีใด ๆ ผลลัพธ์ของผลลัพธ์จะไม่สอดคล้องกับชนิดเริ่มต้นของ R 7 quantile()ในกรณีที่ไม่มีน้ำหนัก / น้ำหนักเท่ากัน หน้าวิกิพีเดียเกี่ยวกับ quantiles ไม่ได้พูดถึงกรณีน้ำหนักเลย มีฟังก์ชั่นทั่วไปของฟังก์ชั่น quantile "type 7" แบบถ่วงน้ำหนักของ R หรือไม่? [ใช้ Python แต่เพียงมองหาอัลกอริทึมจริงๆดังนั้นภาษาใดก็ตามที่จะทำ] …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.