สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
ความแตกต่างระหว่างการวิเคราะห์เชิงสำรวจและปัจจัยเชิงยืนยันในการพิจารณาความเป็นอิสระในการก่อสร้าง
นักวิจัยมักใช้สองมาตรการที่มีรายการที่คล้ายกันมากและให้เหตุผลว่าพวกเขาวัดสิ่งต่าง ๆ (เช่น "ฉันมักจะกังวลเมื่อฉันอยู่ใกล้รถยนต์"; "ฉันกลัวรถยนต์") ให้เรียกมาตรการที่เป็นสมมุติว่ากลัวการวัดรถยนต์และความวิตกกังวลจากมาตราส่วนของรถยนต์ ฉันสนใจที่จะทดสอบสังเกตุถ้าพวกเขาประเมินโครงสร้างแฝงที่แตกต่างกันหรือถ้าพวกเขาวัดสิ่งเดียวกัน สองวิธีที่ดีที่สุดที่ฉันสามารถคิดได้ว่าทำได้โดยผ่านการวิเคราะห์จากโรงงานเพื่อการสำรวจ (EFA) หรือการวิเคราะห์ปัจจัยยืนยัน (CFA) ฉันคิดว่า EFA จะดีเพราะช่วยให้ทุกรายการโหลดได้อย่างอิสระโดยไม่มีข้อ จำกัด หากรายการจากเครื่องชั่งสองเครื่องโหลดด้วยปัจจัยเดียวกันฉันสามารถสรุปได้ว่ามาตรการที่มีแนวโน้มจะไม่ประเมินสิ่งต่าง ๆ เป็นอย่างดี ฉันยังสามารถเห็นประโยชน์ใน CFA อย่างไรก็ตามเนื่องจากฉันจะทดสอบแบบจำลองที่กำหนดไว้ล่วงหน้า ตัวอย่างเช่นฉันสามารถเปรียบเทียบความพอดีของแบบจำลองที่รายการทั้งหมดโหลดไปยังปัจจัยเดียว (เช่นพวกเขาไม่ได้ประเมินโครงสร้างที่แตกต่างกัน) หรือรายการจะถูกแยกออกเป็นมาตรการที่คาดหวัง ฉันคิดว่าปัญหาเกี่ยวกับ CFA คือมันจะไม่พิจารณารูปแบบทางเลือกอื่น ๆ (เช่นแบบจำลองปัจจัยสามตัว) สำหรับวัตถุประสงค์ของการสนทนาขอให้พิจารณาด้วยว่าอาจมีอีกสองมาตรการที่คล้ายกันออกไป (เช่นแบบสอบถามความวิตกกังวลในรถยนต์และเครื่องชั่งสำหรับการประเมินความกลัวของรถยนต์) ที่ฉันต้องการจะผสม! ฉันจะกำหนดสถิติได้ดีที่สุดว่าสองมาตรการประเมินโครงสร้างที่แตกต่างกันอย่างไร

2
จะลดจำนวนรายการโดยใช้การวิเคราะห์ปัจจัยความสอดคล้องภายในและทฤษฎีการตอบสนองข้อต่อได้อย่างไร?
ฉันกำลังอยู่ระหว่างการพัฒนาแบบสอบถามและฉันจะใช้หมายเลขที่กำหนดเองในตัวอย่างนี้เพื่ออธิบาย สำหรับบริบทฉันกำลังพัฒนาแบบสอบถามทางจิตวิทยาที่มีวัตถุประสงค์เพื่อประเมินรูปแบบความคิดที่ระบุโดยทั่วไปในบุคคลที่มีความวิตกกังวล รายการอาจมีลักษณะ "ฉันต้องตรวจสอบเตาอบซ้ำ ๆ เพราะฉันไม่แน่ใจว่าปิดแล้ว " ฉันมีคำถาม 20 ข้อ (Likert 5 จุด) ซึ่งอาจประกอบด้วยหนึ่งหรือสองปัจจัย (โปรดทราบว่าในความเป็นจริงฉันมีคำถาม 200 คำถามซึ่งประกอบด้วย 10 เกล็ดและแต่ละสเกลอาจประกอบด้วยสองปัจจัย) ฉันยินดีที่จะลบรายการครึ่งหนึ่งทิ้งคำถาม 10 ข้อโดยหนึ่งในสองปัจจัย ฉันคุ้นเคยกับการวิเคราะห์ปัจจัยเชิงสำรวจ (EFA) ความสอดคล้องภายใน (อัลฟาของครอนบาค) และเส้นโค้งลักษณะของรายการในทฤษฎีการตอบสนองข้อ (IRT) ฉันสามารถดูว่าฉันจะใช้วิธีการใดวิธีการหนึ่งต่อไปนี้เพื่อกำหนดว่ารายการใด "แย่ลง" ในระดับใด ๆ ฉันขอขอบคุณที่แต่ละวิธียังตอบคำถามที่แตกต่างกันถึงแม้ว่าพวกเขาอาจนำไปสู่ผลลัพธ์ที่คล้ายกันและฉันไม่แน่ใจว่า "คำถาม" อะไรสำคัญที่สุด ก่อนที่เราจะเริ่มให้แน่ใจว่าฉันรู้ว่าฉันกำลังทำอะไรกับแต่ละวิธีเหล่านี้เป็นรายบุคคล เมื่อใช้ EFA ฉันจะระบุจำนวนปัจจัยและลบรายการที่โหลดน้อยที่สุด (ให้พูด <.30) กับปัจจัยที่เกี่ยวข้องหรือโหลดข้ามอย่างมีนัยสำคัญในหลาย ๆ ปัจจัย โดยใช้ความสอดคล้องภายในฉันจะลบรายการที่มี "อัลฟาถ้ารายการถูกลบ" ที่แย่กว่านั้น ฉันสามารถทำได้โดยสมมติหนึ่งปัจจัยในระดับของฉันหรือทำหลังจาก EFA เริ่มต้นเพื่อระบุจำนวนของปัจจัยและเรียกใช้อัลฟาของฉันสำหรับแต่ละปัจจัย …

4
ฉันสามารถใช้คะแนน Z กับข้อมูลที่เอียงและไม่ปกติได้หรือไม่ [ปิด]
ปิด คำถามนี้ต้องการรายละเอียดหรือความคมชัด ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ เพิ่มรายละเอียดและชี้แจงปัญหาโดยแก้ไขโพสต์นี้ ปิดให้บริการใน5 ปีที่ผ่านมา ฉันทำงานกับข้อมูลรอบเวลากระบวนการบางอย่างและปรับขนาดโดยใช้คะแนน z มาตรฐานเพื่อเปรียบเทียบระหว่างส่วนของรอบเวลาทั้งหมด ฉันควรใช้การแปลงรูปแบบอื่นเนื่องจากข้อมูลมีความเบ้อย่างหนัก / ไม่ปกติใช่หรือไม่ ('ค่าผิดปกติ' ไม่สามารถใช้เวลาติดลบและมักใช้เวลานานกว่า 'ค่าเฉลี่ย' มาก) การใช้คะแนน z ยังคงดูเหมือนว่า "ทำงาน" ... ############### # R code ############### mydata <- rweibull(1000,1,1.5) hist(mydata) hist(scale(mydata))

1
การแก้ไขอคติคืออะไร [ปิด]
ปิด คำถามนี้ต้องการรายละเอียดหรือความคมชัด ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ เพิ่มรายละเอียดและชี้แจงปัญหาโดยแก้ไขโพสต์นี้ ปิดให้บริการใน4 ปีที่แล้ว ฉันได้เห็นหลาย ๆ ที่ที่พวกเขามีชุดข้อมูลอินพุต / เอาต์พุตที่พวกเขาสร้างเส้นถดถอยเชิงเส้นแก้ไขอคติจากนั้นใช้ข้อมูลนั้นสำหรับโมเดลของพวกเขาเท่านั้น ฉันไม่ได้รับการแก้ไขความลำเอียงนี้คืออะไร?

2
การวิเคราะห์จำแนกเชิงเส้นและกฎของเบย์: การจำแนกประเภท
ความสัมพันธ์ระหว่างการวิเคราะห์จำแนกเชิงเส้นและกฎเบย์คืออะไร? ฉันเข้าใจว่า LDA ถูกใช้ในการจัดหมวดหมู่โดยพยายามลดอัตราส่วนความแปรปรวนภายในกลุ่มและระหว่างความแปรปรวนกลุ่ม แต่ฉันไม่ทราบว่ากฎของ Bayes ใช้งานอย่างไร

1
การสร้างกราฟเส้นโค้งความน่าจะเป็นสำหรับโมเดล Logit พร้อมตัวทำนายหลายตัว
ฉันมีฟังก์ชั่นความน่าจะเป็นดังต่อไปนี้: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} ที่ไหน z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. แบบจำลองของฉันดูเหมือน Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} สิ่งนี้ถูกมองเห็นผ่านเส้นโค้งความน่าจะเป็นซึ่งดูเหมือนกับด้านล่าง ฉันกำลังพิจารณาเพิ่มตัวแปรสองตัวในสมการการถดถอยเดิมของฉัน สมมติว่าฉันเพิ่มเพศ (หมวดหมู่: F และ M) และอายุ (หมวดหมู่: <25 และ> 26) ลงในโมเดลฉันท้ายด้วย: Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)+0.25×(gender)+0.15×(age)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)+0.25×(gender)+0.15×(age)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid}) + 0.25\times(\text{gender}) + 0.15\times(\text{age})]\right)} ใน RI …

2
การวิเคราะห์ส่วนที่เหลือถดถอยโลจิสติก
คำถามนี้เป็นคำถามทั่วไปและยาวเหยียด แต่โปรดอดทนกับฉัน ในแอปพลิเคชันของฉันฉันมีชุดข้อมูลจำนวนมากแต่ละชุดประกอบด้วย ~ 20,000 ดาต้าพอยน์พร้อมด้วยคุณลักษณะ ~ 50 และตัวแปรไบนารีที่ขึ้นต่อกันเพียงตัวเดียว ฉันพยายามที่จะสร้างแบบจำลองชุดข้อมูลโดยใช้การถดถอยโลจิสติกปกติ (R package glmnet ) ในการวิเคราะห์ของฉันฉันได้สร้างแปลงที่เหลือดังนี้ สำหรับแต่ละคุณลักษณะฉันเรียงลำดับดาต้าพอยน์ตามค่าของฟีเจอร์นั้นแบ่งดาต้าพอยน์ออกเป็น 100 ถังแล้วคำนวณค่าเอาต์พุตเฉลี่ยและค่าการทำนายโดยเฉลี่ยภายในที่เก็บข้อมูลแต่ละชุด ฉันพล็อตความแตกต่างเหล่านี้ นี่คือตัวอย่างพล็อตที่เหลือ: ในพล็อตข้างต้นสถานที่มีช่วง [0,1] (มีความเข้มข้นมากที่ 1) อย่างที่คุณเห็นเมื่อค่าคุณลักษณะต่ำโมเดลจะมีอคติต่อการประเมินความเป็นไปได้ของ 1-output ตัวอย่างเช่นในที่ฝากข้อมูลด้านซ้ายสุดโมเดลจะประมาณค่าความน่าจะเป็นประมาณ 9% ด้วยข้อมูลนี้ฉันต้องการแก้ไขข้อกำหนดคุณลักษณะในลักษณะที่ตรงไปตรงมาเพื่อแก้ไขความลำเอียงนี้อย่างคร่าวๆ การเปลี่ยนแปลงเช่นการแทนที่ x→x−−√x→xx \rightarrow \sqrt{x} หรือ x→fa(x)={ax if x&lt;a elsex→fa(x)={a if x&lt;a x elsex \rightarrow f_a(x) = \cases{a & if $x<a$ \cr …

1
ฉันจะปรับประสิทธิภาพการคำนวณให้เหมาะสมได้อย่างไรเมื่อติดตั้งแบบจำลองที่ซับซ้อนกับชุดข้อมูลขนาดใหญ่ซ้ำ ๆ
ฉันประสบปัญหาประสิทธิภาพการทำงานโดยใช้MCMCglmmแพ็คเกจใน R เพื่อเรียกใช้โมเดลเอฟเฟกต์แบบผสม รหัสมีลักษณะดังนี้: MC1&lt;-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) มีการสำรวจข้อมูลประมาณ 20,000 ครั้งและมีการรวมกลุ่มกันในโรงเรียนประมาณ 200 แห่ง ฉันลบตัวแปรที่ไม่ได้ใช้ทั้งหมดจากดาต้าเฟรมและลบวัตถุอื่นทั้งหมดออกจากหน่วยความจำก่อนที่จะทำงาน ปัญหาที่ฉันมีคือมันใช้เวลานานมากในการรันยกเว้นว่าฉันจะลดการวนซ้ำให้เหลือน้อยมาก ด้วย 50,000 ซ้ำมันใช้เวลา 5 ชั่วโมงและฉันมีรูปแบบที่แตกต่างกันมากมายในการทำงาน ดังนั้นฉันต้องการทราบว่ามีวิธีเร่งความเร็วในการเรียกใช้รหัสหรือแพ็คเกจอื่น ๆ ที่ฉันสามารถใช้ได้ ฉันใช้MCMCglmmเพราะฉันต้องการช่วงความมั่นใจสำหรับเอฟเฟกต์แบบสุ่ม ในทางกลับกันฉันหวังว่าจะได้รับพีซีเครื่องใหม่ในปีนี้ แต่โชคดีที่ฉันสามารถนำมันไปข้างหน้าได้ดังนั้นฉันจึงสงสัยว่าจะใช้เงินจำนวน จำกัด กับฮาร์ดแวร์ใหม่ได้ดีที่สุด - RAM เพิ่มเติม เร็วกว่าซีพียู ฯลฯ จากการดูตัวจัดการงานฉันไม่เชื่อว่า RAM เป็นปัญหา (ไม่เคยใช้งานเกิน 50% ของการใช้งานจริง) แต่การใช้งาน CPU ไม่ได้สูงกว่า 50% มากซึ่งทำให้ฉันแปลก …

6
หากคุณใช้การประมาณจุดที่เพิ่มให้มากที่สุดนั่นจะพูดถึงปรัชญาของคุณอย่างไร? (เป็นประจำหรือ Bayesian หรืออย่างอื่น?)
ถ้ามีคนพูดว่า "วิธีการนั้นใช้การประเมินจุดMLEสำหรับพารามิเตอร์ที่เพิ่มสูงสุดดังนั้นจึงเป็นสิ่งที่เกิดขึ้นบ่อยครั้งและยิ่งไม่ใช่ Bayesian"P ( x | θ )P(x|θ)\mathrm{P}(x|\theta) คุณจะเห็นด้วยไหม อัปเดตบนพื้นหลัง : เมื่อเร็ว ๆ นี้ฉันอ่านกระดาษที่อ้างว่าใช้บ่อย ฉันไม่เห็นด้วยกับการเรียกร้องของพวกเขาที่ดีที่สุดฉันรู้สึกว่ามันคลุมเครือ กระดาษไม่ได้กล่าวถึง MLE อย่างชัดเจน (หรือMAPสำหรับเรื่องนั้น) พวกเขาใช้การประมาณค่าจุดและพวกเขาก็ดำเนินการราวกับว่าการประเมินจุดนี้เป็นจริง พวกเขาทำไม่ได้ทำการวิเคราะห์การกระจายตัวตัวอย่างของตัวประมาณค่านี้หรืออะไรทำนองนั้น แบบจำลองค่อนข้างซับซ้อนและดังนั้นการวิเคราะห์ดังกล่าวอาจเป็นไปไม่ได้ พวกเขาไม่ใช้คำว่า 'หลัง' ที่จุดใดก็ได้ พวกเขาเพียงแค่ใช้การประเมินจุดนี้ที่มูลค่าหน้าและดำเนินการในหัวข้อหลักที่น่าสนใจ - อนุมานข้อมูลที่ขาดหายไป ฉันไม่คิดว่าจะมีอะไรในแนวทางของพวกเขาที่ชี้ให้เห็นว่าปรัชญาของพวกเขาคืออะไร พวกเขาอาจจะตั้งใจที่จะเป็นประจำ (เพราะพวกเขารู้สึกว่าจำเป็นต้องสวมปรัชญาบนแขนเสื้อของพวกเขา) แต่วิธีการที่แท้จริงของพวกเขาค่อนข้างง่าย / สะดวก / ขี้เกียจ / คลุมเครือ ตอนนี้ฉันอยากบอกว่าการวิจัยไม่มีปรัชญาใด ๆ อยู่เบื้องหลัง แต่ฉันคิดว่าทัศนคติของพวกเขาในทางปฏิบัติหรือสะดวกกว่า: "ฉันสังเกตุข้อมูล, , และฉันต้องการประเมินข้อมูลที่ขาดหายไป, . มีพารามิเตอร์ที่ควบคุมความสัมพันธ์ระหว่างและ . ฉันไม่สนใจยกเว้นเรื่องที่จะจบ ถ้าฉันมีค่าประมาณสำหรับมันจะทำให้ง่ายต่อการทำนายจากฉันจะเลือกการประมาณค่าของเพราะสะดวกโดยเฉพาะฉันจะเลือกที่เพิ่ม …

2
วิธีการจำลองข้อมูลการทำงาน?
ฉันพยายามทดสอบวิธีการวิเคราะห์ข้อมูลการทำงานต่างๆ เป็นการดีที่ฉันต้องการทดสอบแผงวิธีที่ฉันมีกับข้อมูลจำลองการทำงาน ฉันได้พยายามที่จะสร้างจำลอง FD ใช้วิธีการขึ้นอยู่กับข้อสรุปเสียงเกาส์ (รหัสด้านล่าง) แต่เส้นโค้งที่เกิดขึ้นมีลักษณะขรุขระมากเกินไปเมื่อเทียบกับสิ่งที่จริง ฉันสงสัยว่าใครบางคนมีตัวชี้ไปยังฟังก์ชั่น / ความคิดเพื่อสร้างข้อมูลจำลองการทำงานที่ดูสมจริงมากขึ้น โดยเฉพาะอย่างยิ่งสิ่งเหล่านี้ควรราบรื่น ฉันยังใหม่กับสาขานี้อย่างสมบูรณ์ดังนั้นยินดีให้คำแนะนำใด ๆ library("MASS") library("caTools") VCM&lt;-function(cont,theta=0.99){ Sigma&lt;-matrix(rep(0,length(cont)^2),nrow=length(cont)) for(i in 1:nrow(Sigma)){ for (j in 1:ncol(Sigma)) Sigma[i,j]&lt;-theta^(abs(cont[i]-cont[j])) } return(Sigma) } t1&lt;-1:120 CVC&lt;-runmean(cumsum(rnorm(length(t1))),k=10) VMC&lt;-VCM(cont=t1,theta=0.99) sig&lt;-runif(ncol(VMC)) VMC&lt;-diag(sig)%*%VMC%*%diag(sig) DTA&lt;-mvrnorm(100,rep(0,ncol(VMC)),VMC) DTA&lt;-sweep(DTA,2,CVC) DTA&lt;-apply(DTA,2,runmean,k=5) matplot(t(DTA),type="l",col=1,lty=1)

2
วิธีการจัดการกับผลกระทบเพดานเนื่องจากเครื่องมือวัด?
ฉันได้รวบรวมข้อมูลทางจิตวิทยาจิตวิทยาที่วัดความสามารถของกลุ่ม (สองกลุ่ม) ในการรับรู้การสั่นสะเทือน โพรบที่สั่นสะเทือนเคลื่อนตัวเข้าหาผิวหนังในตำแหน่งที่เล็กลงและเล็กลงและวัตถุนั้นบ่งชี้ว่าเมื่อพวกเขารู้สึกถึงการสั่นสะเทือน โชคไม่ดีที่ความถี่สูงโพรบสามารถเคลื่อนที่ในระยะทางสั้น ๆ เท่านั้นและบางครั้งระยะทางที่ใหญ่ที่สุดที่โพรบสามารถเคลื่อนที่ยังคงมีขนาดไม่ใหญ่พอสำหรับวัตถุที่จะรับรู้ ดังนั้นฉันจึงมีค่าเกณฑ์ที่แม่นยำสำหรับบางวิชา แต่สำหรับบางคนที่ไม่เคยรู้สึกถึงการสั่นสะเทือนฉันก็มีค่าที่ฉันรู้ว่าเกณฑ์ของพวกเขานั้นยิ่งใหญ่กว่า มีวิธีใดบ้างที่ฉันจะยังคงรวมข้อมูลนี้ไว้ และวิธีที่ดีที่สุดในการวิเคราะห์คืออะไร?

1
วิธีการสร้างการทำนายด้วย rjags?
ฉันใช้ rjags เพื่อรัน MCMC ในรูปแบบที่ระบุในภาษา JAGS มีวิธีที่ดีในการแยกโมเดลนั้นและทำการทำนายด้วยหรือไม่ (ใช้การแจกแจงหลังของพารามิเตอร์ของฉัน)? ฉันสามารถระบุรุ่นใน R อีกครั้งและเสียบโหมดของพารามิเตอร์โปสเตอร์ของฉัน ฉันแค่สงสัยว่ามีวิธีการทำซ้ำซ้อนน้อยลงหรือไม่ ฉันเชื่อว่าhttp://sourceforge.net/p/mcmc-jags/discussion/610037/thread/0ecab41cกำลังถามคำถามเดียวกัน
12 r  jags 

2
กำหนดการกระจายความน่าจะเป็นโดยอัตโนมัติเมื่อได้รับชุดข้อมูล
รับชุดข้อมูล: x &lt;- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. ฉันต้องการตรวจสอบการแจกแจงความน่าจะเป็นที่เหมาะสมที่สุด (แกมม่า, เบตา, ปกติ, เลขชี้กำลัง, ปัวซอง, ไค - สแควร์, ฯลฯ ) ด้วยการประมาณค่าพารามิเตอร์ ฉันได้รับทราบถึงคำถามในลิงก์ต่อไปนี้ซึ่งมีวิธีแก้ไขปัญหาโดยใช้ R: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- Continuous-univariate-distribution-f ทางออกที่ดีที่สุดที่เสนอคือ: &gt; library(MASS) &gt; fitdistr(x, 't')$loglik #$ &gt; fitdistr(x, 'normal')$loglik #$ &gt; fitdistr(x, 'logistic')$loglik #$ &gt; fitdistr(x, 'weibull')$loglik #$ &gt; fitdistr(x, 'gamma')$loglik #$ &gt; fitdistr(x, 'lognormal')$loglik #$ &gt; fitdistr(x, …

3
ตรวจสอบว่ากระบวนการกระจายแบบเทลด์หนักได้รับการปรับปรุงอย่างมีนัยสำคัญหรือไม่
ฉันสังเกตเวลาประมวลผลของกระบวนการก่อนและหลังการเปลี่ยนแปลงเพื่อค้นหาหากกระบวนการได้รับการปรับปรุงโดยการเปลี่ยนแปลง กระบวนการได้รับการปรับปรุงหากเวลาในการประมวลผลลดลง การกระจายเวลาของการประมวลผลเป็นแบบเทลด์ไขมันดังนั้นการเปรียบเทียบตามค่าเฉลี่ยจึงไม่สมเหตุสมผล แต่ฉันอยากทราบว่าความน่าจะเป็นในการสังเกตเวลาประมวลผลที่ลดลงหลังจากการเปลี่ยนแปลงนั้นสูงกว่า 50% หรือไม่ ให้เป็นตัวแปรสุ่มสำหรับเวลาการประมวลผลหลังจากการเปลี่ยนแปลงและYเป็นหนึ่งก่อน ถ้าP ( X &lt; Y )สูงกว่า0.5อย่างมีนัยสำคัญฉันจะบอกว่ากระบวนการได้รับการปรับปรุงXXXYYYP( X&lt; Y)P(X&lt;Y)P(X < Y)0.50.50.5 ตอนนี้ฉันมีสังเกตx ฉันของXและเมตรสังเกตY ญของY สังเกตน่าจะเป็นของP ( X &lt; Y )คือP = 1nnnxผมxix_iXXXม.mmYJyjy_jYYYP( X&lt; Y)P(X&lt;Y)P(X < Y)Jพี^= 1ไม่มΣผมΣJ1xผม&lt; yJp^=1nm∑i∑j1xi&lt;yj\hat p = \frac{1}{n m} \sum_i \sum_j 1_{x_i < y_j} ฉันจะพูดอะไรเกี่ยวกับได้จากการสังเกตการณ์x iและy j ?P( X&lt; Y)P(X&lt;Y)P(X < …

1
มีการเชื่อมต่อระหว่างเบย์เชิงประจักษ์กับเอฟเฟกต์แบบสุ่มหรือไม่?
เมื่อไม่นานมานี้ฉันได้อ่านเกี่ยวกับการทดลอง Bayes (Casella, 1985, การแนะนำการวิเคราะห์ข้อมูลเชิงประจักษ์ Bayes) และมันดูคล้ายกับแบบจำลองเอฟเฟกต์แบบสุ่ม; ในที่ทั้งสองมีการประมาณการหดตัวถึงค่าเฉลี่ยทั่วโลก แต่ฉันยังไม่ได้อ่านอย่างละเอียด ... ใครบ้างมีความเข้าใจอย่างถ่องแท้เกี่ยวกับความเหมือนและความแตกต่างระหว่างพวกเขาบ้างไหม?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.