สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การทดสอบ anova type III สำหรับ GLMM
ฉันเหมาะสมกับglmerโมเดลในlme4แพ็กเกจ R ฉันกำลังมองหาตารางโนวาที่มีค่า p แสดงอยู่ในนั้น แต่ฉันไม่สามารถหาแพ็คเกจที่เหมาะกับมันได้ เป็นไปได้ไหมที่จะทำใน R? แบบจำลองที่ฉันเหมาะสมอยู่ในรูปแบบ: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

1
glmnet จัดการกับการกระจายเกินขนาดได้อย่างไร
ฉันมีคำถามเกี่ยวกับวิธีจำลองข้อความเหนือข้อมูลการนับโดยเฉพาะฉันจะใช้lassoเทคนิคเพื่อลดคุณลักษณะได้อย่างไร สมมติว่าฉันมีบทความออนไลน์ N รายการและจำนวนการเปิดดูหน้าเว็บสำหรับแต่ละบทความ ฉันได้สกัด 1 กรัมและ 2 กรัมสำหรับแต่ละบทความแล้วและฉันต้องการเรียกใช้การถดถอยมากกว่า 1,2- กรัม เนื่องจากฟีเจอร์ (1,2-grams) นั้นมากกว่าวิธีการสังเกตจำนวนมาก Lasso จึงเป็นวิธีที่ดีในการลดจำนวนฟีเจอร์ นอกจากนี้ฉันพบว่าglmnetมันมีประโยชน์จริงๆในการรันการวิเคราะห์บ่วงบาศ อย่างไรก็ตามจำนวนการเปิดดูหน้าเว็บนั้นมีจำนวนมากเกินไป (แปรปรวน> หมายถึง) แต่glmnetไม่มีการเสนอquasipoisson(อย่างชัดเจน) หรือnegative binomialแต่poissonสำหรับการนับข้อมูล วิธีการแก้ปัญหาที่ฉันคิดคือlog transformการนับข้อมูล (วิธีที่ใช้กันทั่วไปในหมู่นักสังคมศาสตร์) และทำให้ตัวแปรตอบสนองคร่าว ๆ ตามการแจกแจงปกติ glmnetเป็นเช่นนี้ผมอาจจะรูปแบบข้อมูลกับครอบครัวของเกาส์โดยใช้ ดังนั้นคำถามของฉันคือ: เหมาะสมหรือไม่ หรือฉันจะใช้ปัวซองglmnetในกรณีglmnetด้ามจับquasipoisson? หรือมีแพ็คเกจ R อื่น ๆ จัดการกับสถานการณ์นี้หรือไม่? ขอบคุณมาก!

4
ช่วยแปลพล็อตปฏิสัมพันธ์หรือไม่
ฉันมีปัญหาในการตีความแผนการโต้ตอบเมื่อมีการโต้ตอบระหว่างตัวแปรอิสระสองตัว กราฟต่อไปนี้มาจากไซต์นี้ : ที่นี่และเป็นตัวแปรอิสระและเป็นตัวแปรตามAAABBBD VDVDV คำถาม: มีปฏิสัมพันธ์และผลกระทบหลักของแต่ไม่มีผลกระทบหลักของAAABBB ฉันสามารถดูว่าสูงกว่าค่าของมูลค่าของสูงให้ B เป็นที่มิฉะนั้นเป็นค่าคงที่โดยไม่คำนึงถึงความคุ้มค่าของ ดังนั้นจึงมีการทำงานร่วมกันระหว่างและและผลกระทบหลักของ (เนื่องจากสูงกว่านำไปสู่สูงขึ้นโดยที่ค่าคงที่ )AAAD VDVDVB1B1B_1DVDVDVAAAAAABBBAAAAAADVDVDVBBBB1B1B_1 นอกจากนี้ผมจะเห็นว่าระดับที่แตกต่างของจะนำไปสู่ระดับที่แตกต่างกันของถือค่าคงที่ ดังนั้นจึงมีผลกระทบหลักของ B. แต่นี่ไม่ใช่กรณี ดังนั้นนี่ต้องหมายความว่าฉันตีความพล็อตปฏิสัมพันธ์อย่างไม่ถูกต้อง ผมทำอะไรผิดหรือเปล่า?BBBDVDVDVAAA ฉันแปลพล็อต 6-8 ผิดด้วย ตรรกะที่ฉันใช้ในการตีความพวกเขาเป็นแบบเดียวกับที่ฉันใช้ข้างต้นดังนั้นถ้าฉันรู้ข้อผิดพลาดที่ฉันทำด้านบนฉันควรจะสามารถตีความส่วนที่เหลือได้อย่างถูกต้อง มิฉะนั้นฉันจะอัปเดตคำถามนี้

1
พลังงานในโปรตีน?
แกรนต์มักต้องการการวิเคราะห์พลังงานเพื่อสนับสนุนขนาดตัวอย่างที่เสนอ ในโปรตีโอมิกส์ (และส่วนใหญ่ -omics) มีคุณลักษณะ / ตัวแปร 100 ถึง 1,000 รายการที่วัดจาก 10 ตัวอย่าง (อาจเป็น 100 แต่ไม่น่าเป็นไปได้) นอกจากนี้เป็นที่ทราบกันว่าหน่วยการวัดเหล่านี้บางส่วน (เช่นจำนวนสเปกตรัมของโปรตีน) ไม่ได้มีการแจกจ่ายตามปกติดังนั้นเราจะใช้การทดสอบแบบไม่มีพารามิเตอร์เพื่อการวิเคราะห์ ฉันเห็นพลังของขนาดตัวอย่างที่กำหนดไว้โดยใช้การวัดเดี่ยวและสมมติว่าเป็นการทดสอบ t แต่ฉันไม่คิดว่าสิ่งนี้จะถูกต้องทั้งหมด ปัญหาอีกประการหนึ่งเกี่ยวกับการนับสเปคตรัมโดยเฉพาะคือแต่ละคุณสมบัติ 100 อยู่ในระดับที่แตกต่างกันมากที่มีข้อผิดพลาดแตกต่างกันอย่างมาก (ค่าที่มากขึ้นมีข้อผิดพลาดน้อยกว่า) [ปัญหานี้ได้รับการอธิบายไว้เป็นอย่างดีในโมเดลการเปลี่ยนแปลงการ จำกัด การพับMutch และคณะ, 2002 ] อะไรจะเป็นวิธีที่เหมาะสมในการกำหนดพลังของขนาดตัวอย่างที่เสนอเนื่องจากสมมติฐานบางอย่างของ FDR และการเปลี่ยนแปลงแบบพับได้ที่ยอมรับได้ การใช้เครื่องมือที่นี่ฉันสามารถระบุได้ดังนี้: 300 ยีน 3 บวกเท็จ 1.4 ความแตกต่างของการพับ 0.8 กำลังที่ต้องการ 0.7 stdev ต้องการขนาดตัวอย่างต่อกลุ่ม 49 สิ่งนี้มีประโยชน์ตั้งแต่ฉันเสนอการออกแบบ 50v50 …

5
การถดถอยโลจิสติกในข้อมูลขนาดใหญ่
ฉันมีชุดข้อมูลประมาณ 5,000 ฟีเจอร์ สำหรับข้อมูลนั้นฉันใช้การทดสอบ Chi Square เป็นครั้งแรกเพื่อเลือกคุณสมบัติ หลังจากนั้นฉันได้ประมาณ 1,500 ตัวแปรซึ่งแสดงความสัมพันธ์อย่างมีนัยสำคัญกับตัวแปรตอบกลับ ตอนนี้ฉันต้องพอดีกับการถดถอยโลจิสติกในที่ ฉันใช้แพ็คเกจ glmulti สำหรับ R (แพ็คเกจ glmulti ให้การเลือกเซตย่อยที่มีประสิทธิภาพสำหรับ vlm) แต่สามารถใช้คุณสมบัติได้ครั้งละ 30 คุณสมบัติเท่านั้นประสิทธิภาพในการทำงานลดลงเนื่องจากจำนวนแถวในชุดข้อมูลของฉันอยู่ที่ประมาณ 20,000 มีวิธีการหรือเทคนิคอื่น ๆ ในการแก้ปัญหาข้างต้นหรือไม่? ถ้าฉันไปตามวิธีข้างต้นมันจะใช้เวลามากเกินไปในการปรับให้เข้ากับโมเดล

1
โมเดลการถดถอยเชิงเส้นที่เหมาะสมที่สุดสำหรับข้อมูลที่มีข้อผิดพลาด
ฉันกำลังมองหาอัลกอริทึมการถดถอยเชิงเส้นที่เหมาะสมที่สุดสำหรับข้อมูลที่ตัวแปรอิสระ (x) มีข้อผิดพลาดการวัดค่าคงที่และตัวแปรตาม (y) มีข้อผิดพลาดขึ้นอยู่กับสัญญาณ ภาพด้านบนแสดงคำถามของฉัน

1
การกระจายรุ่นใดที่จะใช้ในการอ่านหน้าเว็บโมเดล?
ฉันมีฟังก์ชั่นที่คืนค่าเวลารอโดยเฉลี่ยสำหรับผู้ใช้เว็บ กล่าวคือมันให้เวลาเฉลี่ยที่ผู้ใช้โดยเฉลี่ยอาจอยู่ในหน้าเว็บโดยให้ความยาวของทรัพยากรเว็บเป็นคำ ฉันต้องการใช้ฟังก์ชั่นนี้ (และค่าเฉลี่ยที่เกิดขึ้น) ร่วมกับการแจกจ่ายเพื่อวางโมเดล 'ผู้ใช้เว็บเฉลี่ย' เรียกดูเว็บ การกระจายแบบใดที่เหมาะสมสำหรับเรื่องนี้และเพราะอะไร แก้ไข: ฉันต้องการทราบความสามารถในการใช้การแจกแจงเอ็กซ์โปเนนเชียลเพื่อวัตถุประสงค์นี้โดยเฉพาะ ขอบคุณ

3
ความเข้าใจผิดเกี่ยวกับการประมาณการ Monte Carlo Pi
ฉันค่อนข้างแน่ใจว่าฉันเข้าใจการทำงานร่วมกันของ Monte Carlo แต่ฉันไม่เข้าใจการกำหนดวิธีการใช้ Pi เพื่อประเมิน ฉันกำลังทำตามขั้นตอนที่ระบุไว้ในสไลด์ที่ 5 ของงานนำเสนอนี้http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf ฉันเข้าใจขั้นตอนเบื้องต้น Pi เท่ากับ 4 คูณพื้นที่ของหนึ่งในสี่ของวงกลมหน่วย และพื้นที่ของไตรมาสบนขวาของหน่วยวงกลมตรงกลางที่ (0,0) เท่ากับอินทิกรัลของส่วนโค้งที่เป็นไตรมาสบนขวาของวงกลมหน่วยในและ . 0&lt;x&lt;10&lt;x&lt;10<x<10&lt;y&lt;10&lt;y&lt;10<y<1 สิ่งที่ฉันไม่เข้าใจก็คืออินทิกรัลนี้คืออะไร ∬I((x2+y2)&lt;1)P(x,y)dxdy∬I((x2+y2)&lt;1)P(x,y)dxdy\iint I((x^2+y^2)<1)P(x,y)dxdy โดยที่P(x,y)P(x,y)P(x,y)มีการกระจายอย่างสม่ำเสมอในหน่วยสี่เหลี่ยมจัตุรัสรอบวงกลมไตรมาส (นั่นคือเท่ากับ 1 เสมอถ้า0&lt;x&lt;10&lt;x&lt;10<x<1และ0&lt;y&lt;10&lt;y&lt;10<y<1และ 0 เป็นอย่างอื่น) นี่ก็หมายความว่า I((x2+y2)&lt;1)P(x,y)I((x2+y2)&lt;1)P(x,y)I((x^2+y^2)<1)P(x,y) คือฟังก์ชั่นที่เป็นจตุภาคบนขวาของวงกลมหน่วยที่0&lt;x&lt;10&lt;x&lt;10<x<1และ0&lt;y&lt;10&lt;y&lt;10<y<1แต่ฉันไม่เข้าใจว่าสิ่งนี้เป็นจริงได้อย่างไรเนื่องจากฟังก์ชันตัวบ่งชี้สามารถเป็น 1 หรือ 0 เท่านั้นฉันเข้าใจว่ามันอาจจะเขียนด้วยวิธีนี้เพื่อให้การสุ่มตัวอย่าง Monte Carlo ง่าย (นั่นคือความคาดหวังดังนั้นเพียงแค่ตัวอย่างจากP(x,y)P(x,y)P(x,y)และรับค่าเฉลี่ยของตัวอย่างที่ใช้กับI((x2+y2)&lt;1)I((x2+y2)&lt;1)I((x^2+y^2)<1)) แต่มันไม่สมเหตุสมผลเลยสำหรับฉันว่าทำไมอินทิกรัลนั้นแทนพื้นที่ใต้เส้นโค้งนั้น ใครบางคนสามารถให้คำอธิบายที่เข้าใจง่ายเกี่ยวกับเรื่องนี้ อาจแสดงให้เห็นว่าอินทิกรัลนั้นได้มาในแบบทีละขั้นตอนหรือไม่? แก้ไข: ฉันสามารถรับความเข้าใจที่ดีขึ้นโดยเชื่อมโยงความคาดหวังกับพื้นที่ ฉันจะอธิบายที่นี่ในกรณีที่มันช่วยทุกคน เริ่มแรกด้วยการเกี่ยวข้องกับ Pi ไปยังพื้นที่ของควอดเร้นท์ด้านขวาของวงกลมหน่วย π=4×Atrπ=4×Atr\pi=4\times A_{tr} …

3
วิธีรวมและเข้ากับการถดถอยและจะรวมศูนย์ไว้ที่ใด
ฉันต้องการรวมคำว่าxxxและ square x2x2x^2 (ตัวแปรทำนาย) ลงในการถดถอยเพราะฉันคิดว่าค่าต่ำของxxxมีผลในเชิงบวกต่อตัวแปรตามและค่าสูงมีผลกระทบเชิงลบ x2x2x^2ควรจับผลกระทบของค่าที่สูงขึ้น ฉันจึงคาดหวังว่าสัมประสิทธิ์ของxxxจะเป็นค่าบวกและค่าสัมประสิทธิ์ของx2x2x^2จะเป็นค่าลบ นอกจากxxxผมยังรวมถึงตัวแปรอื่น ๆ ฉันอ่านในบางกระทู้ที่นี่เป็นความคิดที่ดีที่จะจัดวางตัวแปรในกรณีนี้เพื่อหลีกเลี่ยง เมื่อทำการถดถอยหลายครั้งคุณควรจัดตำแหน่งตัวแปรตัวทำนายของคุณไว้ที่ใดและเมื่อใดที่คุณควรทำให้เป็นมาตรฐาน ฉันควรจะอยู่ตรงกลางทั้งสองตัวแปรแยก (ที่ค่าเฉลี่ย) หรือควรจะฉันเพียงศูนย์และจากนั้นใช้ตารางหรือฉันควรเพียงศูนย์และรวมถึงต้นฉบับ ?xxxx2x2x^2xxx มันเป็นปัญหาหรือไม่ถ้าเป็นจำนวนตัวแปร?xxx เพื่อหลีกเลี่ยงเป็นตัวแปรนับฉันคิดถึงการหารมันด้วยพื้นที่ที่กำหนดตามหลักวิชาเช่น 5 ตารางกิโลเมตร นี่ควรจะคล้ายกับการคำนวณความหนาแน่นของจุดxxx อย่างไรก็ตามฉันกลัวว่าในสถานการณ์นี้การสันนิษฐานเบื้องต้นของฉันเกี่ยวกับเครื่องหมายของสัมประสิทธิ์จะไม่ถืออีกต่อไปเช่นเมื่อและx² = 4x = 2x=2x=2x ² = 4x²=4x²=4 x = 2 / 5 กม.2x=2/5 km2x= 2 / 5 \text{ km}^2 = 0.4 กม.20.4 km20.4 \text{ km}^2 แต่x2x2x^2จากนั้นก็จะมีขนาดเล็กเพราะ x2= ( 2 …

2
เหตุใดส่วนที่เหลือของ Pearson จากการถดถอยแบบทวินามเชิงลบจึงมีขนาดเล็กกว่าการถดถอยแบบปัวซอง
ฉันมีข้อมูลเหล่านี้: set.seed(1) predictor &lt;- rnorm(20) set.seed(1) counts &lt;- c(sample(1:1000, 20)) df &lt;- data.frame(counts, predictor) ฉันใช้การถดถอยปัวซอง poisson_counts &lt;- glm(counts ~ predictor, data = df, family = "poisson") และการถดถอยแบบทวินามลบ require(MASS) nb_counts &lt;- glm.nb(counts ~ predictor, data = df) จากนั้นฉันคำนวณหาสถิติการกระจายตัวสำหรับการถดถอยปัวซอง: sum(residuals(poisson_counts, type="pearson")^2)/df.residual(poisson_counts) # [1] 145.4905 และการถดถอยแบบทวินามลบ sum(residuals(nb_counts, type="pearson")^2)/df.residual(nb_counts) # [1] 0.7650289 มีใครที่สามารถอธิบายได้โดยไม่ต้องใช้เครื่องมือทำไมสถิติการกระจายตัวของการถดถอยแบบทวินามลบน้อยกว่าสถิติการกระจายตัวสำหรับการถดถอยปัวซอง

2
การประมาณค่าพารามิเตอร์ด้วยโมเดลเชิงเส้นทั่วไป
โดยค่าเริ่มต้นเมื่อเราใช้glmฟังก์ชั่นใน R มันจะใช้วิธีการวนซ้ำน้อยที่สุดอย่างน้อยสี่เหลี่ยม (IWLS) เพื่อหาโอกาสในการประมาณค่าพารามิเตอร์สูงสุด ตอนนี้ฉันมีสองคำถาม การประมาณค่าของ IWLS รับประกันว่าจะมีฟังก์ชั่นโอกาสสูงสุดในระดับโลก ฉันคิดว่ามันไม่ได้ขึ้นอยู่กับสไลด์สุดท้ายในงานนำเสนอนี้ ! ฉันแค่ต้องการทำให้แน่ใจว่า เราสามารถพูดได้ว่าเหตุผลของคำถามที่ 1 ข้างต้นนั้นเป็นเพราะความจริงที่ว่าวิธีการหาค่าเหมาะที่สุดเชิงตัวเลขเกือบทั้งหมดอาจติดอยู่ที่ค่าสูงสุดในท้องถิ่นมากกว่าค่าสูงสุดทั่วโลก

3
ICA จำเป็นต้องใช้ PCA ก่อนหรือไม่
ฉันตรวจสอบเอกสารที่ใช้แอปพลิเคชันโดยบอกว่าใช้ PCA ก่อนที่จะใช้ ICA (ใช้แพ็คเกจ FastICA) คำถามของฉันคือ ICA (fastICA) ต้องการให้ PCA ทำงานก่อนหรือไม่ บทความนี้กล่าวถึง ... มันยังเป็นที่ถกเถียงกันอยู่ว่าการใช้ PCA ล่วงหน้าจะช่วยเพิ่มประสิทธิภาพการทำงานของ ICA โดย (1) การละทิ้งค่าลักษณะเฉพาะขนาดเล็กก่อนที่จะฟอกสีฟันและ (2) ลดความซับซ้อนในการคำนวณโดยลดการพึ่งพาคู่ PCA decorrelates ข้อมูลอินพุต; การพึ่งพาการสั่งซื้อที่สูงขึ้นที่เหลืออยู่จะถูกคั่นด้วย ICA นอกจากนี้ยังมีเอกสารอื่น ๆ จะใช้ PCA ก่อน ICA เช่นนี้ มีข้อดีและข้อเสียอื่น ๆ ในการใช้งาน PCA ก่อน ICA หรือไม่ โปรดระบุทฤษฎีพร้อมด้วยการอ้างอิง

2
EM ปัญหาการปฏิบัติอัลกอริทึม
นี่เป็นปัญหาการปฏิบัติสำหรับการสอบกลางภาค ปัญหาคือตัวอย่างอัลกอริทึม EM ฉันกำลังมีปัญหากับส่วน (f) ฉันแสดงรายการชิ้นส่วน (a) - (e) เพื่อความสมบูรณ์และในกรณีที่ฉันทำผิดพลาดก่อนหน้านี้ ให้เป็นอิสระตัวแปรสุ่มชี้แจงที่มีอัตราการ\น่าเสียดายที่ไม่มีการตรวจสอบค่าแท้จริงและเราจะสังเกตว่าค่าอยู่ในช่วงเวลาที่กำหนดหรือไม่ ให้ ,และ สำหรับ n ข้อมูลที่สังเกตประกอบด้วย{3j})X1,…,XnX1,…,XnX_1,\ldots,X_nθθ\thetaXXXXXXG1j=1{Xj&lt;1}G1j=1{Xj&lt;1}G_{1j} = \mathbb{1}\left\{X_j < 1\right\}G2j=1{1&lt;Xj&lt;2}G2j=1{1&lt;Xj&lt;2}G_{2j} = \mathbb{1}\left\{1< X_j<2\right\}G3j=1{Xj&gt;2}G3j=1{Xj&gt;2}G_{3j} = \mathbb{1}\left\{X_j > 2\right\}j=1,…,nj=1,…,nj=1,\ldots,n(G1j,G2j,G3j)(G1j,G2j,G3j)(G_{1j},G_{2j},G_{3j}) (a) ให้โอกาสในการสังเกตข้อมูล: L(θ|G)=∏j=1nPr{Xj&lt;1}G1jPr{1&lt;Xj&lt;2}G2jPr{Xj&gt;2}G3j=∏j=1n(1−e−θ)G1j(e−θ−e−2θ)G2j(e−2θ)G3jL(θ|G)=∏j=1nPr{Xj&lt;1}G1jPr{1&lt;Xj&lt;2}G2jPr{Xj&gt;2}G3j=∏j=1n(1−e−θ)G1j(e−θ−e−2θ)G2j(e−2θ)G3j\begin{align*} L(\theta | G) &= \prod_{j=1}^n \text{Pr}\left\{X_j < 1\right\}^{G_{1j}}\text{Pr}\left\{12\right\}^{G_{3j}}\\ &= \prod_{j=1}^n \left(1-e^{-\theta}\right)^{G_{1j}}\left(e^{-\theta}-e^{-2\theta}\right)^{G_{2j}}\left(e^{-2\theta}\right)^{G_{3j}} \end{align*} (b) ให้โอกาสในการเก็บข้อมูลอย่างสมบูรณ์ L(θ|X,G)=∏j=1n(θe−θxj)G1j(θe−θxj)G2j(θe−θxj)G3jL(θ|X,G)=∏j=1n(θe−θxj)G1j(θe−θxj)G2j(θe−θxj)G3j\begin{align*} L(\theta | X,G) &= \prod_{j=1}^n …

4
เทคนิคที่ไม่ใช่มุมฉากคล้ายกับ PCA
สมมติว่าฉันมีชุดข้อมูลจุด 2D และฉันต้องการตรวจสอบทิศทางของความแปรปรวนสูงสุดในท้องถิ่นของข้อมูลตัวอย่างเช่น: PCA ไม่ได้ช่วยในสถานการณ์นี้เนื่องจากเป็นการสลายตัวแบบมุมฉากดังนั้นจึงไม่สามารถตรวจจับทั้งสองเส้นที่ฉันระบุเป็นสีน้ำเงินได้ แต่เอาต์พุตอาจมีลักษณะเหมือนเส้นที่แสดงโดยเส้นสีเขียว กรุณาแนะนำเทคนิคใด ๆ ที่อาจเหมาะสำหรับวัตถุประสงค์นี้ ขอบคุณ

2
การวิเคราะห์การอยู่รอดที่ไม่สามารถใช้ข้อมูลแปรปรวนร่วมกับ covariates ได้
ฉันกำลังดูเวลาที่ผู้พิพากษาต้องการในการตัดสินใจ ผู้ตัดสินแต่ละคนประเมินจำนวนผู้สมัครและสามารถอนุมัติหรือไม่อนุมัติใบสมัคร คดีนี้จะสิ้นสุดลงเมื่อผู้พิพากษาแสดงรายงานซึ่งอาจมีบางเวลาหลังจากการพิจารณาคดี หลายกรณียังคงเปิดให้บริการเมื่อสิ้นสุดระยะเวลาการศึกษา ฉันต้องการที่จะประเมินเวลาเฉลี่ยที่จำเป็นสำหรับกรณีที่จะย้ายผ่านระบบ นอกจากนี้ฉันต้องการดูว่ากรณีที่ถูกปฏิเสธใช้เวลานานกว่ากรณีที่ได้รับการอนุมัติ (ผู้พิพากษาดูเหมือนจะใช้เวลานานในการเขียนรายงานของพวกเขาในที่สุดพวกเขาล้มเหลวในการอนุมัติหรือค้นหาเอกสารเพิ่มเติม) เห็นได้ชัดว่าฉันไม่ทราบว่ากรณีที่ยังคงเปิดเมื่อการศึกษาสิ้นสุดลงจะได้รับการอนุมัติหรือไม่ดังนั้น covariate (อนุมัติ / ไม่อนุมัติ) จะถูกตรวจสอบพร้อมกับข้อมูล มีอะไรที่ฉันสามารถทำได้เกี่ยวกับเรื่องนี้?
9 survival 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.