สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
LaTeX เอาท์พุตสำหรับวัตถุ summary.lm ของ R - ในขณะที่แสดงข้อมูลนอกตาราง [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน3 ปีที่ผ่านมา ดูเหมือนว่าฉันจะเป็นแบบพื้นฐาน แต่ฉันไม่สามารถหาวิธีแก้ปัญหาออนไลน์ได้ดังนั้นฉันจึงสงสัยว่าจะพลาดอะไรบ้าง ฉันต้องการรวมเอาท์พุทของวัตถุสรุป lm ภายในเอกสาร Sweave (.Rnw) ฉันสามารถส่งออกสรุป. lm ตามที่เป็นอยู่หรือใช้แพ็คเกจ xtable / Hmisc (ผ่านคำสั่ง xtable หรือลาเท็กซ์) มีบางอย่างเช่น xtable ที่ให้ข้อมูลสรุปที่มีให้จากนอกตารางหรือไม่ ( , F สถิติ ฯลฯ ... ?)R2R2R^2
10 r  regression 

3
จำนวนที่คาดหวังของบัตรที่มองไม่เห็นเมื่อวาด
เรามีไพ่ใบ เราสุ่มไพ่จากมันโดยการสุ่มพร้อมกับการแทนที่ หลังจากวาดจำนวนบัตรที่คาดหวังไม่เคยเลือกคืออะไร?nnn2 n2n2n คำถามนี้เป็นส่วนที่ 2 ของปัญหา 2.12 ใน M. Mitzenmacher และ E. Upfal, ความน่าจะเป็นและการคำนวณ: อัลกอริธึมแบบสุ่มและการวิเคราะห์ความน่าจะเป็น , สำนักพิมพ์มหาวิทยาลัยเคมบริดจ์, 2005 นอกจากนี้สำหรับสิ่งที่คุ้มค่านี่ไม่ใช่ปัญหาการบ้าน เป็นการศึกษาด้วยตนเองและฉันก็ติดอยู่ คำตอบของฉันคือ: ให้เป็นจำนวนบัตรที่แตกต่างกันเห็นได้หลังจากที่ TH วาด แล้ว:XผมXผมX_iผมผมi E[ Xผม] = ∑k = 1nk ( knP(Xi−1=k)+n−k−1nP(Xi−1=k−1))E[Xi]=∑k=1nk(knP(Xi−1=k)+n−k−1nP(Xi−1=k−1))E[X_i] = \displaystyle \sum_{k=1}^{n} k (\frac{k}{n}P(X_{i-1}=k) + \frac{n-k-1}{n} P(X_{i-1}=k-1)) แนวคิดที่นี่คือทุกครั้งที่เราวาดเราจะวาดไพ่ที่เราเคยเห็นหรือเราวาดไพ่ที่เราไม่ได้เห็นและเราสามารถกำหนดแบบวนซ้ำได้ สุดท้ายคำตอบให้กับคำถามที่ว่ามีหลายคนที่เราไม่ได้เห็นหลังจากดึงจะ{2n}]2n2n2nn−E[X2n]n−E[X2n]n-E[X_{2n}] ฉันเชื่อว่าสิ่งนี้ถูกต้อง แต่ต้องมีวิธีแก้ไขที่ง่ายกว่า ความช่วยเหลือใด ๆ ที่จะได้รับการชื่นชมอย่างมาก.

1
เมื่อใดที่จะเปลี่ยนตัวแปรตัวทำนายเมื่อทำการถดถอยหลายครั้ง?
ขณะนี้ฉันกำลังเรียนการถดถอยเชิงเส้นเป็นครั้งแรกในระดับบัณฑิตศึกษาและกำลังดิ้นรนกับการเปลี่ยนแปลงตัวแปรตัวทำนายในการถดถอยเชิงเส้นหลายครั้ง ข้อความที่ฉันใช้ Kutner et al "โมเดลเชิงสถิติเชิงเส้นประยุกต์" ดูเหมือนจะไม่ครอบคลุมคำถามที่ฉันมี (นอกเหนือจากการแนะนำว่ามีวิธี Box-Cox สำหรับเปลี่ยนการทำนายหลายตัว) เมื่อต้องเผชิญกับตัวแปรตอบสนองและตัวแปรทำนายหลายตัวเงื่อนไขใดบ้างที่มุ่งมั่นที่จะพบกับตัวแปรตัวทำนายแต่ละตัว ฉันเข้าใจว่าท้ายที่สุดเรากำลังมองหาความแปรปรวนของความคลาดเคลื่อนและการแจกแจงข้อผิดพลาดตามปกติ (อย่างน้อยที่สุดในเทคนิคที่ฉันได้รับการสอนมา) ฉันเคยมีแบบฝึกหัดมากมายกลับมาซึ่งวิธีแก้ปัญหาเป็นตัวอย่างy ~ x1 + (1/x2) + log(x3)ที่ ตัวทำนายหนึ่งตัวหรือมากกว่าถูกเปลี่ยน ฉันเข้าใจเหตุผลภายใต้การถดถอยเชิงเส้นอย่างง่ายเนื่องจากมันง่ายที่จะดู y ~ x1 และการวินิจฉัยที่เกี่ยวข้อง (พล็อตของคิวคิวของส่วนที่เหลือ, ส่วนที่เหลือเทียบกับ y, ส่วนที่เหลือเทียบกับ x, ฯลฯ ) และทดสอบเพื่อดูว่า y ~ log ( x1) เหมาะสมกับสมมติฐานของเราดีกว่า มีสถานที่ที่ดีที่จะเริ่มทำความเข้าใจเมื่อมีการเปลี่ยนแปลงตัวทำนายในที่ที่มีผู้ทำนายหลายคนหรือไม่? ขอบคุณล่วงหน้า. ด้าน

1
การแจกแจงความแตกต่างของตัวแปรอิสระสองตัวซึ่งถูกตัดที่ 0
ปล่อยให้และเป็นตัวแปรสุ่มอิสระสองตัวที่มีการกระจายตัวแบบเดียวกันมีความหนาแน่นXXXU ( 0 , 1 )YYYยู( 0 , 1 )ยู(0,1)U(0,1) 0 ≤ x ≤ 1 0ฉ( x ) = 1ฉ(x)=1f(x)=1ถ้า (และที่อื่น)0≤x≤10≤x≤10≤x≤1000 ให้เป็นตัวแปรสุ่มจริงที่กำหนดโดย:ZZZ Z=X−YZ=X−YZ=X-Yถ้า (และที่อื่น)0X>YX>YX>Y000 สืบทอดมากระจายของZZZZ คำนวณความคาดหวังและความแปรปรวน(Z)V ( Z )E(Z)E(Z)E(Z)V(Z)V(Z)V(Z)

3
สถิติสำหรับเว็บไซต์หาคู่ออนไลน์
ฉันอยากรู้ว่าระบบการออกเดทออนไลน์อาจใช้ข้อมูลการสำรวจเพื่อกำหนดการแข่งขันอย่างไร สมมติว่าพวกเขามีข้อมูลผลจากการแข่งขันที่ผ่านมา (เช่น 1 = แต่งงานอย่างมีความสุข, 0 = ไม่มีวันที่ 2) ต่อไปสมมติว่าพวกเขามี 2 คำถามที่ชอบ "คุณชอบกิจกรรมกลางแจ้งมากแค่ไหน (1 = ไม่ชอบอย่างยิ่ง 5 = ชอบอย่างยิ่ง)" "คุณเป็นคนมองโลกในแง่ดีแค่ไหน (1 = ไม่ชอบอย่างยิ่ง 5 = ชอบอย่างยิ่ง") สมมติว่าสำหรับแต่ละคำถามที่พวกเขามีตัวบ่งชี้ "คู่สมรสของคุณมีความสำคัญต่อการตั้งค่าของคุณอย่างไร (1 = ไม่สำคัญ 3 = สำคัญมาก)" หากพวกเขามีคำถาม 4 ข้อสำหรับแต่ละคู่และผลลัพธ์ว่าการแข่งขันประสบความสำเร็จหรือไม่โมเดลพื้นฐานที่จะใช้ข้อมูลนั้นเพื่อทำนายการแข่งขันในอนาคตคืออะไร

1
การทำนายการตอบสนองจากเส้นโค้งใหม่โดยใช้แพ็คเกจ fda ใน R
โดยพื้นฐานทั้งหมดที่ฉันต้องการทำคือทำนายการตอบสนองเซนต์คิตส์และเนวิสโดยใช้เส้นโค้งบางอย่าง ฉันใช้วิธีถดถอยแล้ว (ใช้ fRegress จากแพ็คเกจ fda) แต่ก็ไม่รู้ว่าจะใช้ผลลัพธ์กับเส้นโค้งชุดใหม่ได้อย่างไร (สำหรับการทำนาย) ฉันมีเส้นโค้ง N = 536 และการตอบกลับเซนต์คิตส์และเนวิส 536 นี่คือสิ่งที่ฉันทำไปแล้ว: ฉันได้สร้างพื้นฐานสำหรับเส้นโค้ง ฉันสร้างวัตถุ fdPar เพื่อแนะนำการลงโทษ ฉันได้สร้างวัตถุ fd โดยใช้ smooth.basis เพื่อทำให้เส้นโค้งเรียบโดยมีการลงโทษที่เลือกตามเกณฑ์ที่ระบุ ฉันใช้การถดถอยด้วย fRegress () เพื่อลดความโค้งในการตอบสนองสเกลาร์ ตอนนี้สิ่งที่ฉันอยากทำคือใช้การถดถอยนั้นเพื่อคาดการณ์ชุดข้อมูลใหม่ที่ฉันมี ฉันไม่สามารถหาวิธีที่ง่ายในการทำเช่นนี้ ไชโย

3
จะจัดกลุ่มตัวแปรตามยาวได้อย่างไร
ฉันมีกลุ่มของตัวแปรที่มีข้อมูลตามยาวตั้งแต่วันที่ 0 ถึงวันที่ 7 ฉันกำลังมองหาวิธีการจัดกลุ่มที่เหมาะสมซึ่งสามารถจัดกลุ่มตัวแปรตามยาวเหล่านี้ (ไม่ใช่กรณี) ในกลุ่มต่าง ๆ ฉันพยายามวิเคราะห์ชุดข้อมูลแยกต่างหากตามเวลา แต่ผลลัพธ์นั้นค่อนข้างยากที่จะอธิบายอย่างสมเหตุสมผล ฉันตรวจสอบความพร้อมใช้งานของกระบวนการ SAS PROC SIMILARITYเนื่องจากมีตัวอย่างในเว็บไซต์ ; อย่างไรก็ตามฉันคิดว่ามันไม่ถูกวิธี การศึกษาก่อนหน้านี้บางส่วนใช้การวิเคราะห์ปัจจัยเชิงสำรวจในแต่ละช่วงเวลา แต่นี่ไม่ใช่ตัวเลือกในการศึกษาของฉันเช่นกันเนื่องจากผลลัพธ์ที่ไม่สมเหตุสมผล หวังว่าจะมีแนวคิดบางอย่างที่นี่และโปรแกรมที่คอมไพล์เช่น SAS หรือ R สามารถประมวลผลได้ ข้อเสนอแนะใด ๆ ที่ชื่นชม !! นี่คือตัวอย่างสั้น ๆ (ขออภัยสำหรับตำแหน่งที่ไม่สอดคล้องกันระหว่างข้อมูลและชื่อตัวแปร): id time V1 V2 V3 V4 V5 V6 V7 V8 V9 V10 2 0 8 7 3 7 6 6 …
10 clustering 

3
วิธีทดสอบอย่างเป็นทางการสำหรับ“ หยุด” ในการแจกแจงแบบปกติ (หรืออื่น ๆ )
บ่อยครั้งที่มันเกิดขึ้นในสังคมศาสตร์ว่าตัวแปรที่ควรแจกจ่ายในทางใดทางหนึ่งพูดตามปกติจบลงด้วยความไม่ต่อเนื่องในการกระจายรอบจุดต่าง ๆ ตัวอย่างเช่นหากมีการตัดเฉพาะเช่น "การผ่าน / ไม่ผ่าน" และหากมาตรการเหล่านี้มีการบิดเบือนอาจมีความไม่ต่อเนื่อง ณ จุดนั้น ตัวอย่างที่โดดเด่นหนึ่งตัวอย่าง (อ้างอิงด้านล่าง) มาจากคะแนนการทดสอบตามมาตรฐานของนักเรียนโดยทั่วไปจะกระจายอยู่ทั่วไปทุกที่ยกเว้น 60% ที่มีมวลน้อยมากจาก 50-60% และมีมวลมากเกินไปประมาณ 60-65% สิ่งนี้เกิดขึ้นในกรณีที่ครูให้คะแนนนักเรียนของตนเอง ผู้เขียนตรวจสอบว่าครูช่วยนักเรียนสอบจริง ๆ หรือไม่ หลักฐานที่น่าเชื่อถือที่สุดอย่างไม่ต้องสงสัยมาจากการแสดงกราฟของเส้นโค้งระฆังที่มีความไม่ต่อเนื่องรอบการตัดที่แตกต่างกันสำหรับการทดสอบที่แตกต่างกัน อย่างไรก็ตามคุณจะพัฒนาการทดสอบทางสถิติอย่างไร? พวกเขาพยายามแก้ไขแล้วเปรียบเทียบเศษส่วนด้านบนหรือด้านล่างและทดสอบ t ในส่วนที่ 5 คะแนนด้านบนและด้านล่างตัด ในขณะที่มีเหตุผลเหล่านี้เป็นเฉพาะกิจ ใครสามารถคิดอะไรดีกว่า Link: หลักเกณฑ์และดุลยพินิจในการประเมินผลของนักเรียนและโรงเรียน: กรณีของนิวยอร์กผู้สำเร็จราชการสอบ http://www.econ.berkeley.edu/~jmccrary/nys_regents_djmr_feb_23_2011.pdf

1
ดังนั้นคุณจะรวมการประมาณแบบเบย์ในการวิเคราะห์อภิมานอย่างไร
ได้รับแรงบันดาลใจจากคำถามนี้และโดยเฉพาะ "ปัญหา 3": การแจกแจงด้านหลังนั้นค่อนข้างยากกว่าที่จะรวมเข้ากับการวิเคราะห์เมตาเว้นแต่ว่ามีการแจกแจงรายละเอียดเชิงพารามิเตอร์ของการแจกแจงแบบสม่ำเสมอ ฉันคิดว่าเมื่อไม่นานมานี้มีการผสมผสาน meta-analysis เข้ากับแบบจำลอง Bayesian ซึ่งส่วนใหญ่เป็นแหล่งของนักบวช - แต่จะไปในทิศทางอื่นได้อย่างไร? หากการวิเคราะห์แบบเบย์กลายเป็นที่นิยมมากขึ้นและกลายเป็นเรื่องง่ายมากที่จะรวมเข้ากับโค้ดที่มีอยู่ (คำสั่ง BAYES ใน SAS 9.2 และเหนือขึ้นไป) เราควรได้รับผลการประเมินแบบเบย์ในวรรณคดีบ่อยขึ้น ลองทำเป็นว่าเรามีนักวิจัยประยุกต์ที่ตัดสินใจทำการวิเคราะห์แบบเบย์ ใช้รหัสจำลองเดียวกับที่ฉันใช้สำหรับคำถามนี้ถ้าพวกเขาไปกับกรอบบ่อยๆพวกเขาต้องการประมาณการบ่อยต่อไปนี้: log relative risk = 1.1009, standard error = 0.0319, log 95% CI = 1.0384, 1.1633 การใช้การวิเคราะห์คำสั่ง BAYES แบบมาตรฐานที่เป็นค่าเริ่มต้นและไม่เป็นทางการทั้งหมดนั้นไม่มีเหตุผลที่จะมีช่วงเวลาที่ดีความเชื่อมั่นแบบสมมาตรหรือข้อผิดพลาดมาตรฐาน ในกรณีนี้หลังส่วนใหญ่นั้นอธิบายได้ง่ายโดยการแจกแจงแบบปกติดังนั้นใคร ๆ ก็สามารถอธิบายได้ว่ามันเป็นแบบ "ใกล้พอ" แต่จะเกิดอะไรขึ้นถ้ามีคนรายงานการประมาณค่าผลเบย์และช่วงเวลาที่ไม่สมมาตร มีวิธีการที่ตรงไปตรงมาในการวิเคราะห์เมตาดาต้ามาตรฐานหรือไม่จำเป็นต้องมีการประเมินรองเท้ากลับเข้าไปในการแจกแจงแบบอธิบายพารามิเตอร์ที่ใกล้เคียงที่สุดหรือไม่? หรืออย่างอื่น?

1
ฉันจะค้นหาความสัมพันธ์ระหว่างการขัดข้องและสภาพแวดล้อมระบบได้อย่างไร
ในเวลาว่างของฉันฉันกำลังทำงานบนระบบเว็บขนาดเล็กซึ่งรวบรวมรายงานข้อผิดพลาด (แต่ไม่ใช่รายงานข้อผิดพลาดอื่น ๆ ที่ไม่หยุดทำงาน) ที่ส่งจากแอปพลิเคชัน Delphi ของ Windows สำหรับการแก้ไขปัญหาผู้ใช้ยินดีที่จะมีคุณสมบัติการขุดข้อมูลเพื่อค้นหาความสัมพันธ์ระหว่างรุ่นฮาร์ดแวร์หรือระบบปฏิบัติการและข้อผิดพลาดเฉพาะและ / หรือความผิดพลาด เป็นตัวอย่างวิธีการใช้งาน: สำหรับความผิดพลาดทุกครั้งจะมีรายงานในฐานข้อมูลซึ่งมีรหัสลายนิ้วมือ / แฮชของการติดตามสแต็ก (call stack) ในขณะที่เกิดความผิดพลาดเพื่อระบุรายการที่ซ้ำกัน อัลกอริทึมจะตรวจสอบว่ามีการรายงานข้อผิดพลาดซ้ำกันทั้งหมดหรือไม่มีคุณลักษณะทั่วไปอื่น ๆ เช่นเซอร์วิสแพ็คที่ขาดหายไปของระบบปฏิบัติการ ผลการวิเคราะห์แสดงคุณสมบัติทั้งหมดที่รายงานบั๊กมีเหมือนกัน สมมติว่ารายงานข้อผิดพลาดอัตโนมัติเหล่านี้มีข้อมูลสำคัญทั้งหมดเช่นชื่อของกระบวนการทั้งหมดที่กำลังทำงานอยู่ชื่อไฟล์ข้อมูลรุ่นของ DLLs ที่โหลดเป็นต้น ฉันจะค้นหาความสัมพันธ์ระหว่างการขัดข้องซ้ำกับสภาพแวดล้อมได้อย่างไร มีอัลกอริทึมเฉพาะหรือวิธีการทางสถิติที่จะช่วยหรือไม่

2
วิธีการวิเคราะห์ ROC ใน R ด้วยโมเดล Cox
ฉันได้สร้างแบบจำลองการถดถอยของ Cox แล้วและฉันต้องการดูว่าแบบจำลองเหล่านี้ทำงานได้ดีเพียงใดและฉันคิดว่าบางที ROC-curve หรือ c-statistic อาจมีประโยชน์เหมือนกับที่บทความนี้ใช้: JN Armitage และ JH van der Meulen,” การระบุอาการป่วยในผู้ป่วยผ่าตัดโดยใช้ข้อมูลการบริหารกับ Royal College of ศัลยแพทย์ Charlson Score”, วารสาร British Journal of Surgery, Vol. 97, NUM 5, เอสเอส 772-781, Maj 2010 Armitage ใช้การถดถอยแบบโลจิสติกส์ แต่ฉันสงสัยว่าเป็นไปได้หรือไม่ที่จะใช้แบบจำลองจากแพ็กเกจการเอาตัวรอด SurvivalROCให้คำใบ้เกี่ยวกับความเป็นไปได้นี้ แต่ฉันไม่สามารถหาวิธีที่จะทำให้มัน ฉันจะขอบคุณถ้ามีคนจะแสดงให้ฉันเห็นวิธีการวิเคราะห์ ROC ในตัวอย่างนี้: library(survival) data(veteran) attach(veteran) surv <- Surv(time, status) fit …
10 r  survival  roc 

1
แนวปฏิบัติที่ดีเมื่อทำการพยากรณ์อนุกรมเวลา
ฉันทำงานมาหลายเดือนแล้วเกี่ยวกับการพยากรณ์โหลดระยะสั้นและการใช้ข้อมูลสภาพอากาศ / สภาพอากาศเพื่อปรับปรุงความแม่นยำ ฉันมีพื้นฐานด้านวิทยาศาสตร์คอมพิวเตอร์และด้วยเหตุนี้ฉันจึงพยายามที่จะไม่ทำผิดพลาดใหญ่ ๆ และทำการเปรียบเทียบที่ไม่เป็นธรรมกับเครื่องมือสถิติเช่นแบบจำลอง ARIMA ฉันต้องการทราบความคิดเห็นของคุณเกี่ยวกับสองสิ่ง: ฉันใช้ทั้งสองรุ่น (S) ARIMA และ (S) ARIMAX เพื่อตรวจสอบผลกระทบของข้อมูลสภาพอากาศในการพยากรณ์คุณคิดว่าจำเป็นหรือไม่ที่จะต้องใช้วิธีการปรับให้เรียบแบบเอ็กซ์โปเนนเชียล มีอนุกรมเวลา 300 ตัวอย่างรายวันฉันเริ่มจากสองสัปดาห์แรกและฉันทำการพยากรณ์ล่วงหน้า 5 วันโดยใช้รุ่นที่สร้างขึ้นด้วยฟังก์ชั่น auto.arima R (แพ็คเกจการคาดการณ์) จากนั้นฉันเพิ่มตัวอย่างอีกชุดข้อมูลของฉันและฉันสอบเทียบโมเดลอีกครั้งและฉันทำการพยากรณ์อีก 5 วันและต่อไปเรื่อย ๆ จนกว่าจะสิ้นสุดข้อมูลที่มี คุณคิดว่าวิธีการทำงานนี้ถูกต้องหรือไม่? ขอบคุณสำหรับคำแนะนำของคุณถึงแม้ว่าเป้าหมายการทำงานของเราคือบทความในวารสารวิศวกรรมศาสตร์ แต่ฉันต้องการทำงานอย่างเข้มงวดที่สุดเท่าที่จะเป็นไปได้จากมุมมองทางสถิติ

8
อัลกอริทึมใดที่สามารถใช้ในการทำนายการใช้วัสดุสิ้นเปลืองที่ได้รับข้อมูลจากการซื้อในอดีต
คิดเกี่ยวกับปัญหาที่เรียบง่าย แต่น่าสนใจฉันต้องการเขียนโค้ดบางอย่างเพื่อคาดการณ์วัสดุสิ้นเปลืองฉันจะต้องใช้ในอนาคตอันใกล้นี้เนื่องจากมีประวัติการซื้อที่ผ่านมาอย่างสมบูรณ์ ฉันแน่ใจว่าปัญหาประเภทนี้มีคำจำกัดความทั่วไปและศึกษาดีกว่า (มีคนแนะนำว่านี่เกี่ยวข้องกับแนวคิดบางอย่างในระบบ ERP และอื่น ๆ ) ข้อมูลที่ฉันมีคือประวัติการซื้อที่ผ่านมาอย่างสมบูรณ์ สมมติว่าฉันกำลังดูวัสดุกระดาษข้อมูลของฉันดูเหมือน (วันที่แผ่น): 2007-05-10 500 2007-11-11 1000 2007-12-18 1000 2008-03-25 500 2008-05-28 2000 2008-10-31 1500 2009-03-20 1500 2009-06-30 1000 2009-09-29 500 2009-12-16 1500 2010-05-31 500 2010-06-30 500 2010-09-30 1500 2011-05-31 1000 มันไม่ 'สุ่มตัวอย่าง' ในช่วงเวลาปกติดังนั้นฉันคิดว่ามันไม่มีคุณสมบัติเป็นข้อมูลอนุกรมเวลา ฉันไม่มีข้อมูลเกี่ยวกับระดับหุ้นจริงทุกครั้ง ฉันต้องการใช้ข้อมูลที่เรียบง่ายและ จำกัด นี้เพื่อคาดการณ์จำนวนกระดาษที่ฉันต้องการใน (ตัวอย่าง) 3,6,12 เดือน จนถึงตอนนี้ฉันก็รู้ว่าสิ่งที่ฉันกำลังมองหาเรียกว่าการคาดการณ์และไม่มาก …

2
การทดสอบสมมติฐานและระยะทางรวมทั้งหมดกับ Kullback-Leibler divergence
ในการวิจัยของฉันฉันพบปัญหาทั่วไปต่อไปนี้: ฉันมีการแจกแจงและครั้งในโดเมนเดียวกันและมีตัวอย่างจำนวนมาก (แต่ จำกัด ) จากการแจกแจงเหล่านั้น ตัวอย่างมีการกระจายอย่างเป็นอิสระและเหมือนกันจากหนึ่งในสองการแจกแจง (แม้ว่าการแจกแจงอาจเกี่ยวข้อง: ตัวอย่างเช่นQอาจเป็นส่วนผสมของPและการกระจายอื่น ๆ ) สมมติฐานว่างเปล่าคือตัวอย่างมาจากPสมมุติฐานสำรองคือ ตัวอย่างมาจากQPPPQQQQQQPPPPPPQQQ ฉันพยายามที่จะอธิบายลักษณะ Type I และ Type II ข้อผิดพลาดในการทดสอบตัวอย่างที่รู้กระจายPPPและQQQQโดยเฉพาะอย่างยิ่งผมสนใจในขอบเขตหนึ่งข้อผิดพลาดที่กำหนดอื่น ๆ นอกเหนือไปจากความรู้ของPPPและQQQQ ฉันได้ถามคำถามทางคณิตศาสตร์เกี่ยวกับความสัมพันธ์ของระยะทางรวมการเปลี่ยนแปลงระหว่างPPPและQQQกับการทดสอบสมมติฐานและได้รับคำตอบที่ฉันยอมรับ คำตอบนั้นสมเหตุสมผล แต่ฉันยังไม่สามารถสรุปความหมายที่ลึกกว่าความสัมพันธ์ของระยะทางรวมของการเปลี่ยนแปลงและการทดสอบสมมติฐานที่เกี่ยวข้องกับปัญหาของฉัน ดังนั้นฉันตัดสินใจที่จะเปิดฟอรั่มนี้ คำถามแรกของฉันคือ: ความผันแปรทั้งหมดนั้นรวมกับผลรวมของความน่าจะเป็นของข้อผิดพลาด Type I และ Type II ที่เป็นอิสระจากวิธีการทดสอบสมมติฐานที่มีอยู่หรือไม่ ในสาระสำคัญตราบใดที่มีความน่าจะเป็นที่ไม่ใช่ศูนย์ที่ตัวอย่างอาจถูกสร้างขึ้นโดยการแจกแจงอย่างใดอย่างหนึ่งความน่าจะเป็นที่มีข้อผิดพลาดอย่างน้อยหนึ่งข้อต้องไม่เป็นศูนย์ โดยพื้นฐานแล้วคุณไม่สามารถหลบหนีความเป็นไปได้ที่ผู้ทดสอบสมมติฐานของคุณจะทำผิดพลาดไม่ว่าคุณจะประมวลผลสัญญาณมากแค่ไหน และขอบเขตความแปรปรวนโดยรวมที่เป็นไปได้แน่นอน ความเข้าใจของฉันถูกต้องหรือไม่ นอกจากนี้ยังมีความสัมพันธ์ระหว่าง Type I และข้อผิดพลาดครั้งที่สองและพื้นฐานแจกแจงความน่าจะอีกและคือKL แตกต่าง ดังนั้นคำถามที่สองของฉันคือ: KL-divergence ผูกมัดใช้ได้กับวิธีการทดสอบสมมติฐานเฉพาะวิธีเดียวเท่านั้น (ดูเหมือนว่าจะเกิดขึ้นรอบ ๆ วิธีอัตราส่วนความน่าจะเป็นในการเข้าสู่ระบบมาก) หรือหนึ่งสามารถใช้ได้กับวิธีการทดสอบสมมติฐานทั้งหมด …

2
หนังสือที่ดีที่มีความเครียดเท่า ๆ กันเกี่ยวกับทฤษฎีและคณิตศาสตร์
ฉันมีหลักสูตรสถิติเพียงพอในช่วงปีที่เรียนและที่มหาวิทยาลัย ฉันมีความเข้าใจอย่างเป็นธรรมเกี่ยวกับแนวคิดเช่น CI ค่า p การตีความนัยสำคัญทางสถิติการทดสอบหลายแบบสหสัมพันธ์การถดถอยเชิงเส้นอย่างง่าย (ที่มีกำลังสองน้อยที่สุด) (โมเดลเชิงเส้นทั่วไป) และการทดสอบสมมติฐานทั้งหมด ฉันได้รับการแนะนำให้รู้จักกับมันมากของวันก่อนหน้านี้ส่วนใหญ่ทางคณิตศาสตร์ และเมื่อเร็ว ๆ นี้ด้วยความช่วยเหลือของหนังสือชีวสถิติที่ใช้งานง่ายฉันได้เข้าใจและไม่เคยมีมาก่อนเกี่ยวกับทฤษฎีแนวคิดจริงฉันเชื่อ ตอนนี้สิ่งที่ฉันพบว่าขาดคือความเข้าใจในตัวแบบที่เหมาะสม (การประมาณค่าพารามิเตอร์กับตัวแบบ) และสิ่งที่คล้ายกัน โดยเฉพาะอย่างยิ่งแนวคิดต่าง ๆ เช่นการประมาณค่าความน่าจะเป็นสูงสุดแบบจำลองเชิงเส้นแบบทั่วไปวิธีการแบบเบส์เพื่อสถิติเชิงอนุมาน มีตัวอย่างหรือแบบฝึกหัดไม่เพียงพอหรือมีเนื้อหาที่เป็นแนวคิดอย่างที่ควรจะเป็นในโมเดลที่น่าจะเป็นไปได้ง่ายหรือหัวข้ออื่น ๆ (พื้นฐาน) บนอินเทอร์เน็ต ฉันเป็นชีวสารสนเทศศาสตร์และฉันทำงานกับข้อมูล RNA-Seq ซึ่งเกี่ยวข้องกับจำนวนการอ่านดิบที่มีต่อการค้นหาสมมติว่าการแสดงออกของยีน (หรือการแสดงออกของยีนที่แตกต่างกัน) จากพื้นหลังของฉันแม้ว่าฉันจะไม่คุ้นเคยกับแบบจำลองทางสถิติฉันก็สามารถเข้าใจเหตุผลของการกระจายตัวแบบปัวซองและทวินามลบและอื่น ๆ .. แต่เอกสารบางฉบับเกี่ยวข้องกับตัวแบบเชิงเส้นทั่วไปและประมาณ MLE เป็นต้น .. ซึ่ง ฉันเชื่อว่าฉันมีพื้นฐานที่จำเป็นในการทำความเข้าใจ ฉันเดาว่าสิ่งที่ฉันขอเป็นวิธีการที่ผู้เชี่ยวชาญบางคนในหมู่คุณเห็นว่ามีประโยชน์และ (a) หนังสือ (s) ที่ช่วยให้ฉันเข้าใจแนวคิดเหล่านี้ในวิธีที่ง่ายขึ้น (ไม่ใช่แค่คณิตศาสตร์ที่เข้มงวด แต่ทฤษฎีที่สนับสนุนคณิตศาสตร์) ในขณะที่ฉันจะนำไปใช้เป็นส่วนใหญ่ฉันจะพอใจ (ในขณะนี้) ด้วยความเข้าใจว่าอะไรคืออะไรและหลังจากนั้นฉันสามารถกลับไปที่บทพิสูจน์ทางคณิตศาสตร์ที่เข้มงวด ... ไม่มีใครมีคำแนะนำหรือไม่? ฉันไม่รังเกียจที่จะซื้อหนังสือมากกว่า 1 …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.