สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
นี่เป็นวิธีที่ถูกต้องในการอัพเดทความน่าจะเป็นอย่างต่อเนื่องโดยใช้ทฤษฎีบทของเบย์หรือไม่?
สมมติว่าฉันกำลังพยายามหาความน่าจะเป็นที่ไอศครีมที่ชื่นชอบของใครบางคนคือวานิลลา ฉันรู้ว่าคน ๆ นี้ก็ชอบดูหนังสยองขวัญด้วย ฉันต้องการหาความน่าจะเป็นที่ไอศครีมที่ชื่นชอบของบุคคลนั้นคือวานิลลาเนื่องจากพวกเขาเพลิดเพลินกับภาพยนตร์สยองขวัญ ฉันรู้สิ่งต่อไปนี้: 5%5%5\%ของผู้คนเลือกวานิลลาเป็นไอศครีมที่ชื่นชอบ (นี่คือของฉัน )P(A)P(A)P(A) 10%10%10\%ของผู้ที่ชื่นชอบไอศครีมวานิลลาก็ชอบภาพยนตร์สยองขวัญเช่นกัน (นี่คือของฉัน )P(B|A)P(B|A)P(B|A) 1%1%1\%ของคนที่ชื่นชอบไม่ใช่ไอศกรีมวานิลลาก็ชอบหนังสยองขวัญ (นี่คือของฉัน )P(B|¬A)P(B|¬A)P(B|\lnot A) ดังนั้นฉันคำนวณแบบนี้: ฉันพบว่า (ปัดเศษเป็นสิบหลักที่ใกล้ที่สุด) มีโอกาสที่ไอศครีมที่ชื่นชอบของแฟนหนังสยองขวัญคือวานิลลาP(A|B)=0.05×0.1(0.05×0.1)+(0.01×(1−0.05))P(A|B)=0.05×0.1(0.05×0.1)+(0.01×(1−0.05))P(A|B)=\frac{0.05\times0.1}{(0.05 \times 0.1)+(0.01 \times(1-0.05))}P(A|B)=0.3448P(A|B)=0.3448P(A|B) = 0.344834.48%34.48%34.48\% แต่แล้วฉันก็รู้ว่าบุคคลนั้นได้ดูหนังสยองขวัญในช่วง 30 วันที่ผ่านมา นี่คือสิ่งที่ฉันรู้: 34.48%34.48%34.48\%เป็นความน่าจะเป็นด้านหลังที่วานิลลาเป็นคนชื่นชอบไอศครีมรสชาติ -ในปัญหาต่อไปนี้P(A)P(A)P(A) 20%20%20\%ของผู้ที่ชื่นชอบไอศครีมวานิลลาได้ดูหนังสยองขวัญในช่วง 30 วันที่ผ่านมา 5%5%5\%ของผู้ที่ไม่ชอบไอศกรีมวานิลลาได้เห็นภาพยนตร์สยองขวัญในช่วง 30 วันที่ผ่านมา สิ่งนี้จะให้: เมื่อปัดเศษ0.3448×0.2(0.3448×0.2)+(0.05×(1−0.3448))=0.67790.3448×0.2(0.3448×0.2)+(0.05×(1−0.3448))=0.6779\frac{0.3448\times0.2}{(0.3448\times0.2)+(0.05\times(1-0.3448))} = 0.6779 ดังนั้นตอนนี้ฉันเชื่อว่ามีโอกาสที่แฟนหนังสยองขวัญชอบไอศกรีมเพราะพวกเขาเคยดูหนังสยองขวัญในช่วง 30 วันที่ผ่านมา67.79%67.79%67.79\% แต่เดี๋ยวก่อนมีอีกอย่างหนึ่ง ฉันได้เรียนรู้ด้วยว่าบุคคลนั้นเป็นเจ้าของแมว นี่คือสิ่งที่ฉันรู้: 67.79%67.79%67.79\%เป็นความน่าจะเป็นหลังที่ได้รับการปรับปรุงซึ่งวานิลลาเป็นคนชื่นชอบไอศกรีมรสชาติ -ในปัญหาต่อไปนี้P(A)P(A)P(A) 40%40%40\%ของผู้ที่ชื่นชอบไอศครีมวานิลลาก็มีแมวเป็นของตัวเอง …

1
ช่วงเวลากลางของการแจกแจงแบบสมมาตร
ฉันพยายามแสดงให้เห็นว่าช่วงเวลากลางของการแจกแจงแบบสมมาตร: เป็นศูนย์สำหรับเลขคี่ ดังนั้นตัวอย่างเช่นช่วงเวลากลางที่สามฉันเริ่มต้นด้วยการพยายามแสดงให้เห็นว่าฉันไม่แน่ใจว่าจะไปจากที่นี่ข้อเสนอแนะใด ๆ ? มีวิธีที่ดีกว่าในการพิสูจน์เรื่องนี้หรือไม่?ฉx( a + x ) =ฉx( a - x )fx(a+x)=fx(a−x){\bf f}_x{\bf (a+x)} = {\bf f}_x{\bf(a-x)}E [ ( X - u))3] = 0E[(X−u)3]=0.{\bf E[(X-u)^3] = 0}.E [ ( X - u))3] = E [X3] - 3 u E [X2] + 3ยู2E [ X ] -ยู3.E[(X−u)3]=E[X3]−3uE[X2]+3u2E[X]−u3.{\bf E[(X-u)^3] …

2
กำหนดอัตราการเรียนรู้ที่เหมาะสมที่สุดสำหรับการไล่ระดับสีในการถดถอยเชิงเส้น
เราจะกำหนดอัตราการเรียนรู้ที่เหมาะสมที่สุดสำหรับการไล่ระดับสีได้อย่างไร ฉันคิดว่าฉันสามารถปรับได้โดยอัตโนมัติหากฟังก์ชันต้นทุนส่งคืนค่าที่มากกว่าในการคำนวณซ้ำก่อนหน้านี้ (อัลกอริทึมจะไม่มาบรรจบกัน) แต่ฉันไม่แน่ใจว่าควรใช้มูลค่าใหม่แบบไหน

1
ความสับสนที่เกี่ยวข้องกับระบบไดนามิกเชิงเส้น
ฉันอ่านหนังสือเล่มนี้การจดจำรูปแบบและการเรียนรู้ของเครื่องโดยบาทหลวง ฉันมีความสับสนเกี่ยวกับการกำเนิดของระบบพลวัตเชิงเส้น ใน LDS เราถือว่าตัวแปรแฝงเป็นต่อเนื่อง หาก Z หมายถึงตัวแปรแฝงและ X หมายถึงตัวแปรที่สังเกตได้ p (Zn|Zn - 1) = N(Zn| Zn - 1, τ)พี(Zn|Zn-1)=ยังไม่มีข้อความ(Zn|AZn-1,τ)p(z_n|z_{n-1}) = N(z_n|Az_{n-1},\tau) p (xn|Zn) = N(xn, CZn, Σ )พี(xn|Zn)=ยังไม่มีข้อความ(xn,คZn,Σ)p(x_n|z_n) = N(x_n,Cz_n,\Sigma) p (Z1) = N(Z1|ยู0,V0)พี(Z1)=ยังไม่มีข้อความ(Z1|ยู0,V0)p(z_1) = N(z_1|u_0,V_0) ใน LDS ยังใช้การส่งต่อข้อความย้อนหลังอัลฟาเบต้าไปข้างหน้าเพื่อคำนวณการแจกแจงหลังแฝง p (Zn| X)พี(Zn|X)p(z_n|X) α (Zn) = p ( x 1 …

2
เซ็นเซอร์ช่วงแบบ Cox ตามสัดส่วนความเป็นอันตรายใน R
เมื่อกำหนดช่วงเวลาการเอาตัวรอดให้ถูกต้องฉันจะทำการจำลอง Cox PH แบบช่วงเซ็นเซอร์ได้Rอย่างไร การค้นหา rseek จะเปิดแพ็คเกจintcoxซึ่งไม่มีอยู่ในที่Rเก็บอีกต่อไป ฉันเกือบจะเป็นบวกcoxphฟังก์ชั่นในsurvivalแพ็คเกจไม่สามารถจัดการกับข้อมูลการรอดชีวิตแบบเซ็นเซอร์ นอกจากนี้ฉันไม่ต้องการใส่ข้อมูลแล้วใช้coxphฟังก์ชัน วิธีนี้จะประเมินข้อผิดพลาดมาตรฐานต่ำกว่าค่าสัมประสิทธิ์เนื่องจากคุณไม่สนใจความไม่แน่นอนของการเซ็นเซอร์ช่วงเวลา

2
การถดถอย SVM พร้อมข้อมูลระยะยาว
ฉันมีตัวแปรประมาณ 500 ตัวต่อผู้ป่วยแต่ละตัวแปรมีหนึ่งค่าอย่างต่อเนื่องและวัดที่จุดเวลาที่ต่างกันสามจุด (หลังจาก 2 เดือนและหลังจาก 1 ปี) ด้วยการถดถอยฉันต้องการที่จะทำนายผลการรักษาสำหรับผู้ป่วยใหม่ เป็นไปได้ไหมที่จะใช้การถดถอย SVM กับข้อมูลตามยาว

2
คุณใช้การยกกำลังเลขชี้กำลังแบบง่ายใน R ได้อย่างไร?
ฉันเป็นผู้เริ่มต้นใน R คุณช่วยอธิบายวิธีใช้ ses ในแพ็คเกจพยากรณ์ของ R forecast ได้ไหม ฉันต้องการเลือกจำนวนของจุดเริ่มต้นและค่าคงที่แบบเรียบ d <- c(3,4,41,10,9,86,56,20,18,36,24,59,82,51,31,29,13,7,26,19,20,103,141,145,24,99,40,51,72,58,94,78,11,15,17,53,44,34,12,15,32,14,15,26,75,110,56,43,19,17,33,26,40,42,18,24,69,18,18,25,86,106,104,35,43,12,4,20,16,8) ผมมี 70 คาบ, ผมอยากใช้ 40 คาบสำหรับค่าเริ่มต้นและ 30 สำหรับตัวอย่างที่ไม่อยู่ ses(d, h=30, level=c(80,95), fan=FALSE,initial=c("simple"), alpha=.1) ถูกต้องหรือไม่

1
ตามเงื่อนไขทั้งหมด, การกระจายตัวของทวินามลบคืออะไร
หากเป็น IID ทวินามลบแล้วสิ่งคือการกระจายของได้รับx1,x2,…,xnx1,x2,…,xnx_1, x_2, \ldots, x_n(x1,x2,…,xn)(x1,x2,…,xn)(x_1, x_2, \ldots, x_n) x1+x2+…+xn=Nx1+x2+…+xn=Nx_1 + x_2 + \ldots + x_n = N\quad ? NNNแก้ไข หากเป็นปัวซองดังนั้นเงื่อนไขโดยรวมเป็นมัลติโนเมียล ฉันไม่แน่ใจว่ามันเป็นเรื่องจริงสำหรับทวินามลบหรือไม่เพราะมันเป็นปัวซองผสมx1,x2,…,xnx1,x2,…,xnx_1, x_2, \ldots, x_n(x1,x2,…,xn)(x1,x2,…,xn)(x_1, x_2, \ldots, x_n) ในกรณีที่คุณอยากรู้นี่ไม่ใช่ปัญหาการบ้าน


2
การกรองความร่วมมือผ่านการแยกตัวประกอบแบบเมทริกซ์ด้วยฟังก์ชันการสูญเสียโลจิสติกส์
พิจารณาปัญหาการกรองร่วมกัน เรามีเมทริกซ์ขนาด # ผู้ใช้ * #items หากผู้ใช้ฉันชอบรายการ j,หากผู้ใช้ฉันไม่ชอบรายการ j และหากไม่มีข้อมูลเกี่ยวกับคู่ (i, j) เราต้องการที่จะทำนายสำหรับผู้ใช้งานในอนาคตคู่ไอเท็มMMMMi,j=1Mi,j=1M_{i,j} = 1Mi,j=0Mi,j=0M_{i,j} = 0Mi,j=?Mi,j=?M_{i,j}=?Mi,jMi,jM_{i,j} วิธีการกรองแบบร่วมมือกันมาตรฐานคือการแสดง M เป็นผลคูณของ 2 เมทริกซ์เช่นน้อยที่สุด (เช่นการลดความคลาดเคลื่อนกำลังสองเฉลี่ยสำหรับองค์ประกอบที่รู้จักของ )U×VU×VU \times V||M−U×V||2||M−U×V||2||M - U \times V||_2MMM สำหรับฉันแล้วฟังก์ชั่นการสูญเสียโลจิสติกส์ดูจะเหมาะสมกว่าทำไมอัลกอริธึมทั้งหมดที่ใช้ MSE

1
ข้อมูลไม่ต่อเนื่องและทางเลือกในการ PCA
ฉันมีชุดข้อมูลของตัวแปรที่ไม่ต่อเนื่อง (ลำดับ, meristic, และชื่อ) ที่อธิบายถึงลักษณะปีกของสัณฐานวิทยาของแมลงหลายชนิดที่เกี่ยวข้องอย่างใกล้ชิด สิ่งที่ฉันต้องการทำคือทำการวิเคราะห์บางอย่างที่จะทำให้ฉันเห็นภาพของความคล้ายคลึงกันของสปีชีส์ต่าง ๆ ตามลักษณะทางสัณฐานวิทยา สิ่งแรกที่โผล่เข้ามาในหัวของฉันคือ PCA (นี่คือประเภทของการสร้างภาพข้อมูลที่ฉันต้องการสร้าง) แต่หลังจากตรวจสอบแล้ว (โดยเฉพาะคำถามอื่น ๆ เช่น: การวิเคราะห์องค์ประกอบหลักสามารถนำไปใช้กับชุดข้อมูลที่มีการผสมผสานอย่างต่อเนื่อง และตัวแปรเด็ดขาด?) ดูเหมือนว่า PCA อาจไม่เหมาะสมสำหรับข้อมูลที่ไม่ต่อเนื่อง (PCA ใช้ในการศึกษาประเภทนี้ในวรรณคดี แต่มักจะมีข้อมูลต่อเนื่องอยู่เสมอ) ไม่สนใจภูมิหลังทางสถิติว่าเพราะเหตุใดข้อมูลนี้จึงไม่เหมาะสม PCA ให้ผลลัพธ์ที่สมบูรณ์แบบสำหรับคำถามทางชีววิทยาของฉัน (กลุ่มลูกผสมที่น่าสนใจตกอยู่ตรงกลางกลุ่มพ่อ) ฉันได้ลองวิเคราะห์การติดต่อหลายครั้งเพื่อเอาใจสถิติ (อย่างน้อยที่สุดเท่าที่ความเข้าใจของฉันไป) แต่ฉันไม่สามารถรับพล็อตที่คล้ายกับที่ฉันจะได้รับจาก PCA ที่การสังเกตของฉัน (บุคคลทางชีววิทยา) มีการแยกคำพูดด้วยสีเพื่อแสดงการจัดกลุ่มที่แตกต่างกัน (สปีชีส์ต่างกัน, การพูดทางชีววิทยา) ดูเหมือนว่าการวิเคราะห์นี้มีวัตถุประสงค์เพื่ออธิบายว่าตัวแปร (ที่นี่ลักษณะทางสัณฐานวิทยาของฉัน) มีความเกี่ยวข้องกันอย่างไรไม่ใช่การสังเกตของแต่ละบุคคล และเมื่อฉันพล็อตข้อสังเกตเป็นสีกลุ่มฉันจะได้รับค่าเดียวเท่านั้น (อาจเป็นค่าเฉลี่ย) ที่อธิบายกลุ่มบุคคลทั้งหมด ฉันได้ทำการวิเคราะห์ใน R ดังนั้นบางทีฉันก็ไม่ได้ขยันพอที่จะทำให้แนวคิดของฉันทำงาน ฉันถูกต้องในการลองวิเคราะห์เช่นนี้กับข้อมูลของฉันหรือฉันออกนอกเส้นทาง? หากคุณไม่สามารถบอกได้ว่าความเชี่ยวชาญทางสถิติของฉันมี จำกัด ดังนั้นสมการที่เกิดขึ้นภายใต้การวิเคราะห์เหล่านี้จะอยู่เหนือหัวของฉัน ฉันพยายามทำการวิเคราะห์นี้อย่างสมบูรณ์แบบเชิงพรรณนา …

4
การขยายการถดถอยโลจิสติกสำหรับผลลัพธ์ในช่วงระหว่าง 0 ถึง 1
ฉันมีปัญหาการถดถอยที่ผลจะไม่เคร่งครัด 0, 1 แต่ในช่วงของตัวเลขจริงทั้งหมด 0-1 รวม1]Y= [ 0 , 0.12 , 0.31 , . . , 1 ]Y=[0,0.12,0.31,...,1]Y = [ 0, 0.12, 0.31, ..., 1 ] ปัญหานี้ได้รับการกล่าวถึงในกระทู้นี้แล้วแม้ว่าคำถามของฉันจะแตกต่างกันเล็กน้อย ฉันไม่สามารถใช้การถดถอยเชิงเส้นด้วยเหตุผลเดียวกับที่ใช้การถดถอยแบบโลจิสติกส์ ในการถดถอยเชิงเส้น A) ค่า IV ที่มีขนาดใหญ่มากจะบิดเบือนผลลัพธ์ที่คาดการณ์ไว้ที่ 1 และ B) ผลลัพธ์ของการถดถอยเชิงเส้นจะไม่ถูกผูกไว้กับขีด จำกัด 0,1 ดูที่ฟังก์ชันต้นทุนโลจิสติกส์จากตำราฉันรวบรวมว่าสมการถูกออกแบบมาเพื่อคำนวณ ราคามากกว่า 0 ต่อเมื่อและไม่มีค่าเท่ากัน 0 หรือ 1ราคา= - yเข้าสู่ระบบ( h ( …

2
เรียนรู้จากข้อมูลเชิงสัมพันธ์
การตั้งค่า อัลกอริทึมจำนวนมากทำงานบนความสัมพันธ์หรือตารางเดียวในขณะที่ฐานข้อมูลในโลกแห่งความจริงจำนวนมากเก็บข้อมูลในหลายตาราง (Domingos, 2003) คำถาม อัลกอริทึมชนิดใดที่เรียนรู้ได้ดีจากหลาย ๆ ตาราง (เชิงสัมพันธ์) โดยเฉพาะอย่างยิ่งฉันสนใจในอัลกอริทึมที่ใช้กับงานการถดถอยและการจัดหมวดหมู่ (ไม่ใช่งานที่เน้นการวิเคราะห์เครือข่ายเช่นการคาดการณ์ลิงก์) ฉันตระหนักถึงวิธีการหลายอย่างที่ระบุไว้ด้านล่าง (แต่ฉันแน่ใจว่าฉันขาดบางอย่าง): การทำเหมืองข้อมูลแบบหลายสัมพันธ์ (MRDM) (Dzeroski, 2002) การเขียนโปรแกรมตรรกะอุปนัย (ILP) (Muggleton, 1992) การเรียนรู้เชิงสถิติ (SRL) (Getoor, 2007) Džeroski, S. (2003) การทำเหมืองข้อมูลหลายสัมพันธ์: การแนะนำ จดหมายข่าว ACM SIGKDD Explorations Getoor, Lise และ Ben Taskar, eds ความรู้เบื้องต้นเชิงสถิติเชิงสัมพันธ์ กด MIT, 2007 S. Muggleton และ C. Feng การเหนี่ยวนำที่มีประสิทธิภาพของโปรแกรมตรรกะ …

3
เข้าสู่ระบบพลิกเมื่อเพิ่มตัวแปรอีกหนึ่งตัวในการถดถอยและมีขนาดที่ใหญ่กว่ามาก
การตั้งค่าพื้นฐาน: แบบจำลองการถดถอย: โดยที่ C คือเวกเตอร์ของตัวแปรควบคุมY= ค่าคงที่+β1x1+β2x2+β3x3+β4x4+ α C+ ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon ฉันสนใจและคาดว่าและเป็นลบ อย่างไรก็ตามมีปัญหาความสัมพันธ์แบบหลายค่าในตัวแบบสัมประสิทธิ์สหสัมพันธ์โดย corr ( , 0.9345, corr ( , 0.1765, corr ( , 0.3019ββ\betaβ1β1\beta_1β2β2\beta_2x1x1x_1x2) =x2)=x_2)=x1x1x_1x3) =x3)=x_3)=x2x2x_2x3) =x3)=x_3)= ดังนั้นและมีความสัมพันธ์กันสูงและควรให้ข้อมูลเดียวกัน ฉันใช้การถดถอยสามครั้ง: x1x1x_1x2x2x_2 ยกเว้นตัวแปร ; 2. ยกเว้นตัวแปร3. รูปแบบเดิมที่มีทั้งและx_2x1x1x_1x2x2x_2x1x1x_1x2x2x_2 ผลลัพธ์: สำหรับการถดถอย 1 และ 2 จะให้สัญญาณที่คาดไว้สำหรับและตามลำดับและมีขนาดใกล้เคียงกัน และและมีความสำคัญในระดับ 10% ในทั้งสองรุ่นหลังจากฉันทำการแก้ไข HAC ในข้อผิดพลาดมาตรฐาน เป็นค่าบวก …

4
Box Cox Transforms สำหรับการถดถอย
ฉันกำลังพยายามปรับตัวแบบเชิงเส้นในข้อมูลบางส่วนด้วยตัวทำนายเพียงตัวเดียว (พูด (x, y)) ข้อมูลเป็นเช่นนั้นสำหรับค่าเล็ก ๆ ของ x ค่า y ให้พอดีกับเส้นตรงอย่างไรก็ตามเมื่อค่า x เพิ่มขึ้นค่า y จะกลายเป็นความผันผวนมากขึ้น นี่คือตัวอย่างของข้อมูลดังกล่าว (รหัส R) y = c(3.2,3.4,3.5,3.8,4.2,5.5,4.5,6.8,7.4,5.9) x = seq(1,10,1) ฉันอยากรู้ว่ามีการแปลงพลังงานหรือไม่ (อาจเป็น Box cox?) ที่ช่วยให้ฉันได้รับข้อมูลที่ดีกว่าสำหรับการทำแบบพอดีเชิงเส้นดังที่แสดงด้านล่าง fit = lm(y ~ x)

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.