สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เสียนเช่นเดียวกับการกระจายที่มีช่วงเวลาการสั่งซื้อที่สูงขึ้น
สำหรับการกระจายเสียนกับที่ไม่รู้จักค่าเฉลี่ยและความแปรปรวนสถิติเพียงพอในมาตรฐานครอบครัวชี้แจงรูปแบบคือ2) ฉันมีการแจกแจงที่มีโดยที่ N เป็นชนิดของพารามิเตอร์การออกแบบ มีการแจกแจงที่รู้จักกันที่สอดคล้องกันสำหรับเวกเตอร์สถิติที่เพียงพอนี้หรือไม่? ฉันต้องการตัวอย่างจากการกระจายตัวนี้ดังนั้นมันสำคัญมากสำหรับฉันที่จะได้รับตัวอย่างที่แน่นอนจากการกระจายตัว ขอบคุณมาก.T( x ) = ( x , x2)T(x)=(x,x2)T(x)=(x,x^2)T(x)=(x,x2,...,x2N)T(x)=(x,x2,...,x2ยังไม่มีข้อความ)T(x)=(x,x^2,...,x^{2N})

2
การประเมินกลุ่มของลูกโซ่มาร์คอฟอันดับหนึ่ง
ฉันจัดกลุ่มชุดข้อมูลของมาร์คอฟอันดับหนึ่งหลายพันกลุ่มเป็นกลุ่มประมาณ 10 กลุ่ม มีวิธีที่แนะนำบางอย่างที่ฉันสามารถประเมินกลุ่มเหล่านี้และค้นหารายการในกลุ่มที่ใช้ร่วมกันและสิ่งที่แตกต่างจากกลุ่มอื่น ๆ ? ดังนั้นฉันสามารถสร้างคำสั่งเช่น "กระบวนการในกลุ่ม A มักจะอยู่ในสถานะ Y เมื่อพวกเขาไปถึงที่นั่นซึ่งไม่เป็นความจริงสำหรับกระบวนการในกลุ่มอื่น ๆ " เมทริกซ์การเปลี่ยนแปลงของเชนมาร์คอฟนั้นใหญ่เกินกว่าที่จะ "มองและมอง" พวกมันค่อนข้างเบาบางหากสามารถช่วยได้ ความคิดของฉันคือการใช้เมทริกซ์การเปลี่ยนแปลงทั้งหมดในกลุ่มรวมพวกเขาและพล็อตมันเป็นความเข้มในภาพ (ในระดับจาก 0 ถึง 255) มีอะไรเป็น "มืออาชีพ" มากกว่านี้ที่ฉันควรลอง?

2
ฉันจะสร้างตัวเลขตามการแจกแจงโซลิตันได้อย่างไร
การแจกแจงโซลิตันเป็นการแจกแจงความน่าจะเป็นแบบแยกส่วนเหนือชุด{ 1 , … , N}{1,...,ยังไม่มีข้อความ}\{1,\dots, N\}ด้วยฟังก์ชันมวลความน่าจะเป็น p ( 1 ) = 1ยังไม่มีข้อความ,p ( k ) = 1k ( k - 1 )สำหรับ k ∈ { 2 , … , N}พี(1)=1ยังไม่มีข้อความ,พี(k)=1k(k-1)สำหรับ k∈{2,...,ยังไม่มีข้อความ} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} ฉันต้องการใช้มันเป็นส่วนหนึ่งของการใช้งานรหัส LTโดยเฉพาะอย่างยิ่งใน Python ที่มีตัวสร้างตัวเลขสุ่มแบบสม่ำเสมอให้บริการ

3
คำว่า "เรียนรู้แบบจำลอง" มาจากที่ใด
บ่อยครั้งที่ฉันเคยได้ยินว่าผู้ขุดข้อมูลใช้คำนี้ ในฐานะนักสถิติที่ทำงานเกี่ยวกับการจำแนกปัญหาฉันคุ้นเคยกับคำว่า "ฝึกฝนลักษณนาม" และฉันถือว่า "เรียนรู้ตัวแบบ" หมายถึงสิ่งเดียวกัน ฉันไม่สนใจคำว่า "ฝึกฝนลักษณนาม" ที่ดูเหมือนจะแสดงให้เห็นถึงแนวคิดของการปรับโมเดลให้เหมาะสมเนื่องจากข้อมูลการฝึกอบรมใช้เพื่อให้ได้ค่าประมาณที่ดีขึ้นหรือ "ดีขึ้น" ของพารามิเตอร์โมเดล แต่การเรียนรู้จะหมายถึงการได้รับความรู้ ในภาษาอังกฤษธรรมดา "เรียนรู้แบบจำลอง" จะหมายถึงการรู้ว่ามันคืออะไร แต่ในความเป็นจริงเราไม่เคย "รู้" โมเดล แบบจำลองความเป็นจริงโดยประมาณ แต่ไม่มีแบบจำลองที่ถูกต้อง มันเหมือนที่ Box บอกว่า "ไม่มีรุ่นที่ถูกต้อง แต่บางรุ่นก็มีประโยชน์" ฉันสนใจที่จะฟังการตอบสนองของผู้ปฏิบัติข้อมูล คำนี้มาอย่างไร ถ้าคุณใช้มันคุณชอบมันทำไม

1
ปัจจัยเบย์กับนักบวชที่ไม่เหมาะสม
ฉันมีคำถามเกี่ยวกับการเปรียบเทียบแบบจำลองโดยใช้ปัจจัยของเบย์ ในหลายกรณีนักสถิติมีความสนใจที่จะใช้วิธีการแบบเบย์ร่วมกับนักบวชที่ไม่เหมาะสม (ตัวอย่างเช่นนักบวชเจฟฟรีย์และนักบวชอ้างอิง) คำถามของฉันคือในกรณีที่การกระจายตัวด้านหลังของพารามิเตอร์แบบจำลองมีการกำหนดไว้อย่างถูกต้องมันจะถูกต้องหรือไม่ที่จะเปรียบเทียบแบบจำลองที่ใช้ปัจจัย Bayes ภายใต้การใช้ของนักบวชที่ไม่เหมาะสม? ตัวอย่างง่ายๆลองพิจารณาเปรียบเทียบโมเดลปกติกับโมเดลโลจิสติกกับ Jeffreys priors

1
การแก้ไขความไม่แม่นยำของสัญญาณนาฬิกาแบบกระจายตามปกติ
ฉันมีการทดสอบซึ่งดำเนินการกับคอมพิวเตอร์หลายร้อยเครื่องกระจายไปทั่วโลกที่วัดการเกิดเหตุการณ์บางอย่าง เหตุการณ์แต่ละเหตุการณ์นั้นขึ้นอยู่กับอีกเหตุการณ์หนึ่งดังนั้นฉันจึงสามารถสั่งในลำดับที่เพิ่มขึ้นแล้วคำนวณความแตกต่างของเวลา เหตุการณ์ควรจะมีการแจกแจงแบบทวีคูณ แต่เมื่อทำการพล็อตฮิสโตแกรมนี่คือสิ่งที่ฉันได้รับ: ความไม่แน่ชัดของนาฬิกาที่คอมพิวเตอร์ทำให้เกิดเหตุการณ์บางอย่างที่จะได้รับมอบหมายเวลาประทับก่อนหน้าของเหตุการณ์ที่พวกเขาขึ้นอยู่กับ ฉันสงสัยว่าการซิงโครไนซ์นาฬิกาสามารถถูกกล่าวหาได้หรือไม่ว่าจุดสูงสุดของ PDF ไม่เป็น 0 (ว่าพวกเขาเปลี่ยนทุกอย่างไปทางขวา) หรือไม่ หากความแตกต่างของนาฬิกามีการกระจายตามปกติฉันสามารถสมมติว่าเอฟเฟกต์จะชดเชยให้กันและใช้เวลาต่างกันที่คำนวณได้หรือไม่?

2
ความหลากหลายทางชีวภาพเป็นนัยในตัวแปรเด็ดขาดหรือไม่?
ฉันสังเกตว่าในขณะที่ tinkering กับแบบจำลองการถดถอยหลายตัวแปรมีผลกระทบความสัมพันธ์แบบหลายค่าขนาดเล็ก แต่เห็นได้ชัดซึ่งวัดจากปัจจัยเงินเฟ้อความแปรปรวนภายในหมวดหมู่ของตัวแปรเด็ดขาด (หลังจากไม่รวมหมวดหมู่อ้างอิงแน่นอน) ตัวอย่างเช่นสมมติว่าเรามีชุดข้อมูลที่มีตัวแปรต่อเนื่อง y และตัวแปรเด็ดขาดหนึ่งชุด x ซึ่งมีค่า k ที่ไม่เหมือนกันซึ่งเป็นไปได้ เรารหัสผู้ค่าที่เป็นไปตามที่ 0/1 ตัวแปรหุ่นdots, แล้วเราจะเรียกใช้ตัวแบบการถดถอย{k-1} คะแนน VIF สำหรับตัวแปรจำลองกลายเป็นไม่ใช่ศูนย์ ในความเป็นจริงเมื่อจำนวนหมวดหมู่เพิ่มขึ้น VIF ก็เพิ่มขึ้น การจัดกึ่งกลางของตัวแปรจำลองจะไม่เปลี่ยน VIFskkkx1,x2,…,xkx1,x2,…,xkx_1, x_2,\dots ,x_ky=b0+b1x1+b2x2+⋯+bk−1xk−1y=b0+b1x1+b2x2+⋯+bk−1xk−1y = b_0 + b_1x_1 + b_2x_2 + \dots + b_{k-1}x_{k-1}k−1k−1k-1 คำอธิบายที่เข้าใจง่ายดูเหมือนว่าสภาพที่ไม่เกิดร่วมกันของหมวดหมู่ภายในตัวแปรเด็ดขาดนั้นทำให้เกิดความหลากหลายทางสัณฐานวิทยาเล็กน้อย นี่เป็นการค้นพบที่ไม่สำคัญหรือเป็นปัญหาที่ควรพิจารณาเมื่อสร้างแบบจำลองการถดถอยด้วยตัวแปรเชิงหมวดหมู่หรือไม่

2
การประมาณแบบง่ายของการแจกแจงแบบปัวซองในหางยาว?
ฉันต้องการตัดสินใจความจุของตารางเพื่อให้มีราคาต่อรองเหลือน้อยกว่าเพื่อล้นสำหรับโดยสมมติว่าจำนวนรายการตามกฎหมายปัวซองที่กำหนด ความคาดหวังใน{12}]2 - พีพี∈ [ 40 ... 120 ] E ∈ [ 10 3 ... 10 12 ]คCC2- หน้า2−p2^{-p}p ∈ [ 40 … 120 ]p∈[40…120]p\in[40\dots 120]E∈ [ 103… 1012]E∈[103…1012]E\in[10^3\dots 10^{12}] เป็นการดีที่ฉันต้องการจำนวนเต็มต่ำสุดCเช่นที่1-CDF[PoissonDistribution[E],C] < 2^-pได้รับpและE; แต่ฉันพอใจกับบางอย่างที่Cสูงกว่านั้นเล็กน้อย Mathematica นั้นใช้ได้กับการคำนวณแบบแมนนวล แต่ฉันต้องการคำนวณCจากpและEณ เวลารวบรวมซึ่ง จำกัด ฉันเป็นเลขจำนวนเต็ม 64 บิต ปรับปรุง: ใน Mathematica (รุ่น 7) e = 1000; …

3
การเลือกคุณสมบัติโดยใช้ข้อมูลร่วมกันใน Matlab
ฉันกำลังพยายามใช้ความคิดของข้อมูลร่วมกันกับการเลือกคุณสมบัติตามที่อธิบายไว้ในบันทึกการบรรยายเหล่านี้ (หน้า 5) แพลตฟอร์มของฉันคือ Matlab ปัญหาหนึ่งที่ฉันพบเมื่อคำนวณข้อมูลร่วมกันจากข้อมูลเชิงประจักษ์ก็คือจำนวนนั้นจะเอนเอียงเสมอไป ฉันพบไฟล์ประมาณ 3 ~ 4 ไฟล์เพื่อคำนวณ MI บน Matlab Central และพวกเขาทั้งหมดให้จำนวนมาก (เช่น> 0.4) เมื่อฉันป้อนในตัวแปรสุ่มแบบอิสระ ฉันไม่ใช่ผู้เชี่ยวชาญ แต่ปัญหาดูเหมือนว่าถ้าคุณใช้ความหนาแน่นแบบร่วมและส่วนเพิ่มในการคำนวณ MI ระบบจะนำความลำเอียงมาใช้เนื่องจาก MI มีความหมายในเชิงบวก ใครบ้างมีคำแนะนำการปฏิบัติเกี่ยวกับวิธีการประเมินข้อมูลร่วมกันอย่างถูกต้อง? คำถามที่เกี่ยวข้องคือในทางปฏิบัติผู้คนใช้ MI เพื่อเลือกคุณสมบัติอย่างไร ฉันไม่เห็นชัดเจนว่าจะเกิดขึ้นกับค่าเกณฑ์ได้อย่างไรเนื่องจาก MI อยู่ในทฤษฎีที่ไม่มีขอบเขต หรือผู้คนเพียงแค่จัดอันดับคุณสมบัติของ MI และใช้คุณสมบัติ k อันดับต้น ๆ

2
สับสนเกี่ยวกับช่วงความมั่นใจ
ฉันสับสนเกี่ยวกับแนวคิดของช่วงความมั่นใจ โดยเฉพาะสมมติว่ามีตัวแปรเกาส์มีรู้จักและฉันสนใจในขอบเขตล่าง\ mu_Lของค่าเฉลี่ยด้วยระดับความเชื่อมั่น95%σ μ L 95 %X∼N(μ,σ)X∼N(μ,σ)X \sim N(\mu, \sigma)σσ\sigmaμLμL\mu_L95%95%95\% ฉันจะทำทดลองสำหรับ555ครั้งและสังเกตX1X1X_1 , X2X2X_2 , X3X3X_3 , X4X4X_4 , X_5X5X5X_5 ตัวเลือกที่ 1:ผมปฏิบัติแต่ละตัวอย่างแยกกันและผมสามารถคำนวณμL=Xi−σzμL=Xi−σz\mu_L = X_i - \sigma zสำหรับแต่ละx_iXiXiX_iและจากนั้นผมคิดว่ามีวิธีการบางอย่าง (ผมไม่ทราบวิธีการ) ในการคำนวณที่เกิดขึ้นจริงผูกพันลดลงจากนี้ 5 μLμL\mu_L 's ตัวเลือกที่ 2:ในทางกลับกันถ้าผมใช้T=(X1+X2+X3+X4+X5)/5T=(X1+X2+X3+X4+X5)/5T = (X_1+X_2+X_3+X_4+X_5)/5ผมสามารถคำนวณμL=T−σ/5–√zμL=T−σ/5z\mu_L = T - \sigma/\sqrt{5}z Z (สมมติว่าTTTเป็นเรื่องปกติเราสามารถใช้ t-stat ได้เช่นกัน) มีวิธีอื่นนอกเหนือจากตัวเลือกที่ 2 ในการคำนวณขอบเขตล่างตามตัวอย่าง555หรือไม่? และสำหรับตัวเลือกที่ 1 มีวิธีคำนวณขอบเขตล่างโดยคำนวณจากขอบเขตล่าง 5 …

1
ข้อผิดพลาดแบบสุ่มที่สำคัญและผันแปรหรือไม่
ฉันไม่ได้รับความแตกต่างระหว่างrfobject$importanceและimportance(rfobject)ในคอลัมน์ MeanDecreaseAccuracy ตัวอย่าง: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 46.323415 > importance(fit) setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length …

1
แบบจำลองของ P (Y | X) สามารถฝึกผ่านการไล่ระดับสีแบบสุ่มจากตัวอย่างที่ไม่ใช่ iid ของ P (X) และตัวอย่าง iid ของ P (Y | X) ได้หรือไม่?
เมื่อการฝึกอบรมแบบจำลองพารามิเตอร์ (เช่นเพื่อเพิ่มโอกาส) ผ่านการไล่ระดับสีแบบสุ่มในชุดข้อมูลบางอย่างก็มักจะสันนิษฐานว่าตัวอย่างการฝึกอบรมจะถูกดึงออกมาจากการกระจายข้อมูลการฝึกอบรม ดังนั้นหากเป้าหมายคือการสร้างแบบจำลองการแจกแจงร่วมดังนั้นตัวอย่างการฝึกอบรมแต่ละตัวอย่างควรถูกดึงออกมาจากการกระจายนั้น( x i , y i )P( X, วาย)P(X,Y)P(X,Y)( xผม, yผม)(xi,yi)(x_i,y_i) หากเป้าหมายคือการจำลองแบบการแจกแจงแบบมีเงื่อนไขดังนั้นความต้องการของ iid จะเปลี่ยนไปอย่างไรถ้าหากทั้งหมดP( Y| X)P(Y|X)P(Y|X) เราจะต้องดึงตัวอย่างแต่ละตัวอย่าง iid จากการกระจายข้อต่อหรือไม่?( xผม, yผม)(xi,yi)(x_i,y_i) เราควรจะวาด IID จากแล้ววาด IID จาก ? P ( X ) y i P ( Y | X )xผมxix_iP( X)P(X)P(X)Yผมyiy_iP( Y| X)P(Y|X)P(Y|X) เราสามารถวาดไม่ IID จาก (เช่นความสัมพันธ์ในช่วงเวลา) แล้ววาด …

2
ค่าสัมประสิทธิ์การถดถอยแบบโลจิสติกแบบเอ็กซ์โปเนนเชียลแตกต่างจากอัตราต่อรอง
ดังที่ฉันเข้าใจแล้วค่าเบต้าที่ยกกำลังจากการถดถอยโลจิสติกคืออัตราส่วนอัตราต่อรองของตัวแปรนั้นสำหรับตัวแปรตามความสนใจ อย่างไรก็ตามค่าไม่ตรงกับอัตราส่วนอัตราต่อรองที่คำนวณด้วยตนเอง แบบจำลองของฉันกำลังทำนายการสตัน (ตัวชี้วัดการขาดสารอาหาร) โดยใช้ตัวชี้วัดอื่น ๆ ในการประกัน // Odds ratio from LR, being done in stata logit stunting insurance age ... etc. or_insurance = exp(beta_value_insurance) // Odds ratio, manually calculated odds_stunted_insured = num_stunted_ins/num_not_stunted_ins odds_stunted_unins = num_stunted_unins/num_not_stunted_unins odds_ratio = odds_stunted_ins/odds_stunted_unins เหตุผลทางความคิดสำหรับค่าเหล่านี้แตกต่างกันอย่างไร การควบคุมปัจจัยอื่น ๆ ในการถดถอยหรือไม่? เพียงแค่ต้องการที่จะสามารถอธิบายความแตกต่าง

4
การทำให้เป็นมาตรฐานทำให้กระจัดกระจายสำหรับเมทริกซ์สุ่ม
มันเป็นที่รู้จักกันดี (เช่นในด้านการตรวจจับอัด) ที่บรรทัดฐานคือ "sparsity ชักนำ" ในแง่ที่ว่าถ้าเราลดการทำงาน (สำหรับการแก้ไขเมทริกซ์และเวกเตอร์\ vec {ข} ) f_ {หัวใจ , \ vec {b}} (\ vec {x}) = \ | A \ vec {x} - \ vec {b} \ | _2 ^ 2 + \ lambda \ | \ vec {x} \ | _1สำหรับขนาดใหญ่พอ\ แลมบ์ดา> 0เราก็จะมีโอกาสในการเลือกหลาย, \ vec …

1
“ ทฤษฎีขีด จำกัด กลาง” สำหรับผลรวมถ่วงน้ำหนักของตัวแปรสุ่มที่สัมพันธ์กัน
ฉันกำลังอ่านกระดาษซึ่งอ้างว่า (เช่นการแปลงฟูริเยร์แบบไม่ต่อเนื่อง, DFT) โดย CLT มีแนวโน้มที่จะเป็นตัวแปรสุ่ม (ซับซ้อน) gaussian อย่างไรก็ตามฉันรู้ว่านี่ไม่เป็นความจริงโดยทั่วไป หลังจากอ่านอาร์กิวเมนต์ (ผิดพลาด) นี้ฉันค้นหาผ่านเน็ตและพบบทความนี้โดย Peligrad & Wu ปี 2010ที่พวกเขาพิสูจน์ว่าสำหรับกระบวนการคงที่บางคนสามารถพบ "ทฤษฎีบท CLT"X^k= 1ยังไม่มีข้อความ--√Σj = 0ยังไม่มีข้อความ- 1XJอี- ฉัน2 πk j / N,X^k=1ยังไม่มีข้อความΣJ=0ยังไม่มีข้อความ-1XJอี-ผม2πkJ/ยังไม่มีข้อความ,\hat{X}_k=\frac{1}{\sqrt{N}}\sum_{j=0}^{N-1}X_je^{-i2\pi kj/N}, คำถามของฉันคือ: คุณมีการอ้างอิงอื่น ๆ ที่พยายามแก้ไขปัญหาในการค้นหาการ จำกัด การกระจายของ DFT ของลำดับดัชนีที่กำหนด (ทั้งโดยการจำลองหรือทฤษฎี) หรือไม่? ฉันสนใจโดยเฉพาะอย่างยิ่งในอัตราการบรรจบกัน (เช่นความรวดเร็วของ DFT ที่มาบรรจบกัน) เนื่องจากโครงสร้างความแปรปรวนร่วมของในบริบทของการวิเคราะห์อนุกรมเวลาXJXJX_j

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.