สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
การตรวจจับค่าผิดปกติที่แข็งแกร่งในไทม์ทางการเงิน
ฉันกำลังมองหาเทคนิคที่มีประสิทธิภาพในการลบค่าผิดพลาดและข้อผิดพลาด (ไม่ว่าจะเกิดอะไร) จากข้อมูลอนุกรมเวลาการเงิน (เช่น tickdata) ข้อมูลอนุกรมเวลาทางการเงินแบบ Tick-by-tick นั้นยุ่งมาก มันมีช่องว่างขนาดใหญ่ (เวลา) เมื่อการแลกเปลี่ยนถูกปิดและกระโดดอย่างมากเมื่อการแลกเปลี่ยนเปิดขึ้นอีกครั้ง เมื่อการแลกเปลี่ยนเปิดขึ้นปัจจัยทุกชนิดจะแนะนำการซื้อขายในระดับราคาที่ไม่ถูกต้อง (ไม่ได้เกิดขึ้น) และ / หรือไม่ได้เป็นตัวแทนของตลาด (ขัดขวางเนื่องจากการเสนอราคาที่ป้อนไม่ถูกต้องหรือขอราคาตัวอย่าง) บทความนี้โดย tickdata.com (PDF) ทำงานได้ดีในการสรุปปัญหา แต่เสนอวิธีแก้ไขปัญหาที่เป็นรูปธรรมเล็กน้อย เอกสารส่วนใหญ่ที่ฉันสามารถหาได้ทางออนไลน์ที่กล่าวถึงปัญหานี้ก็คือไม่ต้องสนใจ (ติ๊กถูกสันนิษฐานว่าถูกกรอง) หรือรวมการกรองไว้เป็นส่วนหนึ่งของรูปแบบการค้าขนาดใหญ่ซึ่งซ่อนขั้นตอนการกรองที่มีประโยชน์ มีใครตระหนักถึงการทำงานในเชิงลึกมากขึ้นในพื้นที่นี้หรือไม่? อัปเดต: คำถามนี้ดูเหมือนกับพื้นผิว แต่: ซีรี่ส์เวลาทางการเงินคือ (อย่างน้อยก็ที่ระดับเห็บ) ที่ไม่ใช่งวด เอฟเฟ็กต์เปิดเป็นปัญหาใหญ่เพราะคุณไม่สามารถใช้ข้อมูลของวันสุดท้ายเป็นการเริ่มต้นแม้ว่าคุณจะชอบจริงๆ (เพราะไม่เช่นนั้นคุณก็ไม่มีอะไร) เหตุการณ์ภายนอกอาจทำให้การเปิดตัวของวันใหม่แตกต่างกันอย่างมากทั้งในระดับที่แน่นอนและความผันผวนจากวันก่อนหน้า ความถี่ที่ผิดปกติอย่างมากของข้อมูลที่เข้ามา ใกล้เปิดและปิดของวันจำนวนดาต้าพอยน์ / วินาทีสามารถสูงกว่าค่าเฉลี่ย 10 ครั้งในระหว่างวัน คำถามอื่น ๆ ที่เกี่ยวข้องกับข้อมูลตัวอย่างเป็นประจำ "ค่าผิดปกติ" ในข้อมูลทางการเงินแสดงรูปแบบเฉพาะบางอย่างที่สามารถตรวจพบได้ด้วยเทคนิคเฉพาะที่ไม่สามารถใช้ได้ในโดเมนอื่นและฉันกำลังมองหาเทคนิคเฉพาะเหล่านั้น ในกรณีที่รุนแรงมากขึ้น (เช่นเกิดความผิดพลาดของแฟลช) ค่าผิดปกติอาจมีจำนวนมากกว่า 75% …

1
สแตน
ผมจะผ่านเอกสารสแตนซึ่งสามารถดาวน์โหลดได้จากที่นี่ ฉันมีความสนใจเป็นพิเศษในการใช้งานการวินิจฉัยของเจลแมน - รูบิน กระดาษดั้งเดิมGelman & Rubin (1992)กำหนดปัจจัยการลดขนาดที่อาจเกิดขึ้น (PSRF) ดังนี้ Let เป็นฉัน TH โซ่มาร์คอฟชิมและให้มีการรวมMโซ่อิสระตัวอย่าง ให้ˉ Xฉัน⋅เป็นค่าเฉลี่ยจากฉันห่วงโซ่, th และˉ X ⋅ ⋅เป็นค่าเฉลี่ยโดยรวม กำหนด W = 1Xฉัน, 1, … , Xฉัน, NXi,1,…,Xi,NX_{i,1}, \dots , X_{i,N}ผมiiMMMX¯ฉัน⋅X¯i⋅\bar{X}_{i\cdot}ผมiiX¯⋅ ⋅X¯⋅⋅\bar{X}_{\cdot \cdot} ที่ s 2 m =1W= 1MΣm = 1Ms2ม.,W=1M∑m=1Msm2,W = \dfrac{1}{M} \sum_{m=1}^{M} {s^2_m}, และกำหนด B B …


2
การเลือกระหว่าง "สถิติ" โดย Freedman et al. และ "แบบจำลองทางสถิติ: ทฤษฎีและการปฏิบัติ" โดย Freedman
ฉันไม่ใช่นักสถิติ แต่ฉันสนใจสถิติมากและฉันต้องการซื้อหนังสือเพื่อเป็นข้อมูลอ้างอิง ฉันมีหนังสือสองสามเล่มเกี่ยวกับวิชาเฉพาะ (เช่นองค์ประกอบของการเรียนรู้ทางสถิติสำหรับการเรียนรู้ของเครื่องหรือการวิเคราะห์ข้อมูลแบบเบส์สำหรับ ... เอ่อการวิเคราะห์ข้อมูลแบบเบย์ :) ฉันก็กำลังมองหาหนังสือทั่วไปอีกด้วย หนังสือของฟรีแมนมักได้รับการพิจารณาอย่างดีที่นี่: คำแนะนำหนังสือสถิติขั้นสูง คุณจะแนะนำหนังสือเล่มใดสำหรับนักวิทยาศาสตร์ที่ไม่ใช่นักสถิติ? สถิติโดย Freedman, Pisani และ Purves (A) เป็นคำตอบที่เลือกสำหรับคำถามหลังและฉันจะซื้อมัน อย่างไรก็ตามฉันพบเกี่ยวกับแบบจำลองทางสถิติ: ทฤษฎีและการปฏิบัติ (B) หนังสือสองเล่มนั้นคล้ายกัน (สำหรับสิ่งที่ฉันสามารถบอกได้: Amazon จำกัด ฉันไม่ให้อ่าน ToCs แบบเต็ม ... ฉันไม่รู้ว่าทำไม) วันที่เผยแพร่อยู่ใกล้มาก อย่างไรก็ตาม: B มีราคาถูกกว่ามาก ฉันสามารถใช้ A ได้ดังนั้นหาก A ดีกว่า B อย่างชัดเจนฉันยินดีที่จะไปหา A A ยาวกว่า แต่ดูเหมือนว่าบทหลักที่หายไปจาก B นั้นเกี่ยวข้องกับความน่าจะเป็น ฉันไม่ต้องการส่วนนั้นดังนั้นถ้านั่นเป็นความแตกต่างเพียงอย่างเดียวหรือความแตกต่างหลักฉันควรซื้อที่ถูกกว่าและขนส่งได้มากกว่า :) หนังสือเล่มไหนที่คุณอยากแนะนำให้ซื้อ
16 references 

4
ทำไม P (A, B | C) / P (B | C) = P (A | B, C)
ผมเข้าใจP(A∩B)/P(B)=P(A|B)P(A∩B)/P(B)=P(A|B)P(A\cap B)/P(B) = P(A|B) ) เงื่อนไขคือจุดตัดของ A และ B หารด้วยพื้นที่ทั้งหมดของ B แต่ทำไมP(A∩B|C)/P(B|C)=P(A|B∩C)P(A∩B|C)/P(B|C)=P(A|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) ? คุณให้ปรีชาได้ไหม ไม่ควรจะเป็น: P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A\cap B \cap C)/P(B,C) = P(A|B \cap C) ?

2
ฟอเรสต์แบบสุ่มจำเป็นต้องปรับขนาดตัวแปรอินพุตหรือให้อยู่กึ่งกลางหรือไม่
ตัวแปรอินพุตของฉันมีมิติที่แตกต่างกัน ตัวแปรบางตัวเป็นทศนิยมในขณะที่บางส่วนมีหลายร้อย จำเป็นหรือไม่ที่จะจัดกึ่งกลาง (ลบค่าเฉลี่ย) หรือมาตราส่วน (หารด้วยส่วนเบี่ยงเบนมาตรฐาน) ตัวแปรอินพุตเหล่านี้เพื่อทำให้ข้อมูลไม่มีมิติเมื่อใช้ฟอเรสต์แบบสุ่ม

1
มีความสัมพันธ์ใด ๆ ระหว่างความเหมือนโคไซน์ความสัมพันธ์ของแพร์สันและคะแนน z
ฉันสงสัยว่ามีความสัมพันธ์ใด ๆ ระหว่างมาตรการทั้งสามนี้หรือไม่ ฉันไม่สามารถเชื่อมโยงระหว่างพวกเขาได้โดยอ้างถึงคำจำกัดความ (อาจเป็นเพราะฉันยังใหม่กับคำจำกัดความเหล่านี้และฉันมีเวลาค่อนข้างน้อยในการเข้าใจพวกเขา) ฉันรู้ว่าช่วงของความคล้ายคลึงโคไซน์นั้นมีค่าตั้งแต่ 0 - 1 และความสัมพันธ์ของเพียร์สันสามารถอยู่ในช่วงตั้งแต่ -1 ถึง 1 และฉันไม่แน่ใจว่าอยู่ในช่วงของคะแนน z อย่างไรก็ตามฉันไม่ทราบว่าคุณค่าความคล้ายคลึงกันของโคไซน์สามารถบอกอะไรคุณได้บ้างเกี่ยวกับความสัมพันธ์ของเพียร์สันหรือคะแนน z และในทางกลับกัน

2
นิยามลูกบาศก์ธรรมชาติสำหรับการถดถอย
ฉันกำลังเรียนรู้เกี่ยวกับเส้นโค้งจากหนังสือ "องค์ประกอบของการทำเหมืองข้อมูลการเรียนรู้เชิงสถิติการอนุมานและการทำนาย" โดย Hastie et al ฉันพบในหน้า 145 ว่าเส้นโค้งลูกบาศก์ธรรมชาติเป็นเส้นตรงเหนือขอบนอต มีKKKนอตξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_Kในเส้นโค้งและได้รับสิ่งต่อไปนี้เกี่ยวกับเส้นโค้งเช่นนี้ในหนังสือ คำถามที่ 1:เสรีภาพเพิ่มขึ้น 4 องศาอย่างไร ฉันไม่ได้รับส่วนนี้ คำถามที่ 2 : ในคำจำกัดความของเมื่อk = Kแล้วd K ( X ) = 0dk(X)dk(X)d_k(X)k=Kk=Kk=K . ผู้เขียนพยายามทำอะไรในสูตรนี้ สิ่งนี้ช่วยให้แน่ใจได้อย่างไรว่าเส้นโค้งนั้นเป็นเส้นตรงมากกว่านอตขอบdK(X)=00dK(X)=00d_K(X) = \frac 0 0

1
อะไรคือความสำคัญของจำนวนตัวกรองการสนทนาในเครือข่ายแบบ Convolutional
จำนวนของฟิลเตอร์ในชั้นของสังวัตนาถ่ายทอดอย่างไร ตัวเลขนี้มีผลต่อประสิทธิภาพหรือคุณภาพของสถาปัตยกรรมอย่างไร ฉันหมายความว่าเราควรเลือกใช้ตัวกรองจำนวนมากขึ้นหรือไม่ สิ่งที่ดีของพวกเขา? และผู้คนกำหนดจำนวนตัวกรองต่างกันสำหรับเลเยอร์ต่างกันได้อย่างไร ฉันหมายถึงการดูคำถามนี้: วิธีการกำหนดจำนวนผู้ประกอบการ convolutional ใน CNN? คำตอบที่ระบุเลเยอร์ 3 convolution ที่มีจำนวนฟิลเตอร์และขนาดต่างกันอีกครั้งในคำถามนี้: จำนวนแผนที่คุณลักษณะในโครงข่ายประสาทเทียม คุณสามารถดูได้จากภาพที่เรามีตัวกรอง 28 * 28 * 6 สำหรับชั้นแรกและตัวกรอง 10 * 10 * 16 สำหรับชั้นที่สอง พวกเขามากับตัวเลขเหล่านี้ได้อย่างไรนี่ผ่านการลองผิดลองถูกไหม? ขอบคุณล่วงหน้า

2
การตีความช่วงความมั่นใจ
หมายเหตุ: ขออภัยล่วงหน้าหากซ้ำกันฉันไม่พบคิวที่คล้ายกันในการค้นหาของฉัน สมมติว่าเรามีพารามิเตอร์จริง p ช่วงความเชื่อมั่น C (X) เป็น RV ที่มี p พูด 95% ของเวลา ทีนี้สมมติว่าเราสังเกต X และคำนวณ C (X) คำตอบทั่วไปน่าจะเป็นว่ามันไม่ถูกต้องที่จะตีความว่ามี "95% โอกาสที่จะบรรจุ p" เพราะมัน "ไม่หรือไม่มี p" อย่างไรก็ตามสมมติว่าฉันเลือกการ์ดจากด้านบนของสำรับสับและทิ้งมันลง ฉันคิดอย่างถี่ถ้วนว่าความน่าจะเป็นของการ์ดใบนี้จากการเป็นเอซโพดำในฐานะ 1/52 แม้ว่าในความเป็นจริง "มันอาจเป็นหรือไม่ใช่เอซโพดำ" เหตุใดฉันจึงไม่สามารถใช้เหตุผลนี้กับตัวอย่างของช่วงความมั่นใจได้ หรือถ้ามันไม่มีความหมายเลยที่จะพูดถึง "ความน่าจะเป็น" ของการ์ดที่เป็นเอซโพดำเพราะมัน "เป็นหรือไม่ใช่" ฉันจะยังคงวางอัตราต่อรอง 51: 1 ว่ามันไม่ใช่เอซโพดำ มีคำอื่นที่อธิบายข้อมูลนี้หรือไม่? แนวคิดนี้แตกต่างจาก "ความน่าจะเป็น" อย่างไร แก้ไข: อาจจะมีความชัดเจนมากขึ้นจากการตีความความน่าจะเป็นแบบเบย์ถ้าฉันบอกว่าตัวแปรสุ่มมี p 95% ของเวลาเนื่องจากการรับรู้ของตัวแปรสุ่มนั้น (และไม่มีข้อมูลอื่นที่จะมีเงื่อนไข) …

3
จะเลือกจำนวนปัจจัยแฝงที่เหมาะสมที่สุดในการแยกตัวประกอบเมทริกซ์ที่ไม่เป็นลบได้อย่างไร
ได้รับเมทริกซ์ , ไม่ใช่เชิงลบเมทริกซ์ตัวประกอบ (NMF) พบว่าทั้งสองเมทริกซ์ที่ไม่ใช่เชิงลบและ ( คือทุกองค์ประกอบ ) เพื่อเป็นตัวแทนของเมทริกซ์ที่สลายตัวเมื่อ:Vm×nVm×n\mathbf V^{m \times n}Wm×kWm×k\mathbf W^{m \times k}Hk×nHk×n\mathbf H^{k \times n}≥0≥0\ge 0 V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, ตัวอย่างเช่นโดยการกำหนดว่าไม่ใช่ - ลบและลดข้อผิดพลาดในการสร้างใหม่WW\mathbf WHH\mathbf H∥V−WH∥2.‖V−WH‖2.\|\mathbf V-\mathbf W\mathbf H\|^2. มีวิธีปฏิบัติทั่วไปในการประมาณค่าkkkใน NMF หรือไม่ ตัวอย่างเช่นจะใช้การตรวจสอบความถูกต้องไขว้เพื่อจุดประสงค์นั้นได้อย่างไร

3
เมื่อไหร่ที่เราสามารถพูดถึง collinearity
ในตัวแบบเชิงเส้นเราต้องตรวจสอบว่าความสัมพันธ์มีอยู่ในตัวแปรอธิบายหรือไม่ หากพวกเขาสัมพันธ์กันมากเกินไปก็จะมีความเป็นเส้นตรงกัน (นั่นคือตัวแปรอธิบายบางส่วน) ตอนนี้ฉันแค่ดูความสัมพันธ์แบบคู่ระหว่างตัวแปรอธิบายแต่ละอย่าง คำถามที่ 1: อะไรคือการจำแนกความสัมพันธ์มากเกินไป? ตัวอย่างเช่นความสัมพันธ์ของเพียร์สันคือ 0.5 มากเกินไปหรือไม่ คำถามที่ 2: เราสามารถพิจารณาได้อย่างสมบูรณ์ว่ามีค่าความเป็นคู่ระหว่างตัวแปรสองตัวตามค่าสัมประสิทธิ์สหสัมพันธ์หรือไม่หรือขึ้นอยู่กับปัจจัยอื่น ๆ คำถามที่ 3: การตรวจสอบกราฟิกของ Scatterplot ของตัวแปรสองตัวนั้นเพิ่มอะไรลงไปในสิ่งที่สัมประสิทธิ์สหสัมพันธ์บ่งชี้หรือไม่?

3
ทำไมจึงต้องใช้ REML (แทน ML) เพื่อเลือกระหว่างรุ่น var-covar ที่ซ้อนกัน?
คำอธิบายต่าง ๆ เกี่ยวกับการเลือกแบบจำลองที่มีผลต่อการสุ่มของตัวแบบเชิงเส้นผสมแนะนำให้ใช้ REML ฉันรู้ความแตกต่างระหว่าง REML และ ML ในบางระดับ แต่ฉันไม่เข้าใจว่าทำไมควรใช้ REML เพราะ ML นั้นมีความเอนเอียง ตัวอย่างเช่นการใช้ LRT กับพารามิเตอร์ความแปรปรวนของแบบจำลองการแจกแจงแบบปกติโดยใช้ ML นั้นเป็นความผิดหรือไม่? ฉันไม่เข้าใจว่าทำไมการมีความเป็นกลางจึงสำคัญกว่าการเป็น ML ในการเลือกรุ่น ฉันคิดว่าคำตอบที่ดีที่สุดต้องเป็น "เพราะการเลือกแบบจำลองทำงานได้ดีกับ REML มากกว่ากับ ML" แต่ฉันอยากรู้มากกว่านั้นเล็กน้อย ฉันไม่ได้อ่าน derivations ของ LRT และ AIC (ฉันไม่ดีพอที่จะเข้าใจพวกเขาอย่างละเอียด) แต่ถ้าใช้ REML อย่างชัดเจนในการอ้างอิงเพียงแค่รู้ว่ามันจะเพียงพอจริง ๆ (เช่น n <- 100 a <- 10 b <- 1 alpha …

2
เครื่องหมายใดและทำไม:
อนุสัญญาโวหารเหล่านี้เป็นเพียง (ไม่ว่าจะเป็นตัวเอียงหรือไม่ใช่ตัวเอียง) หรือมีความแตกต่างที่สำคัญในความหมายของสัญลักษณ์เหล่านี้หรือไม่ มีข้อความอื่น ๆ ที่มีความหมายว่า " ความน่าจะเป็น " ที่ควรพิจารณาในคำถามนี้หรือไม่


โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.