สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
วิธีแปลงค่าลบเป็นลอการิทึม
ฉันต้องการทราบวิธีแปลงค่าลบให้Log()เป็นเพราะฉันมีข้อมูลแบบเฮเทอโรเซด ฉันอ่านว่ามันใช้งานได้กับสูตรLog(x+1)แต่มันใช้ไม่ได้กับฐานข้อมูลของฉันและฉันได้รับ NaNs อย่างต่อเนื่อง เช่นฉันได้รับข้อความเตือนนี้ (ฉันไม่ได้ใส่ฐานข้อมูลที่สมบูรณ์เพราะฉันคิดว่าหนึ่งในค่าลบของฉันก็เพียงพอที่จะแสดงตัวอย่าง): > log(-1.27+1) [1] NaN Warning message: In log(-1.27 + 1) : NaNs produced > ขอบคุณล่วงหน้า UPDATE: นี่คือฮิสโตแกรมของข้อมูลของฉัน ฉันทำงานกับอนุกรมเวลาของการตรวจวัดสารเคมีในยุค palaeontological เช่นความแตกต่างระหว่างตัวแปรอย่าง Ca และ Zn นั้นใหญ่เกินไปจากนั้นฉันต้องการมาตรฐานข้อมูลบางประเภทนั่นคือเหตุผลที่ฉันกำลังทดสอบlog()ฟังก์ชั่น นี่คือข้อมูลดิบของฉัน
12 r  logarithm 

1
ทำไมคนไม่ใช้ RBF หรือ RBF ที่ลึกกว่าร่วมกับ MLP
ดังนั้นเมื่อดู Radial Basis Function Neural Networks ฉันสังเกตว่าผู้คนเคยแนะนำให้ใช้เลเยอร์ที่ซ่อนอยู่เพียง 1 เลเยอร์เท่านั้นในขณะที่เครือข่ายนิวรัลเพอร์เซปตรอนแบบหลายชั้นจะถือว่าดีกว่า ระบุว่าเครือข่าย RBF สามารถฝึกอบรมกับรุ่นของการเผยแพร่กลับมีเหตุผลใดที่เครือข่าย RBF ที่ลึกกว่าจะไม่ทำงานหรือว่าเลเยอร์ RBF ไม่สามารถใช้เป็นเลเยอร์สุดท้ายหรือเลเยอร์สุดท้ายในเครือข่าย MLP ลึก (ฉันคิดว่าเลเยอร์สุดท้ายเพื่อให้สามารถฝึกอบรมคุณลักษณะที่เรียนโดยเลเยอร์ MLP ก่อนหน้านี้)

2
การโยนเหรียญเป็นวิธีที่ยุติธรรมในการสุ่มกลุ่มเป็นสองกลุ่มหรือไม่?
ดังนั้นตัวฉันและลุงของฉันจึงโต้เถียงกันว่าการพลิกเหรียญเป็นการสุ่มอย่างแท้จริงหรือไม่ ฉันโต้เถียงมันไม่ใช่เพราะในความเป็นจริงเหรียญ tosser มักจะจัดการเหรียญดังนั้นผลไม่ใช่ 50/50 ดังนั้นจึงไม่ใช่ทางเลือกที่ดีสำหรับเทคนิคการสุ่มสำหรับการมอบหมายกลุ่มในการทดลองทางคลินิก อย่างไรก็ตามเขาระบุว่ามันเป็นความไม่สมบูรณ์แบบนาทีในการโยนเหรียญที่สร้างแบบแผน ดังนั้นเขาจึงตั้งสมมติฐานเครื่องจักรที่จะสามารถโยนเหรียญที่ยุติธรรมได้ตลอดกาลและวางมันไว้บนหัวและพูดตามตรงฉันก็แค่ต้องการใครสักคนมาโต้แย้งเรื่องนี้กับฉัน การโยนเหรียญเป็นวิธีที่ยุติธรรมในการสุ่มกลุ่มเป็นสองกลุ่มหรือไม่?

1
การแยกคำหลักอัตโนมัติ: ใช้ความคล้ายคลึงโคไซน์เป็นคุณสมบัติ
ฉันมีเมทริกซ์เอกสารและตอนนี้ฉันต้องการแยกคำหลักสำหรับแต่ละเอกสารด้วยวิธีการเรียนรู้ภายใต้การดูแล (SVM, Naive Bayes, ... ) ในรุ่นนี้ฉันใช้แท็ก Tf-idf, Pos tag, ...MMM แต่ตอนนี้ฉันสงสัยเกี่ยวกับเน็กซ์ ฉันมีเมทริกซ์มีความเหมือนโคไซน์ระหว่างคำCCC มีความเป็นไปได้ไหมที่จะใช้ความคล้ายคลึงกันนี้เป็นคุณสมบัติสำหรับโมเดลของฉัน? ผมคิดว่าสำหรับระยะในเอกสาร , การใช้ค่าเฉลี่ยของความคล้ายคลึงกันโคไซน์ของข้อความทั้งหมดในเอกสารที่มีระยะเวลาฉันสิ่งนี้มีประโยชน์หรือไม่?iiiddddddiii

1
เมื่อใดที่ฉันควรกังวลเกี่ยวกับ Jeffreys-Lindley บุคคลที่ผิดธรรมดาในตัวเลือกแบบจำลอง Bayesian
ฉันกำลังพิจารณาที่มีขนาดใหญ่ ( แต่ จำกัด ) พื้นที่ของรูปแบบที่แตกต่างกันของความซับซ้อนซึ่งผมสำรวจโดยใช้RJMCMC ก่อนหน้าเกี่ยวกับเวกเตอร์พารามิเตอร์สำหรับแต่ละรุ่นมีข้อมูลค่อนข้าง ในกรณีใด (ถ้ามี) ฉันควรกังวลเกี่ยวกับJeffreys-Lindley บุคคลที่ผิดธรรมดานิยมรุ่นที่ง่ายกว่าเมื่อหนึ่งในแบบจำลองที่ซับซ้อนมากขึ้นจะเหมาะสมกว่าหรือไม่ มีตัวอย่างง่ายๆที่เน้นปัญหาของความขัดแย้งในการเลือกตัวแบบเบย์หรือไม่? ฉันได้อ่านบทความไม่กี่ฉบับนั่นคือบล็อกของซีอานและบล็อกของแอนดรูเจลแมนแต่ฉันยังไม่เข้าใจปัญหามากนัก

1
วิธีการตีความความสูงของพล็อตความหนาแน่น
ฉันจะตีความความสูงของแปลงความหนาแน่นได้อย่างไร: ตัวอย่างเช่นในพล็อตข้างต้นจุดสูงสุดอยู่ที่ประมาณ 0.07 ที่ x = 18 ฉันสามารถสรุปได้ว่าประมาณ 7% ของค่าประมาณ 18? ฉันจะเจาะจงมากกว่านี้ได้ไหม? นอกจากนี้ยังมีจุดสูงสุดที่สองที่ x = 30 ที่มีความสูง 0.02 นั่นหมายความว่าประมาณ 2% ของค่าประมาณ 30? แก้ไข: คำถามเกี่ยวกับค่าการแจกแจงความน่าจะเป็นที่เกิน 1 นั้นเป็นไปได้ไหมกล่าวถึงค่าความน่าจะเป็น> 1 ซึ่งไม่ใช่ปัญหาเลย นอกจากนี้ยังกล่าวถึงความสัมพันธ์ที่ไร้เดียงสากับ Bayes classfier ซึ่งไม่ใช่จุดที่นี่ ฉันต้องการมีการอนุมานเชิงตัวเลขที่เราสามารถวาดจากเส้นโค้งความหนาแน่นเช่นในภาษาที่เรียบง่าย มีการกล่าวถึงบทบาทของพื้นที่ภายใต้เส้นโค้ง แต่คำถามของฉันคือสิ่งที่เราสามารถอนุมานได้โดยเฉพาะเกี่ยวกับชุดค่าผสม x และ y เฉพาะที่มีอยู่บนเส้นโค้ง ตัวอย่างเช่นเราจะเชื่อมโยง x = 30 และ y = 0.02 บนกราฟนี้ได้อย่างไร เราสามารถเขียนข้อความอะไรเกี่ยวกับความสัมพันธ์ระหว่าง 30 …

2
เหตุใดจึงใช้ n-gram ในการระบุภาษาข้อความแทนที่จะเป็นคำ?
ในไลบรารีการระบุภาษาที่ได้รับความนิยมสองเครื่อง Compact Language Detector 2 สำหรับ C ++ และเครื่องตรวจจับภาษาสำหรับ Java ทั้งคู่ใช้ (ตามอักขระ) n-grams เพื่อแยกคุณลักษณะข้อความ ทำไมไม่ใช้ถุงแบบคำ (คำเดียว / พจนานุกรม) และข้อดีและข้อเสียของถุงแบบคำและ n-g คืออะไร นอกจากนี้การใช้แบบจำลอง n-grams อื่น ๆ ในการจำแนกข้อความมีประโยชน์อะไรบ้าง? โอ้โห ดูเหมือนว่ามีคำถามที่คล้ายกันที่นี่: เกี่ยวกับการใช้แบบจำลอง Bigram (N-Gram) เพื่อสร้างเวกเตอร์คุณลักษณะสำหรับเอกสารข้อความ แต่ใครบางคนสามารถให้คำตอบที่ครอบคลุมมากขึ้น? ในกรณีที่มีการระบุภาษาดีกว่า (หวังว่าฉันจะได้ความหมายของ n-gg และถุงของคำถูกต้องฮ่าฮ่าถ้าไม่ได้โปรดช่วยฉันด้วย)

3
เกี่ยวกับการลู่เข้าในความน่าจะเป็น
ปล่อยเป็นลำดับของตัวแปรสุ่ม stในความเป็นไปได้โดยที่เป็นค่าคงที่คงที่ ฉันพยายามที่จะแสดงต่อไปนี้: และ ทั้งคู่ในความน่าจะเป็น ฉันมาที่นี่เพื่อดูว่าตรรกะของฉันเป็นเสียงหรือไม่ นี่คืองานของฉัน{Xn}n≥1{Xn}n≥1\{X_n\}_{n\geq 1}Xn→aXn→aX_n \to aa&gt;0a&gt;0a>0Xn−−−√→a−−√Xn→a\sqrt{X_n} \to \sqrt{a}aXn→1aXn→1\frac{a}{X_n}\to 1 พยายาม สำหรับส่วนแรกเรามี สังเกตว่า หลังจากนั้น |Xn−−−√−a−−√|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn−−−√+a−−√|=ϵ|(Xn−−−√−sqrta)+2a−−√||Xn−a|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn+a|=ϵ|(Xn−sqrta)+2a||\sqrt{X_n}-\sqrt{a}|<\epsilon \impliedby |X_n-a|<\epsilon|\sqrt{X_n}+\sqrt{a}|=\epsilon|(\sqrt{X_n}-sqrt{a})+2\sqrt{a}| ≤ϵ|Xn−−−√−a−−√|+2ϵa−−√&lt;ϵ2+2ϵa−−√≤ϵ|Xn−a|+2ϵa&lt;ϵ2+2ϵa\leq \epsilon|\sqrt{X_n}-\sqrt{a}|+2\epsilon\sqrt{a}<\epsilon^2+2\epsilon\sqrt{a}ϵ2+2ϵa−−√&gt;ϵa−−√ϵ2+2ϵa&gt;ϵa\epsilon^2+2\epsilon\sqrt{a}>\epsilon\sqrt{a}P(|Xn−−−√−a−−√|≤ϵ)≥P(|Xn−a|≤ϵa−−√)→1asn→∞P(|Xn−a|≤ϵ)≥P(|Xn−a|≤ϵa)→1asn→∞P(|\sqrt{X_n}-\sqrt{a}|\leq \epsilon)\geq P(|X_n-a|\leq \epsilon\sqrt{a})\to 1 \;\;as\;n\to\infty ⟹Xn−−−√→a−−√inprobability⟹Xn→ainprobability\implies \sqrt{X_n}\to\sqrt{a} \;\;in\;probability สำหรับส่วนที่สองเรามี ตอนนี้เนื่องจากเป็นเรามีเป็นลำดับล้อมรอบ ในคำอื่น ๆ ที่มีอยู่เป็นจำนวนจริง STM ดังนั้น ดูที่ความน่าจะเป็นเรามี |aXn−1|=|Xn−aXn|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn||aXn−1|=|Xn−aXn|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn||\frac{a}{X_n}-1|=|\frac{X_n-a}{X_n}|<\epsilon \impliedby |X_n-a|<\epsilon|X_n|Xn→aXn→aX_n \to an→∞n→∞n \to \inftyXnXnX_nM&lt;∞M&lt;∞M<\infty|Xn|≤M|Xn|≤M|X_n|\leq M|Xn−a|&lt;ϵ|Xn|⟸|Xn−a|&lt;ϵM|Xn−a|&lt;ϵ|Xn|⟸|Xn−a|&lt;ϵM|X_n-a|<\epsilon|X_n|\impliedby |X_n-a|<\epsilon MP(|aXn−1|&gt;ϵ)=P(|Xn−a|&gt;ϵ|Xn|)≤P(|Xn−a|&gt;ϵM)→0asn→∞P(|aXn−1|&gt;ϵ)=P(|Xn−a|&gt;ϵ|Xn|)≤P(|Xn−a|&gt;ϵM)→0asn→∞P(|\frac{a}{X_n}-1|>\epsilon)=P(|X_n-a|>\epsilon|X_n|)\leq P(|X_n-a|>\epsilon M)\to …

1
การกระจายผลิตภัณฑ์โดยประมาณของ N iid ปกติ? กรณีพิเศษμ≈0
รับ iid X n ≈ N ( μ X , σ 2 X ) , และμ X ≈ 0 , ค้นหา:ยังไม่มีข้อความ≥ 30N≥30N\geq30Xn≈ N( μX, σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈ 0μX≈0\mu_X \approx 0 การประมาณการแจกแจงแบบฟอร์มปิดที่แม่นยำของ Yยังไม่มีข้อความ= ∏1ยังไม่มีข้อความXnYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} asymptotic ( exponential ?) การประมาณของผลิตภัณฑ์เดียวกัน นี้เป็นกรณีพิเศษของขึ้นคำถามทั่วไปμX≈ 0μX≈0\mu_X \approx 0

1
อะไรคือชื่อของวิธีการประมาณความหนาแน่นที่คู่ที่เป็นไปได้ทั้งหมดถูกใช้เพื่อสร้างการกระจายแบบผสมปกติ?
ฉันแค่คิดถึงวิธีที่เป็นระเบียบเรียบร้อย (ไม่จำเป็นต้องดี) ในการสร้างความหนาแน่นมิติหนึ่งและคำถามของฉันคือ: วิธีการประมาณความหนาแน่นนี้มีชื่อหรือไม่? ถ้าไม่ใช่มันเป็นกรณีพิเศษของวิธีอื่นในวรรณคดีหรือไม่? นี่คือวิธีการที่เรามีเวกเตอร์ซึ่งเราสันนิษฐานว่ามาจากการแจกแจงที่ไม่รู้จักที่เราต้องการประเมิน วิธีการทำเช่นนี้คือการใช้ค่าที่เป็นไปได้ทั้งหมดในXและสำหรับแต่ละคู่[ x i , x j ] i ≠ jเหมาะสมกับการแจกแจงแบบปกติโดยใช้โอกาสสูงสุด การประมาณความหนาแน่นของผลลัพธ์คือการกระจายตัวของส่วนผสมที่ประกอบด้วย Normals ที่ได้ทั้งหมดซึ่งแต่ละ Normal จะได้รับน้ำหนักเท่ากันX= [ x1, x2, . . . , xn]X=[x1,x2,...,xn]X = [x_1,x_2,...,x_n]XXX[ xผม, xJ]ฉัน≠ j[xi,xj]i≠j[x_i,x_j]_{i \neq j} รูปด้านล่างแสดงให้เห็นถึงการใช้วิธีนี้ในเวกเตอร์ ] ที่นี่วงกลมคือ datapoints, Normals สีคือการแจกแจงความน่าจะเป็นสูงสุดที่ประมาณโดยใช้แต่ละคู่ที่เป็นไปได้และเส้นสีดำหนาแสดงการประมาณความหนาแน่นที่เกิดขึ้น (นั่นคือการกระจายตัวของผสม)[ - 1.3 , 0.15 , 0.73 , …

1
ความแปรปรวนของโคเฮนสถิติ
Cohen'sเป็นหนึ่งในวิธีการทั่วไปที่เราวัดขนาดของเอฟเฟกต์ ( ดู Wikipedia ) มันวัดระยะห่างระหว่างสองวิธีในแง่ของค่าเบี่ยงเบนมาตรฐานที่รวมเข้าด้วยกัน เราจะได้สูตรทางคณิตศาสตร์ของการประมาณค่าความแปรปรวนของ Cohen'sอย่างไร dddddd ธันวาคม 2015 แก้ไข:ที่เกี่ยวข้องกับคำถามนี้เป็นความคิดของการคำนวณช่วงความเชื่อมั่นทั่วdบทความนี้กล่าวว่าddd σ2d=n+n×+d22n+σd2=n+n×+d22n+\sigma_{d}^2 = \dfrac{n_{+}}{n_{\times}} + \dfrac{d^2}{2n_{+}} โดยที่คือผลรวมของขนาดตัวอย่างสองขนาดและเป็นผลิตภัณฑ์ของขนาดตัวอย่างสองขนาด n ×n+n+n_{+}n×n×n_{\times} สูตรนี้มีวิธีมาอย่างไร

2
ข้อดีของการใช้เครือข่ายประสาทแบบเบย์คืออะไร
เมื่อเร็ว ๆ นี้ฉันอ่านบทความเกี่ยวกับโครงข่ายประสาท Bayesian (BNN) [Neal, 1992] , [Neal, 2012]ซึ่งให้ความน่าจะเป็นความสัมพันธ์ระหว่างอินพุตและเอาต์พุตในเครือข่ายประสาท การฝึกอบรมเช่นโครงข่ายประสาทเทียมคือผ่าน MCMC ซึ่งแตกต่างจากอัลกอริธึมการขยายพันธุ์แบบเดิม คำถามของฉันคืออะไรประโยชน์ของการใช้เครือข่ายประสาทดังกล่าวคืออะไร? โดยเฉพาะคุณสามารถให้ตัวอย่างที่เหมาะสมกับ BNN มากกว่า NN หรือไม่?

2
วิธีการคำนวณน้ำหนักเกณฑ์ฟิชเชอร์
ฉันกำลังศึกษาการจดจำรูปแบบและการเรียนรู้ของเครื่องและฉันพบคำถามต่อไปนี้ พิจารณาปัญหาการจำแนกประเภทสองระดับที่มีความน่าจะเป็นคลาสก่อนหน้าเท่ากับP(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} และการแจกแจงอินสแตนซ์ในแต่ละคลาสที่กำหนดโดย p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 \end{bmatrix}, \begin{bmatrix} 2 & 0 \\ 0 & 1 \end{bmatrix} \right), p(x|D2)=N([44],[1001]).p(x|D2)=N([44],[1001]). p(x|D_2)= {\cal N} \left( \begin{bmatrix} 4 \\ 4 \end{bmatrix}, \begin{bmatrix} 1 & 0 \\ 0 & 1 \end{bmatrix} \right). วิธีการคำนวณน้ำหนักเกณฑ์ฟิชเชอร์ อัปเดต 2:น้ำหนักที่คำนวณได้จากหนังสือของฉันคือ: W=[−43−29]W=[−43−29]W=\begin{bmatrix} \frac{-4}{3} \\ \frac{-2}{9} …

3
การหาปริมาณความคล้ายคลึงกันระหว่างชุดข้อมูลสองชุด
สรุป : การพยายามค้นหาวิธีที่ดีที่สุดสรุปความคล้ายคลึงกันระหว่างชุดข้อมูลสองชุดโดยใช้ค่าเดียว รายละเอียด : คำถามของฉันอธิบายได้ดีที่สุดด้วยแผนภาพ กราฟด้านล่างแสดงสองชุดข้อมูลที่แตกต่างกันแต่ละคนมีค่าที่มีป้ายกำกับและnf nrจุดตามแกน x เป็นตัวแทนของการวัดและค่าบนแกน y เป็นค่าที่วัดได้ สำหรับกราฟแต่ละอันฉันต้องการตัวเลขเดียวเพื่อสรุปความคล้ายคลึงกันnfและnrค่าของแต่ละจุดการวัด ในตัวอย่างนี้เห็นได้อย่างชัดเจนว่าผลลัพธ์ในกราฟแรกนั้นน้อยกว่าผลลัพธ์ในกราฟที่สอง แต่ฉันมีข้อมูลอื่นมากมายที่ความแตกต่างนั้นชัดเจนน้อยกว่าดังนั้นการจัดอันดับปริมาณนี้จะเป็นประโยชน์ ฉันคิดว่าอาจมีเทคนิคมาตรฐานที่ใช้โดยทั่วไป การค้นหาความคล้ายคลึงกันทางสถิติให้ผลลัพธ์ที่แตกต่างกันมากมาย แต่ฉันไม่แน่ใจว่าสิ่งที่ดีที่สุดที่จะเลือกหรือถ้าสิ่งที่ฉันพร้อมนำไปใช้กับปัญหาของฉัน ดังนั้นฉันคิดว่าคำถามนี้อาจคุ้มค่าที่จะถามที่นี่ในกรณีที่มีคำตอบง่ายๆ

3
เหตุใดการเพิ่มประสิทธิภาพจึงมีความอ่อนไหวต่อค่าผิดปกติ
ฉันพบบทความจำนวนมากที่ระบุว่าวิธีการส่งเสริมมีความอ่อนไหวต่อค่าผิดปกติ แต่ไม่มีบทความอธิบายว่าเพราะเหตุใด ในค่าประสบการณ์ของฉันไม่ดีสำหรับอัลกอริทึมการเรียนรู้ของเครื่อง แต่ทำไมวิธีการเพิ่มประสิทธิภาพจึงมีความอ่อนไหวเป็นพิเศษ อัลกอริธึมต่อไปนี้จะจัดอันดับในแง่ของความไวต่อค่าผิดปกติ: boost-tree, ป่าสุ่ม, เครือข่ายประสาท, SVM และวิธีการถดถอยแบบง่ายเช่นการถดถอยแบบโลจิสติกอย่างไร

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.