สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

3
จะสร้างค่าที่กระจายอย่างสม่ำเสมอในช่วงเวลาได้อย่างมีประสิทธิภาพได้อย่างไร
(a, b)สมมติว่าผมต้องการที่จะสร้างชุดของตัวเลขสุ่มจากช่วงเวลาที่ ลำดับที่สร้างควรมีคุณสมบัติที่เรียงลำดับด้วย ฉันสามารถนึกถึงสองวิธีในการบรรลุเป้าหมายนี้ อนุญาตnเป็นความยาวของลำดับที่จะสร้าง อัลกอริทึมที่ 1: Let `offset = floor((b - a) / n)` for i = 1 up to n: generate a random number r_i from (a, a+offset) a = a + offset add r_i to the sequence r อัลกอริทึมที่ 2: for i = 1 up to n: …

2
pdf ของผลิตภัณฑ์ของตัวแปรสุ่มแบบอิสระทั้งสองชุด
ให้ ~และ ~เป็นสองตัวแปรสุ่มอิสระพร้อมการแจกแจงที่กำหนด การกระจายของคืออะไร?XXXยู( 0 , 2 )U(0,2)U(0,2)YYYยู( - 10 , 10 )U(−10,10)U(-10,10)V= XYV=XYV=XY ฉันได้ลองทำข้อตกลงโดยรู้ว่า h ( v ) = ∫Y= + ∞Y= - ∞1YฉY(y) fX( vY) dYh(v)=∫y=−∞y=+∞1yfY(y)fX(vy)dyh(v) = \int_{y=-\infty}^{y=+\infty}\frac{1}{y}f_Y(y) f_X\left (\frac{v}{y} \right ) dy นอกจากนี้เรายังรู้ว่า , ฉY( y) = 120fY(y)=120f_Y(y) = \frac{1}{20} h(v)=1h ( v ) = 120∫Y= 10Y= …

2
อะไรคือความแตกต่างระหว่างแบบผสมผลกระทบและแบบจำลองการถดถอยเชิงเส้น?
ใครช่วยอธิบายความแตกต่างระหว่างแบบผสมและการวิเคราะห์การถดถอยเชิงเส้นได้ไหม (ฉันมีความรู้เกี่ยวกับสถิติที่ จำกัด มาก)

2
มัน“ โอเค” ที่จะลงจุดเส้นถดถอยสำหรับข้อมูลอันดับ (Spearman correlation) หรือไม่?
ฉันมีข้อมูลที่ฉันคำนวณความสัมพันธ์ Spearman และต้องการเห็นภาพสำหรับสิ่งพิมพ์ ตัวแปรที่ขึ้นอยู่กับการจัดอันดับตัวแปรอิสระไม่ได้ สิ่งที่ฉันต้องการเห็นภาพนั้นเป็นแนวโน้มทั่วไปมากกว่าความชันจริงดังนั้นฉันจึงจัดอันดับความเป็นอิสระและใช้ความสัมพันธ์ / การถดถอยของสเปียร์แมน แต่เมื่อฉันวางแผนข้อมูลของฉันและกำลังจะแทรกลงในต้นฉบับของฉันฉันสะดุดกับคำสั่งนี้ (บนเว็บไซต์นี้ ): คุณจะแทบไม่เคยใช้เส้นถดถอยสำหรับคำอธิบายหรือทำนายอย่างใดอย่างหนึ่งเมื่อคุณทำสเปียร์แมนยศสัมพันธ์ดังนั้นไม่คำนวณเทียบเท่าของสายการถดถอย และหลังจากนั้น คุณสามารถสร้างกราฟข้อมูลความสัมพันธ์อันดับ Spearman ในลักษณะเดียวกับการถดถอยเชิงเส้นหรือสหสัมพันธ์ อย่าใส่เส้นถดถอยบนกราฟอย่างไรก็ตาม; มันจะทำให้เข้าใจผิดที่จะวางเส้นถดถอยเชิงเส้นบนกราฟเมื่อคุณวิเคราะห์ด้วยความสัมพันธ์อันดับ ประเด็นก็คือเส้นการถดถอยนั้นไม่แตกต่างจากตอนที่ฉันไม่ได้จัดอันดับความเป็นอิสระและคำนวณสหสัมพันธ์ของเพียร์สัน แนวโน้มเหมือนกัน แต่เนื่องจากค่าธรรมเนียมที่สูงเกินไปสำหรับกราฟิกสีในสมุดรายวันที่ฉันไปด้วยการแสดงเอกรงค์และจุดข้อมูลที่แท้จริงจะทับซ้อนกันมากจนไม่เป็นที่รู้จัก แน่นอนว่าฉันสามารถหลีกเลี่ยงปัญหานี้ได้ด้วยการทำแปลงสองแบบ: แบบหนึ่งสำหรับจุดข้อมูล (อันดับ) และอีกแบบสำหรับเส้นการถดถอย (ไม่จัดอันดับ) แต่ถ้าปรากฎว่าแหล่งข้อมูลที่ฉันอ้างนั้นผิดหรือปัญหา ไม่เป็นปัญหาในกรณีของฉันมันจะทำให้ชีวิตของฉันง่ายขึ้น (ฉันเห็นคำถามนี้ด้วย แต่ก็ไม่ได้ช่วยฉัน) แก้ไขสำหรับข้อมูลเพิ่มเติม: ตัวแปรอิสระบนแกน x แสดงถึงจำนวนของคุณสมบัติและตัวแปรที่ขึ้นต่อกันบนแกน y แสดงถึงอันดับหากอัลกอริทึมการจำแนกประเภทเมื่อเปรียบเทียบกับประสิทธิภาพของพวกเขา ตอนนี้ฉันมีอัลกอริธึมที่เทียบเคียงได้โดยเฉลี่ย แต่สิ่งที่ฉันอยากจะพูดกับพล็อตของฉันก็คือ: "ในขณะที่ตัวแยกประเภท A ได้รับฟีเจอร์ที่ดีกว่ายิ่งมีฟีเจอร์ตัวแยกประเภท B จะดีกว่า แก้ไข 2 เพื่อรวมแปลงของฉัน: อันดับของอัลกอริทึมถูกพล็อตเมื่อเทียบกับจำนวนฟีเจอร์ อันดับของอัลกอริทึมที่ถูกจับคู่กับจำนวนอันดับของฟีเจอร์ ดังนั้นเพื่อทำซ้ำคำถามจากชื่อ: การลงจุดเส้นถดถอยสำหรับข้อมูลอันดับของ Spearman …

4
หนังสือเรียนเสริมการเรียนรู้
ฉันกำลังมองหาหนังสือเรียน / บันทึกการบรรยายในการเสริมแรงการเรียนรู้ ฉันชอบ"รู้เบื้องต้นเกี่ยวกับสถิติการเรียนรู้"แต่น่าเสียดายที่พวกเขาไม่ครอบคลุมหัวข้อนี้ ฉันรู้ว่าหนังสือของ Sutton และ Bartoเป็นหนังสืออ้างอิงมาตรฐานและบางทีNDPก็ดีเช่นกัน แต่พวกเขาก็ลงวันที่ 1997-98 และฉันหวังว่าจะพบงานนิทรรศการที่ทันสมัยมากขึ้นเนื่องจากสาขานี้น่าจะมีการพัฒนาค่อนข้างเร็ว เวลา.

3
คำอธิบายของสูตรสำหรับค่ามัธยฐานที่ใกล้ที่สุดถึงจุดกำเนิดของตัวอย่าง N จากลูกบอลหน่วย
ในองค์ประกอบของการเรียนรู้ทางสถิติมีการนำเสนอปัญหาเพื่อเน้นประเด็นที่มี k-nn ในพื้นที่มิติสูง มีจุดข้อมูลจุดที่กระจายอย่างสม่ำเสมอในบอลหน่วย -dimensionalหน้าNNNppp ระยะทางเฉลี่ยจากแหล่งกำเนิดถึงจุดข้อมูลที่ใกล้เคียงที่สุดจะได้รับจากการแสดงออก: d(p,N)=(1−(12)1N)1pd(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} เมื่อสูตรแบ่งครึ่งรัศมีของลูกบอลออกไปและฉันเห็นว่าจุดที่ใกล้ที่สุดเข้ามาใกล้เส้นขอบเป็นจึงทำให้สัญชาตญาณหลัง knn สลายตัวในมิติสูง แต่ฉันไม่สามารถเข้าใจได้ว่าทำไมสูตรนี้จึงขึ้นอยู่กับเอ็นp → ∞N=1N=1N=1p→∞p→∞p \rightarrow \infty หนังสือเล่มนี้กล่าวถึงปัญหานี้เพิ่มเติมโดยระบุว่า: "... การทำนายนั้นยากกว่าใกล้ขอบของตัวอย่างการฝึกอบรมเราต้องคาดการณ์จากจุดตัวอย่างที่อยู่ใกล้เคียงแทนการสอดแทรกระหว่างพวกเขา" ดูเหมือนว่าจะเป็นข้อความที่ลึกซึ้ง แต่ฉันไม่สามารถเข้าใจความหมายของมันได้ ทุกคนสามารถพูดคำซ้ำ?

2
อัลกอริทึมการเรียนรู้ของเครื่องสำหรับข้อมูลพาเนล
ในคำถามนี้ - มีวิธีการสร้างต้นไม้การตัดสินใจที่คำนึงถึงตัวทำนายที่มีโครงสร้าง / ลำดับชั้น / หลายระดับหรือไม่? - พวกเขาพูดถึงวิธีการข้อมูลแผงสำหรับต้นไม้ มีวิธีข้อมูลพาเนลเฉพาะสำหรับการสนับสนุน Vector Machines และ Neural Networks หรือไม่? ถ้าเป็นเช่นนั้นคุณสามารถอ้างอิงเอกสารสำหรับอัลกอริทึมและ (ถ้ามี) แพ็คเกจ R ที่ใช้งานได้หรือไม่

2
ความเข้าใจเกี่ยวกับค่า p ในการถดถอยเชิงเส้นหลายครั้ง
เกี่ยวกับค่า p ของการวิเคราะห์การถดถอยเชิงเส้นแบบหลายส่วนการแนะนำจากเว็บไซต์ของ Minitabจะแสดงอยู่ด้านล่าง p-value สำหรับแต่ละเทอมทดสอบสมมติฐานว่างว่าสัมประสิทธิ์เท่ากับศูนย์ (ไม่มีผล) ค่า p ต่ำ (<0.05) แสดงว่าคุณสามารถปฏิเสธสมมติฐานว่างได้ กล่าวอีกนัยหนึ่งตัวทำนายที่มีค่า p ต่ำน่าจะเป็นส่วนเสริมที่มีความหมายกับโมเดลของคุณเนื่องจากการเปลี่ยนแปลงค่าของตัวทำนายเกี่ยวข้องกับการเปลี่ยนแปลงในตัวแปรตอบกลับ ตัวอย่างเช่นผมมีรูปแบบอัตราดอกเบี้ย MLR ผลลัพธ์เป็น 14.48 และเอาออกแสดงอยู่ด้านล่าง จากนั้นyสามารถคำนวณได้โดยใช้สมการนี้y=0.46753X1−0.2668X2+1.6193X3+4.5424X4+14.48y=0.46753X1−0.2668X2+1.6193X3+4.5424X4+14.48 y=0.46753{{X}_{1}}-0.2668{{X}_{2}}+1.6193{{X}_{3}}+4.5424{{X}_{4}}+14.48 yyy Estimate SE tStat pValue ________ ______ _________ _________ (Intercept) 14.48 5.0127 2.8886 0.0097836 x1 0.46753 1.2824 0.36458 0.71967 x2 -0.2668 3.3352 -0.079995 0.93712 x3 1.6193 9.0581 0.17877 …

2
การกระจายความน่าจะเป็นสำหรับคลื่นไซน์ที่มีเสียงดัง
ฉันต้องการวิเคราะห์การกระจายความน่าจะเป็นของจุดสุ่มตัวอย่างจากฟังก์ชันการแกว่งเมื่อมีข้อผิดพลาดในการวัด ฉันได้คำนวณการแจกแจงความน่าจะเป็นสำหรับส่วน "ไม่มีเสียง" แล้ว (ฉันจะใส่ท้ายนี้) แต่ฉันไม่สามารถหาวิธีรวม "เสียง" ได้ การประมาณเชิงตัวเลข เพื่อให้ชัดเจนยิ่งขึ้นลองจินตนาการว่ามีฟังก์ชั่นซึ่งคุณสุ่มเลือกคะแนนจากในรอบเดียว หากคุณได้รับคะแนนในฮิสโตแกรมคุณจะได้รับบางสิ่งที่เกี่ยวข้องกับการแจกแจงy(x)=sin(x)y(x)=sin⁡(x)y(x) = \sin(x) ไม่มีเสียงดังรบกวน ตัวอย่างเช่นนี่คือและฮิสโตแกรมที่เกี่ยวข้องsin(x)sin(x)sin(x) พร้อมเสียงดัง ตอนนี้หากมีข้อผิดพลาดในการวัดบางอย่างมันจะเปลี่ยนรูปร่างของฮิสโตแกรม ตัวอย่างเช่น การคำนวณเชิงวิเคราะห์ ดังนั้นหวังว่าฉันจะทำให้คุณมั่นใจว่ามีความแตกต่างระหว่างสองอย่างนี้ตอนนี้ฉันจะเขียนวิธีคำนวณกรณี "ไม่มีเสียง": ไม่มีเสียงดังรบกวน y(x)=sin(x)y(x)=sin⁡(x) y(x) = \sin(x) จากนั้นถ้าเวลาที่เราสุ่มตัวอย่างกระจายอย่างสม่ำเสมอการแจกแจงความน่าจะเป็นสำหรับyyyจะต้องเป็นไปตาม: P(y)dy=dx2πP(y)dy=dx2π P(y) dy = \frac{dx}{2\pi} ตั้งแต่นั้นมา dxdy=ddy(arcsin(y))=11−y2−−−−−√dxdy=ddy(arcsin⁡(y))=11−y2\frac{dx}{dy} = \frac{d}{dy}\left(\arcsin(y)\right) = \frac{1}{\sqrt{1 - y^{2}}} และอื่น ๆ P(y)=12π1−y2−−−−−√P(y)=12π1−y2 P(y) = \frac{1}{2\pi\sqrt{1 - y^{2}}} ซึ่งการปรับมาตรฐานให้เหมาะสมนั้นเหมาะกับฮิสโตแกรมที่สร้างขึ้นในกรณี "ไม่มีเสียงรบกวน" …

2
วิธีเปรียบเทียบอัลกอริทึมการจัดอันดับสองรายการ
ฉันต้องการเปรียบเทียบอัลกอริทึมการจัดอันดับสองรายการ ในอัลกอริทึมเหล่านี้ลูกค้าระบุเงื่อนไขบางอย่างในการค้นหาของเขา / เธอ ตามความต้องการของลูกค้าอัลกอริทึมเหล่านี้ควรกำหนดคะแนนสำหรับแต่ละรายการในฐานข้อมูลและดึงรายการที่มีคะแนนสูงสุด ฉันได้อ่านหัวข้อต่าง ๆ ที่เกี่ยวข้องกับคำถามของฉันในเว็บไซต์นี้และค้นหาสุทธิ จากการค้นหาของฉันบทความที่เกี่ยวข้องที่สุดซึ่งอธิบายเกี่ยวกับตัวชี้วัดบางอย่างสำหรับการเปรียบเทียบอัลกอริทึมการจัดอันดับคือ: Brian McFee และ Gert RG Lanckriet, Metric Learning to Rank, ICML 2010 ( https://bmcfee.github.io/papers/mlr) .pdf ) ฉันคิดว่า prec @ k, MAP, MRR และ NDCG เป็นตัวชี้วัดที่ดีที่จะใช้ แต่ฉันมีปัญหา: อัลกอริทึมของฉันเรียงลำดับผลลัพธ์ดังนั้นรายการแรกในรายการผลลัพธ์ของฉันคือรายการที่ดีที่สุดที่มีคะแนนสูงสุดผลที่สองมีคะแนนสูงสุดอันดับสองและอื่น ๆ ฉัน จำกัด อัลกอริทึมการค้นหาของฉันไว้ที่ตัวอย่างเช่นค้นหา 5 ผลลัพธ์ที่ดีที่สุดผลลัพธ์คือรายการที่ติดอันดับสูงสุด 5 ดังนั้นความแม่นยำจะเป็น 1 เมื่อฉัน จำกัด การค้นหาของฉันเพื่อค้นหาผลลัพธ์ที่ดีที่สุดมันจะพบสิ่งที่ดีที่สุด อีกครั้งความแม่นยำจะเป็น 1. …

5
สันเขาและลาสโซบรรทัดฐาน
โพสต์นี้ตามหลังอันนี้: ทำไมการประมาณสันถึงดีกว่า OLS โดยการเพิ่มค่าคงที่ในแนวทแยง นี่คือคำถามของฉัน: เท่าที่ฉันรู้แล้วการทำให้เป็นมาตรฐานของสันเขาใช้ -norm (ระยะทางแบบยูคลิด) แต่ทำไมเราถึงใช้สแควร์ของบรรทัดฐานนี้ (แอปพลิเคชันโดยตรงของจะส่งผลให้มีสแควร์รูทของผลรวมของเบต้ากำลังสอง)ℓ 2ℓ2ℓ2\ell_2ℓ2ℓ2\ell_2 เป็นการเปรียบเทียบเราไม่ทำเช่นนี้กับ LASSO ซึ่งใช้ไม่ต้องทำเป็นประจำ แต่นี่คือบรรทัดฐาน"ของจริง" (เพียงผลรวมของกำลังสองของค่าสัมบูรณ์สัมบูรณ์เบต้าและไม่ใช่กำลังสองของผลรวมนี้)ℓ 1ℓ1ℓ1\ell_1ℓ1ℓ1\ell_1 มีคนช่วยฉันอธิบายไหม

2
เหตุใด R ใช้เวลานานในการปรับให้พอดีกับโมเดลด้วยปัจจัยหลายระดับ
ฉันพอดีกับโมเดลที่มีหลายระดับและใช้เวลานาน R เพื่อให้พอดีกับโมเดลนั้น ทำไมนี้ ตัวอย่างเช่นถ้าฉันพอดีกับการถดถอยเพื่อทำนายเงินเดือนของผู้เล่นและรวมถึงตัวทำนายปัจจัยสำหรับเชื้อชาติของผู้เล่นทุกคนนั่นจะใช้เวลานานกว่าการปรับแบบจำลองให้เหมาะกับเงินเดือนของผู้เล่นด้วยตัวทำนายต่อเนื่องเช่นผู้เล่น ความสูง

1
เมทริกซ์ที่แน่นอนกึ่งบวกทุกตัวสอดคล้องกับเมทริกซ์ความแปรปรวนร่วมหรือไม่?
มันเป็นที่รู้จักกันดีว่าเมทริกซ์ความแปรปรวนร่วมจะต้องแน่นอนกึ่งบวกอย่างไรก็ตามเป็นจริงสนทนา? นั่นคือเมทริกซ์แน่นอนกึ่งบวกทุกตัวนั้นตรงกับเมทริกซ์ความแปรปรวนร่วมหรือไม่?

4
“ curvilinear” หมายถึงอะไร?
เท่าที่ผมสามารถบอกโค้งถูกกำหนดราง แต่หมายความว่าเช่นเดียวกับการไม่เชิงเส้น ถูกต้องหรือไม่ หรือcurvilinearมีคำจำกัดความที่ชัดเจนหรือไม่?

1
การกระจายแบบไหนที่ส่งผลให้เพิ่มการแจกแจงพาเรโตสองครั้ง
ฉันสงสัยว่าผลการจัดจำหน่ายในสิ่งที่เพิ่มสอง (หรือมากกว่า) ชนิดหนึ่งในการกระจาย Pareto ของแบบฟอร์มalpha} จากการทดลองดูเหมือนว่ากฎหมายพลังงานสองโหมดซึ่งแสดงถึงความแตกต่างของอัลฟาx−αx−αx^{-\alpha}

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.