สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ฉันควรเลือกตัวแยกป่าแบบสุ่มหรือตัวแยกประเภทของฟอเรสต์ป่าหรือไม่
ฉันพอดีกับชุดข้อมูลที่มีคลาสเป้าหมายไบนารีโดยฟอเรสต์แบบสุ่ม ในไพ ธ อนฉันสามารถทำได้ทั้งโดย randomforestclassifier หรือ randomforestregressor ฉันสามารถรับการจัดหมวดหมู่ได้โดยตรงจาก randomforestclassifier หรือฉันสามารถเรียกใช้ randomforestregressor ก่อนและรับชุดคะแนนที่ประเมินกลับมา (ค่าต่อเนื่อง) จากนั้นฉันสามารถหาค่า cutoff เพื่อให้ได้คลาสที่ทำนายไว้จากคะแนน ทั้งสองวิธีสามารถบรรลุเป้าหมายเดียวกัน (เช่นทำนายคลาสสำหรับข้อมูลการทดสอบ) นอกจากนี้ฉันสามารถสังเกตได้ว่า randomforestclassifier.predict_proba(X_test)[:,1]) แตกต่างจาก randomforestregressor.predict(X_test) ดังนั้นฉันแค่ต้องการยืนยันว่าทั้งสองวิธีนั้นถูกต้องแล้ววิธีใดดีกว่าในแอปพลิเคชันฟอเรสต์แบบสุ่ม

3
ทำไม OLS ประมาณค่าสัมประสิทธิ์ AR (1) เอนเอียง?
ฉันพยายามที่จะเข้าใจว่าทำไม OLS จึงให้ตัวประมาณค่าแบบอคติของกระบวนการ AR (1) พิจารณา ในรูปแบบนี้มีการละเมิด exogeneity ที่เข้มงวดเช่นและมีความสัมพันธ์กัน แต่และไม่มีความสัมพันธ์กัน แต่ถ้าสิ่งนี้เป็นจริงแล้วเหตุใดความเรียบง่ายที่ตามมาจึงไม่เกิดขึ้น Yเสื้อεเสื้อ= α + βYt - 1+εเสื้อ,~ฉันฉันdยังไม่มีข้อความ( 0 , 1 )Yเสื้อ=α+βYเสื้อ-1+εเสื้อ,εเสื้อ~ผมผมdยังไม่มีข้อความ(0,1). \begin{aligned} y_{t} &= \alpha + \beta y_{t-1} + \epsilon_{t}, \\ \epsilon_{t} &\stackrel{iid}{\sim} N(0,1). \end{aligned} Yเสื้อYเสื้อy_tεเสื้อεเสื้อ\epsilon_tYt - 1Yเสื้อ-1y_{t-1}εเสื้อεเสื้อ\epsilon_tPLIM β^=โคฟ(Yเสื้อ,Yt - 1)วาร์(Yt - 1)=Cov ( α + βYt - 1+εเสื้อ,Yt - …

4
AUC น่าจะเป็นของการจำแนกอินสแตนซ์ที่เลือกแบบสุ่มจากแต่ละชั้นอย่างถูกต้องหรือไม่
ฉันอ่านคำอธิบายภาพนี้ในกระดาษและไม่เคยเห็น AUC อธิบายในลักษณะนี้ที่อื่น มันเป็นเรื่องจริงเหรอ? มีหลักฐานหรือวิธีง่ายๆในการดูสิ่งนี้หรือไม่? ภาพที่ 2 แสดงความถูกต้องในการทำนายของตัวแปรโดมิโนที่แสดงในรูปของพื้นที่ภายใต้เส้นโค้งลักษณะการรับ - ปฏิบัติการ (AUC) ซึ่งเทียบเท่ากับความน่าจะเป็นในการจำแนกผู้ใช้สองคนที่เลือกแบบสุ่มอย่างละหนึ่งคน ) สำหรับฉันแล้วดูเหมือนว่ามันไม่เป็นความจริงเนื่องจากสำหรับ AUC = 0.5 ข้างต้นจะแนะนำว่ามีความน่าจะเป็น 50% ในการทำนายการพลิกเหรียญอย่างถูกต้องสองครั้งติดต่อกัน แต่ในความเป็นจริงคุณมีโอกาส 25% เท่านั้น การทำนายการโยนเหรียญสองครั้งในแถวอย่างถูกต้อง อย่างน้อยนั่นคือสิ่งที่ฉันกำลังคิดถึงคำแถลงนี้

3
ใช้ Holt-Winters หรือ ARIMA หรือไม่
คำถามของฉันเกี่ยวกับความแตกต่างทางแนวคิดระหว่าง Holt-Winters และ ARIMA เท่าที่ฉันเข้าใจ Holt-Winters เป็นกรณีพิเศษของ ARIMA แต่เมื่อไรที่อัลกอริทึมหนึ่งต้องการมากกว่าอีกอันหนึ่ง? บางทีโฮลท์ - วินเทอร์เป็นแบบเพิ่มขึ้นดังนั้นจึงทำหน้าที่เป็นอัลกอริทึมแบบอินไลน์ (เร็วกว่า)? รอคอยที่จะเข้าใจบางอย่างที่นี่

3
อะไรคือข้อดีของการถดถอยแบบขั้นตอน
ฉันกำลังทดลองกับการถดถอยแบบขั้นตอนเพื่อเห็นแก่ความหลากหลายในแนวทางการแก้ไขปัญหา ดังนั้นฉันมี 2 คำถาม: อะไรคือข้อดีของการถดถอยแบบขั้นตอน จุดเด่นเฉพาะคืออะไร คุณคิดอย่างไรเกี่ยวกับวิธีการไฮบริดที่คุณใช้การถดถอยแบบขั้นตอนเพื่อเลือกคุณสมบัติแล้วใช้การถดถอยปกติโดยนำคุณสมบัติที่เลือกทั้งหมดมารวมกัน

2
การจัดการคำที่ไม่รู้จักในงานสร้างแบบจำลองภาษาโดยใช้ LSTM
สำหรับภารกิจการประมวลผลภาษาธรรมชาติ (NLP) มักใช้เวกเตอร์ word2vecเพื่อฝังคำ อย่างไรก็ตามอาจมีคำที่ไม่รู้จักจำนวนมากที่ไม่ได้ถูกจับโดย word2vec vector เพียงเพราะคำเหล่านี้ไม่ได้เห็นบ่อยในข้อมูลการฝึกอบรม (การใช้งานจำนวนมากใช้การนับขั้นต่ำก่อนเพิ่มคำลงในคำศัพท์) นี่อาจเป็นกรณีที่มีข้อความจากเช่น Twitter ซึ่งคำมักสะกดผิด ควรจัดการคำที่ไม่รู้จักเช่นนั้นอย่างไรเมื่อสร้างแบบจำลองงาน NLP เช่นการคาดการณ์ความเชื่อมั่นโดยใช้เครือข่ายระยะสั้นระยะยาว (LSTM) ฉันเห็นสองตัวเลือก: การเพิ่มโทเค็น 'คำที่ไม่รู้จัก' ในพจนานุกรม word2vec การลบคำที่ไม่รู้จักเหล่านี้ออกไปเพื่อที่ LSTM จะไม่รู้แม้แต่คำนั้นในประโยค วิธีที่เหมาะสมในการจัดการคำเหล่านี้คืออะไร?


1
การติดตั้ง GLOM แบบทวินาม (glmer) กับตัวแปรตอบกลับที่เป็นสัดส่วนหรือเศษส่วน
ฉันหวังว่าใครบางคนสามารถช่วยในสิ่งที่ฉันคิดว่าเป็นคำถามที่ค่อนข้างง่ายและฉันคิดว่าฉันรู้คำตอบ แต่ไม่มีการยืนยันมันกลายเป็นสิ่งที่ฉันไม่แน่ใจ ฉันมีข้อมูลการนับเป็นตัวแปรตอบกลับและฉันต้องการวัดว่าตัวแปรนั้นเปลี่ยนแปลงไปอย่างไรด้วยการมีสัดส่วนของบางสิ่งบางอย่าง ในรายละเอียดเพิ่มเติมตัวแปรตอบสนองจะนับการมีอยู่ของสปีชีส์ของแมลงในหลาย ๆ ไซต์ดังนั้นตัวอย่างจะถูกสุ่มตัวอย่าง 10 ครั้งและสปีชีส์นี้อาจเกิดขึ้น 4 ครั้ง ฉันต้องการที่จะดูว่าสิ่งนี้มีความสัมพันธ์กับการปรากฏตัวตามสัดส่วนของกลุ่มพันธุ์พืชใน commmunity โดยรวมของพืชที่เว็บไซต์เหล่านี้ ซึ่งหมายความว่าข้อมูลของฉันมีลักษณะดังนี้ (นี่เป็นเพียงตัวอย่าง) Site, insectCount, NumberOfInsectSamples, ProportionalPlantGroupPresence 1, 5, 10, 0.5 2, 3, 10, 0.3 3, 7, 9, 0.6 4, 0, 9, 0.1 ข้อมูลยังรวมถึงเอฟเฟกต์แบบสุ่มสำหรับตำแหน่ง ฉันคิดว่าสองวิธีหนึ่งจะเป็นแบบจำลองเชิงเส้น ( lmer) กับแมลงที่แปลงเป็นสัดส่วนเช่น lmer.model<-lmer(insectCount/NumberOfInsectSamples~ ProportionalPlantGroupPresence+(1|Location),data=Data) ครั้งที่สองจะเป็นแบบทวินาม GLMM ( glmer) เช่น glmer.model <- glmer(cbind(insectCount,NumberOfInsectSamples-insectCount)~ …

4
วิธีการเห็นภาพตัวอย่างการทดสอบสองตัวอย่าง
วิธีที่ได้รับการยอมรับมากที่สุดในการแสดงภาพผลลัพธ์ของการทดสอบตัวอย่างสองตัวอย่างที่เป็นอิสระคืออะไร ตารางตัวเลขใช้บ่อยขึ้นหรือมีการเรียงลำดับบางอย่างหรือไม่? เป้าหมายคือเพื่อให้ผู้สังเกตการณ์แบบชั่วคราวมองดูรูปและเห็นได้ทันทีว่าพวกเขาอาจมาจากประชากรสองกลุ่มที่แตกต่างกัน

1
คำถามเกี่ยวกับการลบค่าเฉลี่ยในชุดรถไฟ / ถูกต้อง / ทดสอบ
ฉันกำลังประมวลผลข้อมูลล่วงหน้าและจะสร้าง Convonets กับข้อมูลของฉันหลังจากนั้น คำถามของฉันคือ: สมมติว่าฉันมีชุดข้อมูลทั้งหมด 100 ภาพฉันคำนวณค่าเฉลี่ยสำหรับแต่ละภาพ 100 ภาพแล้วลบมันออกจากแต่ละภาพจากนั้นแยกชุดนี้เป็นชุดรถไฟและชุดตรวจสอบและฉันก็ทำเช่นเดียวกัน ขั้นตอนในการประมวลผลในชุดทดสอบที่กำหนด แต่ดูเหมือนว่านี่ไม่ใช่วิธีที่ถูกต้องในการทำตามลิงค์นี้: http://cs231n.github.io/neural-networks-2/#datapre จุดผิดพลาดทั่วไปจุดสำคัญที่จะทำให้การประมวลผลล่วงหน้าคือสถิติการประมวลผลล่วงหน้า (เช่นค่าเฉลี่ยของข้อมูล) จะต้องคำนวณจากข้อมูลการฝึกอบรมเท่านั้นจากนั้นนำไปใช้กับข้อมูลการตรวจสอบ / ทดสอบเช่นคำนวณค่าเฉลี่ยและลบออกจาก ทุกภาพในชุดข้อมูลทั้งหมดจากนั้นแยกข้อมูลออกเป็นส่วนแยก train / val / test จะเป็นความผิดพลาดแทนค่าเฉลี่ยจะต้องคำนวณเฉพาะข้อมูลการฝึกอบรมและจากนั้นแยกเท่า ๆ กันจากการแยกทั้งหมด (train / val / test) " ฉันคาดเดาสิ่งที่ผู้เขียนพูดคืออย่าคำนวณค่าเฉลี่ยและลบมันภายในแต่ละภาพ แต่คำนวณค่าเฉลี่ยของชุดภาพทั้งหมด (เช่น (image1 + ... + image100) / 100) และลบค่าเฉลี่ยของ แต่ละภาพ ฉันไม่เข้าใจทุกคนสามารถอธิบายได้? และอาจอธิบายได้ว่าทำไมสิ่งที่ฉันทำผิด (ถ้าผิด)

2
ตัวประมาณที่ไม่เอนเอียงสำหรับแบบจำลองAR ( )
พิจารณาโมเดลAR ( ) (สมมติว่าค่าเฉลี่ยเป็นศูนย์สำหรับความเรียบง่าย):ppp xt=φ1xt−1+…+φpxt−p+εtxt=φ1xt−1+…+φpxt−p+εt x_t = \varphi_1 x_{t-1} + \dotsc + \varphi_p x_{t-p} + \varepsilon_t OLS ประมาณการ (เทียบเท่ากับเงื่อนไขประมาณการโอกาสสูงสุด) สำหรับเป็นที่รู้จักกันจะลำเอียงตามที่ระบุไว้ในหัวข้อที่ผ่านมาφ:=(φ1,…,φp)φ:=(φ1,…,φp)\mathbf{\varphi} := (\varphi_1,\dotsc,\varphi_p) (อยากรู้อยากเห็นฉันไม่สามารถหาอคติที่กล่าวถึงในแฮมิลตัน"การวิเคราะห์อนุกรมเวลา"หรือในตำราอนุกรมเวลาอื่น ๆ ไม่กี่อย่างไรก็ตามมันสามารถพบได้ในบันทึกการบรรยายต่างๆและบทความทางวิชาการเช่นนี้ ) ผมไม่สามารถที่จะหาไม่ว่าจะเป็นที่แน่นอนประมาณการความน่าจะเป็นสูงสุดของ AR ( ) จะลำเอียงหรือไม่ ดังนั้นคำถามแรกของฉันppp คำถามที่ 1:เป็นที่แน่นอนประมาณการความน่าจะเป็นสูงสุดของ AR ( ) รูปแบบของพารามิเตอร์อัตลำเอียง? (ให้เราสมมติว่ากระบวนการ AR ( ) เป็นแบบนิ่งมิฉะนั้นตัวประมาณจะไม่สอดคล้องกันเนื่องจากมันถูก จำกัด ในภูมิภาคที่อยู่นิ่ง; ดูเช่น"การวิเคราะห์อนุกรมเวลา"แฮมิลตัน, หน้า 123)pppφ1,…,φpφ1,…,φp\varphi_1,\dotsc,\varphi_pppp นอกจากนี้ คำถามที่ …

1
วิธีการตีความสัมประสิทธิ์ระยะที่สองในการถดถอยตัวแปรเครื่องมือด้วยเครื่องมือไบนารีและตัวแปรภายนอกไบนารี?
(โพสต์ค่อนข้างยาวขออภัยมีข้อมูลพื้นหลังมากมายดังนั้นโปรดข้ามไปที่คำถามด้านล่าง) Intro:ฉันกำลังทำงานในโครงการที่เรากำลังพยายามที่จะระบุผลกระทบของตัวแปรภายนอกไบนารีบนผลอย่างต่อเนื่องปีเราได้สร้างเครื่องมือขึ้นมาซึ่งเราเชื่อมั่นอย่างยิ่งว่าจะได้รับการมอบหมายแบบสุ่มx1x1x_1YyyZ1z1z_1 ข้อมูล:ข้อมูลอยู่ในโครงสร้างแผงซึ่งมีการสังเกตการณ์ประมาณ 34,000 ครั้งกระจายไปทั่ว 1,000 หน่วยและประมาณ 56 ช่วงเวลา ใช้ค่า 1 สำหรับการสังเกตประมาณ 700 (2%) และทำประมาณ 3000 (9%) 111 (0.33%) สังเกตคะแนน 1 ทั้งและและมันก็เป็นสองเท่าแนวโน้มสำหรับข้อสังเกตที่จะทำคะแนน 1ถ้ามันยังคะแนน 1 z_1x1x1x_1Z1z1z_1Z1z1z_1x1x1x_1x1x1x_1Z1z1z_1 การประมาณ:เราประเมินโมเดล 2SLS ต่อไปนี้ผ่านขั้นตอน ivreg2 ของ Stata: x1=π0+π1Z1+ Z π+ vx1=π0+π1z1+Zπ+vx_1 = \pi_0 + \pi_1z_1 + \mathbf{Z}\mathbf{\pi} + v Y=β0+β1x* * * *1+ Z β+ uy=β0+β1x1∗+Zβ+uy …

4
เมื่อใดจึงควรใช้ Gradient descent vs Monte Carlo เป็นเทคนิคการหาค่าเหมาะที่สุดเชิงตัวเลข
เมื่อชุดของสมการไม่สามารถแก้ไขได้เชิงวิเคราะห์เราสามารถใช้อัลกอริธึมการไล่ระดับสี แต่ดูเหมือนว่ายังมีวิธีการจำลองมอนติคาร์โลที่สามารถใช้ในการแก้ปัญหาที่ไม่มีวิธีการวิเคราะห์ จะบอกได้อย่างไรว่าจะใช้การไล่ระดับสีแบบไล่ระดับและเมื่อใดที่จะใช้ Monte Carlo หรือฉันแค่สับสนคำว่า 'การจำลอง' กับ 'การเพิ่มประสิทธิภาพ' แบบธรรมดา ขอบคุณมาก!

2
การกระจายสำหรับสูงสุด (ขั้นต่ำ) ของตัวแปรสุ่มแบบอิสระสองตัวคืออะไร
โดยเฉพาะสมมติว่า XXX และ YYYเป็นตัวแปรสุ่มปกติ (อิสระ แต่ไม่จำเป็นต้องมีการกระจายเหมือนกัน) รับเฉพาะใด ๆaaaมีสูตรที่ดีสำหรับ P( สูงสุด( X), วาย) ≤ x )P(max(X,Y)≤x)P(\max(X,Y)\leq x)หรือแนวคิดที่คล้ายกัน เราจะรู้ว่าสูงสุด( X, วาย)max(X,Y)\max(X,Y)มีการกระจายตามปกติอาจจะเป็นสูตรสำหรับค่าเบี่ยงเบนมาตรฐานค่าเฉลี่ยและในแง่ของเหล่านั้นสำหรับXXXและYYY ? ฉันตรวจสอบสถานที่ปกติ (วิกิพีเดีย google) แต่ไม่พบอะไรเลย

2
การจัดกลุ่มข้อมูลที่เบ้มากนับจำนวน: คำแนะนำใด ๆ ที่จะดำเนินการ (แปลง ฯลฯ )
ปัญหาพื้นฐาน นี่คือปัญหาพื้นฐานของฉัน: ฉันกำลังพยายามจัดกลุ่มชุดข้อมูลที่มีตัวแปรที่เบ้อย่างมากพร้อมจำนวน ตัวแปรประกอบด้วยศูนย์จำนวนมากและดังนั้นจึงไม่ค่อยมีข้อมูลสำหรับขั้นตอนการจัดกลุ่มของฉัน - ซึ่งน่าจะเป็นอัลกอริทึม k-mean คุณพูดได้แค่แปลงตัวแปรโดยใช้สแควร์รูทบ็อกซ์คอกซ์หรือลอการิทึม แต่เนื่องจากตัวแปรของฉันขึ้นอยู่กับตัวแปรเด็ดขาดฉันกลัวว่าฉันอาจแนะนำอคติโดยจัดการกับตัวแปร (ขึ้นอยู่กับค่าหนึ่งของตัวแปรเด็ดขาด) ในขณะที่ปล่อยให้ผู้อื่น (ขึ้นอยู่กับค่าอื่น ๆ ของตัวแปรเด็ดขาด) ในแบบที่พวกเขาเป็น . ลองดูรายละเอียดเพิ่มเติม ชุดข้อมูล ชุดข้อมูลของฉันแสดงถึงการซื้อสินค้า รายการมีหมวดหมู่ต่างกันเช่นสี: น้ำเงินแดงและเขียว การซื้อจะถูกจัดกลุ่มเข้าด้วยกันเช่นจากลูกค้า ลูกค้าเหล่านี้แต่ละคนมีชุดข้อมูลหนึ่งแถวของฉันดังนั้นฉันจึงต้องรวมการซื้อกับลูกค้า วิธีที่ฉันทำคือการนับจำนวนการซื้อโดยที่รายการนั้นมีสีที่แน่นอน ดังนั้นแทนที่จะตัวแปรเดียวcolorผมจบลงด้วยสามตัวแปรcount_red, และcount_bluecount_green นี่คือตัวอย่างสำหรับภาพประกอบ: ----------------------------------------------------------- customer | count_red | count_blue | count_green | ----------------------------------------------------------- c0 | 12 | 5 | 0 | ----------------------------------------------------------- c1 | 3 | …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.