สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ทำไมค่า p เปลี่ยนแปลงอย่างมีนัยสำคัญเมื่อเปลี่ยนลำดับของ covariates ใน aov model?
ฉันมีชุดข้อมูลของการสังเกต 482 ชุด data=Populationfull ฉันจะทำการวิเคราะห์ความสัมพันธ์ของจีโนไทป์สำหรับ 3 SNP ฉันกำลังพยายามสร้างแบบจำลองสำหรับการวิเคราะห์ของฉันและฉันใช้ aov (y ~ x, data = ... ) สำหรับคุณลักษณะหนึ่งฉันมีเอฟเฟกต์คงที่และค่าแปรปรวนร่วมหลายอย่างที่ฉันได้รวมไว้ในโมเดลเช่น: Starts <- aov(Starts~Sex+DMRT3+Birthyear+Country+Earnings+Voltsec+Autosec, data=Populationfull) summary(Starts) Df Sum Sq Mean Sq F value Pr(>F) Sex 3 17.90 5.97 42.844 < 2e-16 *** DMRT3 2 1.14 0.57 4.110 0.017 * Birthyear 9 5.59 0.62 4.461 …
10 r  anova 

3
เป็นไปได้ไหมที่จะฝึกโครงข่ายประสาทเทียมเพื่อวาดภาพในบางสไตล์?
เป็นไปได้ไหมที่จะฝึกโครงข่ายประสาทเทียมเพื่อวาดภาพในบางสไตล์? (ดังนั้นจึงใช้รูปภาพและวาดใหม่ในสไตล์ที่ฝึกมา) มีเทคโนโลยีใดที่ได้รับการรับรองสำหรับสิ่งนั้นหรือไม่? ฉันรู้เกี่ยวกับอัลกอริทึม DeepArt มันเป็นการดีที่จะเติมภาพหลักด้วยรูปแบบบางอย่าง (ตัวอย่างเช่นรูปภาพ vangoghify) แต่ฉันกำลังมองหาบางอย่างที่แตกต่าง - ตัวอย่างเช่นทำให้การ์ตูนในสไตล์ที่แน่นอนจากแนวตั้งอินพุท

2
ใช้ LASSO สำหรับการเลือกคุณสมบัติเท่านั้น
ในระดับการเรียนรู้เครื่องของเราได้เรียนรู้เกี่ยวกับวิธีการ Lasso ถดถอยเป็นอย่างดีในการดำเนินการเลือกคุณลักษณะเพราะมันทำให้การใช้ regularizationล.1ล.1l_1 คำถามของฉัน: โดยปกติแล้วคนใช้แบบจำลอง LASSO เพียงเพื่อทำการเลือกคุณลักษณะ (แล้วดำเนินการถ่ายโอนคุณลักษณะเหล่านั้นไปยังรูปแบบการเรียนรู้ของเครื่องอื่น) หรือพวกเขามักจะใช้ LASSO เพื่อทำการเลือกทั้งคุณสมบัติและการถดถอยจริง ตัวอย่างเช่นสมมติว่าคุณต้องการลดการถดถอยในแนวสัน แต่คุณเชื่อว่าคุณสมบัติหลายอย่างของคุณไม่ดีนัก จะเป็นการดีไหมถ้าจะเรียกใช้ LASSO ใช้เฉพาะฟีเจอร์ที่อัลกอริธึมไม่ใกล้ศูนย์และใช้เฉพาะในการทิ้งข้อมูลของคุณเป็นแบบจำลองการถดถอยของสันเขา? ด้วยวิธีนี้คุณจะได้รับประโยชน์จากการทำให้เป็นปกติสำหรับการเลือกคุณสมบัติ แต่ยังได้รับประโยชน์จากการทำให้เป็นเพื่อลดการ(ฉันรู้ว่าสิ่งนี้มีความสำคัญกับ Elastic Net Regression แต่ดูเหมือนว่าคุณไม่จำเป็นต้องมีทั้งคำและในฟังก์ชันวัตถุประสงค์การถดถอยขั้นสุดท้าย)ล.1ล.1l_1ล.2ล.2l_2ล.1ล.1l_1ล.2ล.2l_2 นอกเหนือจากการถดถอยแล้วนี่เป็นกลยุทธ์ที่ชาญฉลาดหรือไม่เมื่อทำการแบ่งประเภท (ใช้ SVMs, โครงข่ายประสาทเทียม, ฟอเรสต์แบบสุ่ม, ฯลฯ )?

2
Kullback-Leibler Divergence สำหรับสองตัวอย่าง
ฉันพยายามใช้การประมาณเชิงตัวเลขของ Kullback-Leibler Divergence สำหรับสองตัวอย่าง การแก้ปัญหาการดำเนินการวาดตัวอย่างจากสองการแจกแจงปรกติและ(1,2)N(0,1)N(0,1)\mathcal N (0,1)N(1,2)N(1,2)\mathcal N (1,2) สำหรับการประมาณแบบง่ายฉันได้สร้างฮิสโทแกรมสองกราฟและพยายามประมาณอินทิกรัลเชิงตัวเลข ฉันติดอยู่กับการจัดการส่วนต่าง ๆ ของฮิสโตแกรมที่ซึ่งช่องเก็บของฮิสโตแกรมนั้นมีค่าเป็นศูนย์ซึ่งฉันจะสิ้นสุดด้วยการหารด้วยศูนย์หรือลอการิทึมของศูนย์ ฉันจะจัดการปัญหานี้ได้อย่างไร คำถามที่เกี่ยวข้องอยู่ในใจของฉัน: จะคำนวณ KL-Divergence ระหว่างการแจกแจงเครื่องแบบที่แตกต่างกันสองแบบได้อย่างไร ฉันต้อง จำกัด อินทิกรัลกับการรวมกันของการสนับสนุนของการแจกแจงทั้งสองหรือไม่?

6
เราจะทราบความแปรปรวนของประชากรได้อย่างไร?
ในการทดสอบสมมติฐานคำถามทั่วไปคือความแปรปรวนของประชากรคืออะไร? คำถามของฉันคือเราจะทราบความแปรปรวนของประชากรได้อย่างไร ถ้าเรารู้การกระจายตัวทั้งหมดเราก็อาจรู้ค่าเฉลี่ยของประชากรทั้งหมด จากนั้นการทดสอบสมมติฐานคืออะไร?


5
วิธีการทดสอบเอฟเฟกต์ปฏิสัมพันธ์กับการทดสอบที่ไม่ใช่พารามิเตอร์ (เช่นการทดสอบการเปลี่ยนแปลง)
ฉันมีตัวแปรเด็ดขาด / สองเล็กน้อย แต่ละคนสามารถรับค่าที่แตกต่างกันเพียงสองค่าเท่านั้น (ดังนั้นฉันจึงมีทั้งหมด 4 แบบ) การรวมกันของค่าแต่ละค่ามาพร้อมกับชุดของค่าตัวเลข ดังนั้นฉันมีตัวเลข 4 ชุด เพื่อให้เป็นรูปธรรมมากขึ้นขอให้เราบอกว่าฉันมีmale / femaleและyoung / oldเป็นตัวแปรที่กำหนดและฉันมีweight"เอาท์พุท" เชิงตัวเลข ฉันรู้ว่าการเปลี่ยนจากmaleเป็นfemaleเปลี่ยนน้ำหนักเฉลี่ยและการเปลี่ยนแปลงเหล่านี้มีนัยสำคัญทางสถิติ ดังนั้นฉันสามารถคำนวณgenderปัจจัย เช่นเดียวกับageตัวแปร ฉันรู้ว่าการเปลี่ยนจากyoungเป็นoldเปลี่ยนน้ำหนักเฉลี่ยและฉันสามารถคำนวณageปัจจัยที่เกี่ยวข้องได้ ตอนนี้สิ่งที่ฉันต้องการดูว่าข้อมูลพิสูจน์ให้เห็นว่าการเปลี่ยนจากหญิงสาวเป็นชายชราเป็นมากกว่าการรวมกันของเพศ - และปัจจัยอายุ กล่าวอีกนัยหนึ่งฉันต้องการทราบว่าข้อมูลพิสูจน์ว่ามี "เอฟเฟ็กต์ 2 มิติ" หรือกล่าวอีกนัยหนึ่งว่าเอฟเฟกต์อายุและเพศไม่ได้เป็นอิสระ ตัวอย่างเช่นอาจเป็นเรื่องเก่าสำหรับผู้ชายที่เพิ่มน้ำหนักตามปัจจัย 1.3 และสำหรับผู้หญิงปัจจัยที่เกี่ยวข้องคือ 1.1 แน่นอนฉันสามารถคำนวณสองปัจจัยที่กล่าวถึง (ปัจจัยอายุสำหรับผู้ชายและปัจจัยอายุสำหรับผู้หญิง) และพวกเขาจะแตกต่างกัน แต่ฉันต้องการคำนวณนัยสำคัญทางสถิติของความแตกต่างนี้ ความแตกต่างนี้จริงแค่ไหน ฉันต้องการทำแบบทดสอบที่ไม่ใช่พารามิเตอร์หากเป็นไปได้ เป็นไปได้ไหมที่จะทำสิ่งที่ฉันต้องการจะทำโดยการผสมทั้งสี่เซตสับมันแบ่งอีกครั้งและคำนวณบางอย่าง

2
อคติเป็นทรัพย์สินของผู้ประมาณค่าหรือจากการประมาณค่าโดยเฉพาะหรือไม่?
เป็นตัวอย่างที่ผมมักจะพบนักเรียนที่รู้ว่าสังเกตเป็นประมาณการลำเอียงของประชากร 2 จากนั้นเมื่อเขียนรายงานพวกเขาพูดเช่น:R2R2R^2R2R2R^2 "ฉันคำนวณ Observedและ Adjustedและพวกมันก็ค่อนข้างคล้ายกันโดยแนะนำอคติเพียงเล็กน้อยในค่า Observedเราได้รับ"R2R2R^2R2R2R^2R2R2R^2 ฉันได้รับโดยทั่วไปเมื่อเราพูดถึงอคติเรามักพูดถึงคุณสมบัติของตัวประมาณมากกว่าการประมาณโดยเฉพาะ อย่างไรก็ตามข้อความที่ยกมานั้นเป็นคำที่ใช้ผิดวัตถุประสงค์หรือไม่

1
เครือข่ายประสาทมักใช้เวลาสักครู่เพื่อ“ เริ่มเล่น” ระหว่างการฝึกซ้อมหรือไม่?
ฉันพยายามที่จะฝึกอบรมเครือข่ายประสาทลึกเพื่อจัดหมวดหมู่โดยใช้การขยายพันธุ์กลับ โดยเฉพาะฉันใช้เครือข่ายประสาทเทียมสำหรับการจำแนกภาพโดยใช้ห้องสมุด Tensor Flow ในระหว่างการฝึกฉันพบกับพฤติกรรมแปลก ๆ และฉันแค่สงสัยว่ามันเป็นเรื่องปกติหรือว่าฉันอาจจะทำอะไรผิด ดังนั้นเครือข่ายประสาทเทียมของฉันมี 8 ชั้น (5 convolutional, 3 เชื่อมต่อเต็ม) น้ำหนักและอคติทั้งหมดจะเริ่มต้นด้วยตัวเลขสุ่มขนาดเล็ก จากนั้นฉันตั้งขนาดขั้นตอนและดำเนินการฝึกอบรมด้วยชุดเล็กโดยใช้ Adam Optimizer ของ Tensor Flow พฤติกรรมแปลก ๆ ที่ฉันกำลังพูดถึงคือประมาณ 10 ลูปแรกจากข้อมูลการฝึกอบรมของฉันการสูญเสียการฝึกอบรมโดยทั่วไปไม่ลดลง น้ำหนักกำลังได้รับการปรับปรุง แต่การสูญเสียการฝึกอบรมอยู่ที่ประมาณค่าเดียวกันบางครั้งจะเพิ่มขึ้นและบางครั้งจะลดลงระหว่างชุดมินิ มันคงอยู่แบบนี้ซักพักแล้วและฉันก็มักจะได้รับความประทับใจว่าการสูญเสียจะไม่ลดลง ทันใดนั้นการสูญเสียการฝึกอบรมก็ลดลงอย่างรวดเร็ว ตัวอย่างเช่นภายในประมาณ 10 ลูปผ่านข้อมูลการฝึกอบรมความแม่นยำในการฝึกอบรมจะอยู่ที่ประมาณ 20% ถึงประมาณ 80% จากนั้นเป็นต้นมาทุกอย่างก็จบลงอย่างบรรจบกัน สิ่งเดียวกันเกิดขึ้นทุกครั้งที่ฉันเรียกใช้ขั้นตอนการฝึกอบรมตั้งแต่เริ่มต้นและด้านล่างเป็นกราฟที่แสดงตัวอย่างการวิ่งหนึ่งครั้ง ดังนั้นสิ่งที่ฉันสงสัยคือว่านี่เป็นพฤติกรรมปกติด้วยการฝึกอบรมโครงข่ายประสาทเทียมลึกหรือไม่ หรือเป็นไปได้ว่ามีบางอย่างที่ฉันทำผิดซึ่งทำให้เกิดความล่าช้านี้ ขอบคุณมาก ๆ!

2
การกระจายไขมันนิ้ว
คำถามโดยย่อ: มีการกระจายนิ้วไขมันหรือไม่ ฉันแน่ใจว่าถ้ามีอยู่แล้วมันมีชื่ออื่น ฉันไม่ทราบวิธีกำหนดเป็นฟังก์ชันวิเคราะห์ คุณสามารถช่วยฉันค้นหารุ่นที่มีอยู่หรือเริ่มต้นในการกำหนดในสิ่งที่สะอาดกว่าการจำลองขนาดยักษ์ได้หรือไม่ มันคือการกระจายของตัวเลขที่เกิดขึ้นจริงเมื่อจำนวนที่กำหนดเป็นเป้าหมายที่ต้องการ แต่ปุ่มนั้นเล็กกว่านิ้วมากดังนั้นบางครั้งปุ่มที่อยู่ใกล้เคียงจึงถูกบางครั้งโดนโดยบังเอิญ การใช้งานการแจกจ่ายเช่นนี้เป็นรายการที่ผิดพลาดในการกดปุ่มบนโทรศัพท์มือถือ หากฉันดำเนินการ บริษัท ที่มี "กด 1 ตอนนี้" หรืออะไรบางอย่างและ "คุณกด 1 ถูกต้อง" จากนั้นพวกเขาจะได้ประมาณความน่าจะเป็นของไขมันนิ้วที่ดีแม้ว่า 2 นิ้วในแถวไขมันนิ้วอาจยุ่งเหยิง ขึ้นบ้าง (ระยะห่างของแฮมมิงในนิ้วอ้วน? โซ่มาร์คอฟนิ้วอ้วน?) ฉันต้องการใช้มันเพื่อลองและสร้างการแก้ไขข้อผิดพลาดในการกดปุ่ม ฉันมีตัวอย่างบางส่วนของตัวเอง แต่มีความผันแปรไม่เพียงพอในนิ้ว "ความอ้วน" หรือโครงสร้างของแป้นพิมพ์โทรศัพท์มือถือที่มีความทนทาน ความเป็นมาและรายละเอียด: นี่คือรูปแบบปุ่มกดโทรศัพท์มือถือปกติ: ลองนึกภาพว่านิ้วมือของฉันมีขนาดใหญ่กว่าปุ่มมากดังนั้นเมื่อฉันไปกด 5 ฉันมักจะได้รับ 5 แต่ส่วนใหญ่แล้วฉันก็มีแนวโน้มที่จะได้ 2,4,6 หรือ 8 เท่ากัน ) จากนั้นมีโอกาสน้อยกว่า (แต่ไม่เป็นศูนย์) ที่จะได้รับ 1,3,7,9 (มีโอกาสเท่ากัน) และฉันไม่น่าจะได้รับ 0 ฉันสามารถจินตนาการได้ว่าถ้าฉันพยายามพิมพ์จำนวนอนันต์ของ 5 …

2
การถดถอย: ทำไมการทดสอบภาวะปกติของเศษโดยรวมแทนที่จะเหลือเงื่อนไขใน
ฉันเข้าใจว่าในการถดถอยเชิงเส้นข้อผิดพลาดจะถูกกระจายโดยปกติเงื่อนไขตามค่าที่ทำนายของ y จากนั้นเราดูที่เหลือเป็นพร็อกซีสำหรับข้อผิดพลาด มันมักจะแนะนำให้สร้างผลลัพธ์เช่นนี้ อย่างไรก็ตามฉันไม่เข้าใจว่าจุดใดที่ได้รับส่วนที่เหลือของแต่ละจุดข้อมูลและทำการบดเข้าด้วยกันในพล็อตเดียว ฉันเข้าใจว่าเราไม่น่าจะมีจุดข้อมูลเพียงพอที่จะประเมินว่าเรามีค่าคงที่ปกติตามค่าที่ทำนายไว้ของ y หรือไม่ อย่างไรก็ตามไม่ใช่คำถามว่าเรามีสารตกค้างตามปกติโดยรวมแยกจากกันหรือไม่และเป็นสิ่งที่ไม่เกี่ยวข้องอย่างชัดเจนกับสมมติฐานแบบจำลองของค่าคงที่ปกติที่แต่ละค่าคาดการณ์ของ y เราไม่สามารถมีค่าคงที่ปกติในแต่ละค่าที่คาดการณ์ของ y ในขณะที่มีค่าคงที่โดยรวมที่ค่อนข้างไม่ปกติ

2
เมทริกซ์ความแปรปรวนร่วมผกผันกับเมทริกซ์ความแปรปรวนร่วมใน PCA
ใน PCA มันสร้างความแตกต่างหรือไม่ถ้าเราเลือกส่วนประกอบหลักของเมทริกซ์ความแปรปรวนร่วมผกผันหรือถ้าเราปล่อยค่าลักษณะเฉพาะความแปรปรวนร่วมของเมทริกซ์ความแปรปรวนร่วมที่สอดคล้องกับค่าลักษณะเฉพาะขนาดใหญ่ สิ่งนี้เกี่ยวข้องกับการสนทนาในโพสต์นี้

3
ตัวแบบการถดถอยแบบใดที่เหมาะสมที่สุดที่จะใช้กับข้อมูลการนับ
ฉันกำลังพยายามหาสถิติเล็กน้อย แต่ฉันติดอยู่กับบางสิ่ง ข้อมูลของฉันมีดังนี้: Year Number_of_genes 1990 1 1991 1 1993 3 1995 4 ตอนนี้ฉันต้องการสร้างแบบจำลองการถดถอยเพื่อให้สามารถทำนายจำนวนยีนสำหรับปีใดก็ตามโดยอ้างอิงจากข้อมูล ฉันทำมันด้วยการถดถอยเชิงเส้นจนกระทั่งตอนนี้ แต่ฉันได้อ่านมาแล้วและดูเหมือนจะไม่เป็นทางเลือกที่ดีที่สุดสำหรับข้อมูลประเภทนี้ ฉันได้อ่านว่าการถดถอยของปัวซองอาจมีประโยชน์ แต่ฉันไม่แน่ใจว่าจะใช้อะไร ดังนั้นคำถามของฉันคือ: มีรูปแบบการถดถอยทั่วไปสำหรับข้อมูลประเภทนี้หรือไม่? ถ้าไม่ฉันต้องทำอย่างไรเพื่อค้นหาว่าวิธีใดเหมาะสมที่สุดที่จะใช้ (ในแง่ของสิ่งที่ฉันต้องค้นหาเกี่ยวกับข้อมูล)

3
Cohen's d สำหรับการทดสอบตัวอย่างขึ้นอยู่กับ
คำถามด่วน: ฉันเคยเห็นโคเฮนคำนวณวิธีที่ต่างกันสองวิธีสำหรับตัวอย่างที่ต้องทดสอบ t-test (เช่นการออกแบบภายในตัวอย่างที่ทดสอบประสิทธิภาพของยาที่มีการจับเวลาก่อน / หลัง) ใช้ค่าเบี่ยงเบนมาตรฐานของคะแนนการเปลี่ยนแปลงในส่วนของสมการสำหรับ Cohen's d การใช้ค่าเบี่ยงเบนมาตรฐานของคะแนนทดสอบก่อนกำหนดในส่วนของสมการสำหรับ Cohen's d ฉันพบว่ามีวรรณกรรมน้อยมากที่อธิบายถึงการใช้และ / หรือตัวเลือกใดตัวเลือกหนึ่ง มีความคิดด่วนไหม?

1
การสร้างแบบจำลองอนุกรมเวลาไบนารีที่สัมพันธ์กันโดยอัตโนมัติ
อะไรคือวิธีปกติในการสร้างแบบจำลองอนุกรมเวลาไบนารี? มีกระดาษหรือหนังสือที่มีการรักษาไหม? ฉันคิดว่ากระบวนการแบบไบนารีที่มีความสัมพันธ์แบบอัตโนมัติที่แข็งแกร่ง บางอย่างเช่นสัญลักษณ์ของกระบวนการ AR (1) เริ่มต้นที่ศูนย์ Sayและ มีสัญญาณรบกวนสีขาว\ epsilon_t จากนั้นอนุกรมเวลาแบบไบนารี่(Y_t) _ {t \ ge 0} ที่กำหนดโดย Y_t = \ text {sign} (X_t) จะแสดงความสัมพันธ์อัตโนมัติซึ่งฉันต้องการแสดงด้วยรหัสต่อไปนี้X0= 0X0=0X_0 = 0Xt + 1= β1Xเสื้อ+ ϵเสื้อ,Xt+1=β1Xt+ϵt, X_{t+1} = \beta_1 X_t + \epsilon_t, εเสื้อϵt\epsilon_t( Yเสื้อ)t ≥ 0(Yt)t≥0(Y_t)_{t \ge 0}Yเสื้อ= sign ( Xเสื้อ)Yt=sign(Xt) Y_t = \text{sign}(X_t) set.seed(1) …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.