สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การใช้การตรวจสอบข้ามมีผลต่อผลลัพธ์หรือไม่
อย่างที่คุณทราบมีการตรวจสอบข้ามแบบนิยมสองประเภท K-fold และการสุ่มตัวอย่างแบบสุ่ม (ดังอธิบายในWikipedia ) อย่างไรก็ตามฉันรู้ว่านักวิจัยบางคนกำลังสร้างและตีพิมพ์เอกสารที่บางสิ่งที่อธิบายไว้ในฐานะ K-fold CV นั้นเป็นตัวอย่างย่อยแบบสุ่มดังนั้นในทางปฏิบัติคุณไม่เคยรู้ว่าจริงๆแล้วคืออะไรในบทความที่คุณกำลังอ่าน โดยปกติแล้วความแตกต่างนั้นไม่สามารถสังเกตเห็นได้และคำถามของฉันก็เป็นไปได้ไหม - คุณลองนึกถึงตัวอย่างเมื่อผลลัพธ์ของประเภทหนึ่งแตกต่างกันอย่างมีนัยสำคัญหรือไม่



10
แนะนำการสร้างภาพไลบรารีสำหรับแอปพลิเคชันแบบสแตนด์อโลน
คุณต้องการแนะนำให้แสดงภาพไลบรารีใดในแปลง (พล็อตกราฟ ... ) ในแอปพลิเคชันแบบสแตนด์อโลน (Linux, .Net, Windows หรืออะไรก็ตาม) ประสิทธิภาพที่เหมาะสมจะดีเช่นกัน

1
ความแตกต่างระหว่าง Naive Bayes กับ Recurrent Neural Network (LSTM)
ฉันต้องการที่จะทำการวิเคราะห์ความเชื่อมั่นในข้อความได้ผ่านหลายบทความบางคนกำลังใช้"Naive Bayes"และอื่น ๆ คือ"Recurrent Neural Network (LSTM)"ในทางกลับกันฉันได้เห็นห้องสมุดหลามสำหรับการวิเคราะห์ความเชื่อมั่นว่า คือ nltk มันใช้"Naive Bayes"ทุกคนสามารถอธิบายความแตกต่างระหว่างการใช้สองคนนี้ได้อย่างไร ฉันได้ผ่านโพสต์นี้ไปแล้ว แต่ไม่ชัดเจนเกี่ยวกับพวกเขาทั้งคู่ .. ความแตกต่างระหว่างเครือข่าย Bayes, โครงข่ายประสาทเทียม, ต้นไม้ตัดสินใจและมุ้ง Petri

4
ค่า Worm และ Apple ที่คาดหวัง
แอปเปิ้ลตั้งอยู่ที่จุดสุดยอดของเพนตากอนและหนอนตั้งอยู่สองจุดอยู่ห่างออกไปที่Cทุกวันหนอนจะคลานด้วยความน่าจะเป็นที่เท่ากันของหนึ่งในสองจุดยอดที่อยู่ติดกัน ดังนั้นหลังจากที่วันหนึ่งหนอนที่จุดสุดยอดหรือแต่ละคนมีความน่าจะเป็น1/2หลังจากสองวันหนอนอาจกลับมาที่อีกครั้งเนื่องจากไม่มีหน่วยความจำของตำแหน่งก่อนหน้า เมื่อถึงจุดสุดยอดมันจะหยุดรับประทานอาหารAAAABCDEABCDEABCDECCCBBBDDD1/21/21/2CCCAAA (a) จำนวนวันจนกระทั่งอาหารค่ำคืออะไร? (b) ให้ p เป็นความน่าจะเป็นที่จำนวนวันเป็นหรือมากกว่า ความไม่เท่าเทียมของมาร์คอฟพูดถึงอย่างไร100100100ppp สำหรับ (a) ให้เป็นตัวแปรสุ่มที่กำหนดโดยจำนวนวันจนกระทั่งอาหารเย็น ดังนั้นP (X = 0) = 0 \\ P (X = 1) = 0 \\ P (X = 2) = \ frac {1} {\ binom {5} {2}} \\ \ vdotsXXXP(X=0)=0P(X=1)=0P(X=2)=1(52)⋮P(X=0)=0P(X=1)=0P(X=2)=1(52)⋮ P(X = 0) = 0 \\ P(X=1) = …

3
การแจกแจงแบบปกติ
มีปัญหาทางสถิติที่ฉันโชคไม่ดีที่ไม่รู้จะเริ่มต้นอย่างไร (ฉันกำลังศึกษาด้วยตัวเองดังนั้นจึงไม่มีใครถามได้ถ้าฉันไม่เข้าใจอะไร คำถามคือ X,YX,YX,Y iidN(a,b2);a=0;b2=6;var(X2+Y2)=?N(a,b2);a=0;b2=6;var(X2+Y2)=?N(a,b^2); a=0; b^2=6; var(X^2+Y^2)=?

2
ทำไมชุดข้อมูลนี้จึงไม่มีความแปรปรวนร่วม
ความเข้าใจของฉันเกี่ยวกับความแปรปรวนร่วมในการทำงานคือข้อมูลที่มีความสัมพันธ์ควรมีความแปรปรวนร่วมค่อนข้างสูง ฉันเจอสถานการณ์ที่ข้อมูลของฉันดูมีความสัมพันธ์ (ดังที่แสดงในพล็อตกระจาย) แต่ความแปรปรวนร่วมอยู่ใกล้ศูนย์ ความแปรปรวนร่วมของข้อมูลจะเป็นศูนย์ได้อย่างไรถ้าพวกมันมีความสัมพันธ์กัน? import numpy as np x1 = np.array([ 0.03551153, 0.01656052, 0.03344669, 0.02551755, 0.02344788, 0.02904475, 0.03334179, 0.02683399, 0.02966126, 0.03947681, 0.02537157, 0.03015175, 0.02206443, 0.03590149, 0.03702152, 0.02697212, 0.03777607, 0.02468797, 0.03489873, 0.02167536]) x2 = np.array([ 0.0372599 , 0.02398212, 0.03649548, 0.03145494, 0.02925334, 0.03328783, 0.03638871, 0.03196318, 0.03347346, 0.03874528, 0.03098697, 0.03357531, 0.02808358, 0.03747998, …

1
ฉันสามารถตัวอย่างชุดข้อมูลขนาดใหญ่ที่การทำซ้ำ MCMC ทุกครั้งได้หรือไม่
ปัญหา:ฉันต้องการทำการสุ่มตัวอย่างของกิ๊บส์เพื่อสรุปหลังชุดข้อมูลขนาดใหญ่ โชคไม่ดีโมเดลของฉันไม่ง่ายนักและการสุ่มตัวอย่างช้าเกินไป ฉันจะพิจารณาแนวทางที่หลากหลายหรือขนาน แต่ก่อนที่จะไปไกล ... คำถาม:ฉันต้องการทราบว่าฉันสามารถสุ่มตัวอย่างตัวอย่าง (พร้อมการแทนที่) จากชุดข้อมูลของฉันที่การวนซ้ำของกิ๊บส์ทุกครั้งหรือไม่ สัญชาตญาณของฉันคือแม้ว่าฉันจะเปลี่ยนตัวอย่างฉันจะไม่เปลี่ยนความหนาแน่นของความน่าจะเป็นและดังนั้นตัวอย่างกิ๊บส์ไม่ควรสังเกตเห็นเคล็ดลับ ฉันถูกไหม? มีผู้อ้างอิงบางคนที่ทำสิ่งนี้หรือไม่?

1
วิธีการวัดจำนวนคนในภาพของฝูงชนหรือไม่?
พื้นหลัง : อิสราเอล (และตะวันออกกลางโดยทั่วไป) เต็มไปด้วยการประท้วง ฉันอยากรู้อยากเห็นเมื่อได้รับภาพเพื่อประเมินจำนวนคนที่อยู่ในภาพนั้น (มักจะเป็นภาพของฝูงชนขนาดใหญ่) การสร้างแบบจำลองใดที่สามารถเสนอวิธีแก้ไขปัญหานี้ได้บ้าง (และแน่นอนว่ามันสามารถทำได้กับแพ็คเกจโอเพนซอร์ซใด ๆ Say, R?)

1
ฉันสามารถใส่โมเดลผสมกับวัตถุที่มีเพียงการสังเกต 1 ข้อเท่านั้นหรือไม่
ฉันมีชุดข้อมูลที่มีขนาดใหญ่มากซึ่งฉันได้ทำการวัดซ้ำหลายครั้งในแต่ละสถานที่ บางตำแหน่งอาจมีจุดข้อมูล 10 จุดและบางตำแหน่งมีเพียงจุดข้อมูล 1 จุด ฉันพอดีกับโมเดลผสมและใช้ตำแหน่งเป็นเอฟเฟกต์แบบสุ่ม คำถามของฉันคือฉันยังสามารถใช้ตำแหน่งที่มีเพียง 1 จุดข้อมูล (เนื่องจากคุณไม่สามารถสร้างบรรทัดการถดถอยด้วยข้อมูลเพียง 1) หรือฉันควรยกเว้นสถานที่เหล่านั้นหรือไม่

1
วิธีการวิเคราะห์ความสัมพันธ์ 'เบียร์และผ้าอ้อม'
ฉันมีข้อมูลที่เทียบเท่ากับ: shopper_1 = ['beer', 'eggs', 'water',...] shopper_2 = ['diapers', 'beer',...] ... ฉันต้องการทำการวิเคราะห์บางอย่างกับชุดข้อมูลนี้เพื่อรับเมทริกซ์สหสัมพันธ์ที่จะมีความหมายคล้ายกับ: หากคุณซื้อ x คุณมีแนวโน้มที่จะซื้อ y ใช้ไพ ธ อน (หรือบางทีอาจเป็นอะไรก็ได้ยกเว้น MATLAB) ฉันจะทำยังไงต่อไป แนวทางพื้นฐานบางอย่างหรือตัวชี้ไปยังที่ที่ฉันควรดูจะช่วย ขอบคุณ, แก้ไข - สิ่งที่ฉันได้เรียนรู้: ปัญหาเหล่านี้เรียกว่าการค้นพบกฎการเชื่อมโยง Wikipedia มีบทความที่ดีที่ครอบคลุมอัลกอริทึมทั่วไปบางประการที่ควรทำ อัลกอริทึมแบบดั้งเดิมที่ทำเช่นนั้นน่าจะเป็น Apriori เนื่องจาก Agrawal และ อัล นั่นทำให้ฉันเป็นสีส้มแพคเกจหลาม data interconnect สำหรับ Linux วิธีที่ดีที่สุดในการติดตั้งนั้นมาจากแหล่งที่มาโดยใช้ setup.py ที่ให้มา ออเรนจ์โดยค่าเริ่มต้นจะอ่านอินพุตจากไฟล์ซึ่งจัดรูปแบบด้วยวิธีใดวิธีหนึ่งที่รองรับ ในที่สุดการเรียนรู้กฎของ Apriori อย่างง่าย ๆก็เป็นสีส้ม
โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.