สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
MFCCs เป็นวิธีที่ดีที่สุดในการแสดงเพลงไปยังระบบดึงข้อมูลหรือไม่?
เทคนิคการประมวลสัญญาณที่Mel frequency Cepstrumมักใช้เพื่อดึงข้อมูลจากชิ้นดนตรีเพื่อใช้ในงานการเรียนรู้ของเครื่อง วิธีนี้ให้สเปกตรัมพลังงานระยะสั้นและค่าสัมประสิทธิ์ถูกใช้เป็นอินพุต ในการออกแบบระบบดึงเพลงค่าสัมประสิทธิ์ดังกล่าวถือเป็นลักษณะของชิ้นส่วน (เห็นได้ชัดว่าไม่จำเป็นต้องเป็นเอกลักษณ์ แต่แตกต่าง) มีคุณสมบัติใดบ้างที่เหมาะกับการเรียนรู้กับเครือข่ายมากขึ้น? ลักษณะที่เปลี่ยนแปลงตามเวลาเช่นความก้าวหน้าของเสียงเบสของชิ้นส่วนที่ใช้ในบางอย่างเช่นเครือข่าย Elmanทำงานได้อย่างมีประสิทธิภาพมากขึ้นหรือไม่ ลักษณะใดที่จะก่อให้เกิดการจัดหมวดหมู่ที่ครอบคลุมพอที่จะเกิดขึ้น

3
ล้างข้อมูลอัตโนมัติ
ปัญหาที่พบบ่อยคือ ML เป็นข้อมูลที่มีคุณภาพไม่ดี: ข้อผิดพลาดในค่าคุณลักษณะ, อินสแตนซ์ที่ผิดประเภท ฯลฯ ฯลฯ วิธีหนึ่งในการจัดการปัญหานี้คือการตรวจสอบข้อมูลด้วยตนเอง แต่มีเทคนิคอื่นหรือไม่? (ฉันเดิมพันมี!) อันไหนดีกว่าและทำไม?

3
เหตุใดจึงมีค่า R ^ 2 (และสิ่งที่กำหนดไว้) เมื่อ lm ไม่มีความแปรปรวนในค่าที่คาดการณ์
พิจารณารหัส R ต่อไปนี้: example <- function(n) { X <- 1:n Y <- rep(1,n) return(lm(Y~X)) } #(2.13.0, i386-pc-mingw32) summary(example(7)) #R^2 = .1963 summary(example(62)) #R^2 = .4529 summary(example(4540)) #R^2 = .7832 summary(example(104))) #R^2 = 0 #I did a search for n 6:10000, the result for R^2 is NaN for #n = 2, …
10 r  regression 

3
วัดซ้ำแบบจำลองสมการโครงสร้าง
ฉันต้องการวิเคราะห์ชุดข้อมูลของข้อมูลการฟื้นฟูสมรรถภาพทางคลินิก ฉันสนใจในความสัมพันธ์ที่ขับเคลื่อนด้วยสมมุติฐานระหว่างปริมาณข้อมูลที่ป้อนเข้า (ปริมาณของการรักษา) และการเปลี่ยนแปลงสถานะสุขภาพ แม้ว่าชุดข้อมูลจะมีขนาดค่อนข้างเล็ก (n ~ 70) เรามีข้อมูลซ้ำ ๆ ที่สะท้อนการเปลี่ยนแปลงทางโลกทั้งคู่ ฉันคุ้นเคยกับการสร้างแบบจำลองเอฟเฟ็กต์ที่ไม่ใช่เชิงเส้นใน R แต่ฉันสนใจในความสัมพันธ์แบบ "เชิงสาเหตุ" ที่อาจเกิดขึ้นระหว่างอินพุตและเอาต์พุตที่นี่และกำลังพิจารณาการประยุกต์ใช้มาตรการซ้ำ ๆ ของ SEM ฉันขอขอบคุณคำแนะนำว่าหากแพ็คเกจ SEM สำหรับ R (sam, lavaan, openmx?) ใดเหมาะที่สุดกับข้อมูลการวัดซ้ำ ๆ และโดยเฉพาะคำแนะนำสำหรับตำรา (มี "Pinheiro และ Bates" ของฟิลด์หรือไม่) .

2
ช่วงความเชื่อมั่นสำหรับไคสแควร์
ฉันพยายามหาวิธีแก้ปัญหาเพื่อเปรียบเทียบการทดสอบ "ดี - พอดี - แบบไค - สแควร์" แม่นยำยิ่งขึ้นฉันต้องการเปรียบเทียบผลลัพธ์จากการทดสอบอิสระสองครั้ง ในการทดลองเหล่านี้ผู้เขียนใช้ความดีแบบพอดีไคสแควร์เพื่อเปรียบเทียบการคาดเดาแบบสุ่ม (ความถี่ที่คาดหวัง) กับความถี่ที่สังเกตได้ การทดลองสองรายการมีจำนวนผู้เข้าร่วมเท่ากันและขั้นตอนการทดลองเหมือนกันมีเพียงสิ่งเร้าที่เปลี่ยนไป ผลการทดลองทั้งสองระบุว่าไคสแควร์อย่างมีนัยสำคัญ (exp. 1: X² (18) = 45; p <.0005 และ exp 2: X² (18) = 79; p <.0001) ทีนี้สิ่งที่ฉันอยากทำคือทดสอบว่ามีความแตกต่างระหว่างสองผลลัพธ์นี้หรือไม่ ฉันคิดว่าวิธีแก้ปัญหาอาจใช้ช่วงความเชื่อมั่น แต่ฉันไม่รู้วิธีคำนวณช่วงความมั่นใจเหล่านี้กับผลลัพธ์เหล่านี้เท่านั้น หรืออาจเป็นการทดสอบเพื่อเปรียบเทียบขนาดเอฟเฟกต์ (Cohen's w)? ใครมีทางออก? ขอบคุณมาก! FD

4
มีวิธีใช้การตรวจสอบไขว้เพื่อทำการเลือกตัวแปร / คุณสมบัติใน R หรือไม่?
ฉันมีชุดข้อมูลที่มีตัวแปรประมาณ 70 ตัวที่ฉันต้องการลด สิ่งที่ฉันต้องการทำคือใช้ CV เพื่อค้นหาตัวแปรที่มีประโยชน์มากที่สุดในรูปแบบต่อไปนี้ 1) สุ่มเลือกพูด 20 ตัวแปร 2) ใช้stepwise/ LASSO/ lars/ ฯลฯ เพื่อเลือกตัวแปรที่สำคัญที่สุด 3) ทำซ้ำ ~ 50x และดูว่าตัวแปรใดถูกเลือก (ไม่ตัดออก) บ่อยที่สุด นี่เป็นไปตามสายของสิ่งที่randomForestจะทำ แต่rfVarSelดูเหมือนว่าแพคเกจจะทำงานเฉพาะกับปัจจัย / การจัดหมวดหมู่และฉันจำเป็นต้องทำนายตัวแปรตามอย่างต่อเนื่อง ฉันกำลังใช้ R ดังนั้นคำแนะนำใด ๆ ก็จะถูกนำไปใช้อย่างเหมาะสม

4
คำอธิบายของการจำลองทางสถิติ
ฉันไม่ใช่นักสถิติ ดังนั้นโปรดอดทนกับความผิดพลาดของฉันถ้ามี คุณช่วยอธิบายด้วยวิธีง่ายๆได้ไหม ฉันรู้ว่ามันเลือกตัวอย่างสุ่มจากการแจกแจงแบบปกติและใช้สำหรับการจำลอง แต่ไม่เข้าใจอย่างชัดเจน
10 simulation 

3
การเหลือบมองครั้งแรกอย่างรวดเร็วที่ชุดข้อมูล
กรุณาให้อภัยความไม่รู้ของฉัน แต่ ... ฉันพบตัวเองอยู่ในสถานการณ์ที่ฉันต้องเผชิญกับข้อมูลใหม่ ๆ มากมายที่ฉันพยายามหา ข้อมูลนี้มักจะมีลักษณะดังนี้: Date Number1 Number2 Category1 Category2 20120125 11 101 Dog Brown 20120126 21 90 Cat Black 20120126 31 134 Cat Brown (...) โดยทั่วไปในครั้งแรกที่ฉันไม่สามารถบอกได้ว่ามีแนวโน้มใด ๆ ที่นี่หรือไม่ ความสัมพันธ์ระหว่างคอลัมน์ต่าง ๆ อาจไม่สำคัญมาก แต่ฉันจะดีใจถ้าฉันไม่ต้องสร้างพล็อตด้วยตนเองสำหรับทุกชุดของคอลัมน์ / หมวดหมู่ที่เป็นไปได้ มีเครื่องมือที่จะยอมรับตารางของข้อมูลพร้อมกับข้อมูลที่คอลัมน์ควรจะถือว่าเป็นตัวเลขวันที่และหมวดหมู่แล้วดำเนินการพล็อต: ความสัมพันธ์ระหว่างแต่ละคอลัมน์สองคอลัมน์ ความสัมพันธ์ระหว่างแต่ละคอลัมน์สองคอลัมน์โดยมีเส้นแนวโน้มแยกกันสำหรับแต่ละหมวดหมู่ แต่ละคอลัมน์ตัวเลขเป็นอนุกรมเวลา แต่ละคอลัมน์ตัวเลขเป็นอนุกรมเวลาคั่นด้วยหมวดหมู่ เป็นต้น ในที่สุดสิ่งนี้จะสร้างแปลงจำนวนมากซึ่งส่วนใหญ่จะแสดงเพียงเสียงรบกวน ตามหลักการแล้วเครื่องมือสามารถทำคะแนนพล็อตตามความสัมพันธ์และในที่สุดก็แสดงสไลด์โชว์โดยเริ่มจากพล็อตการให้คะแนนสูงสุด นี่จะไม่สมบูรณ์มาก แต่มีประโยชน์อย่างรวดเร็วก่อนที่ชุดข้อมูล ดังนั้น? มีเครื่องมือที่ทุกคนใช้สำหรับสิ่งนี้และฉันไม่รู้เกี่ยวกับมันหรือเป็นสิ่งที่เราต้องทำหรือไม่?

7
ใน R ไดรเวอร์กราฟิกที่ดีที่สุดสำหรับการใช้กราฟใน Microsoft Word คืออะไร
ฉันใช้ R เพื่อสร้างกราฟที่เรียบร้อยที่ฉันใช้ในเอกสาร Microsoft Office ตามหน้านี้คุณภาพที่ดีที่สุดนั้นมาพร้อมกับไดรเวอร์ PDF น่าเสียดายที่ Word ไม่รองรับการนำเข้าตัวเลข PDF ฉันควรใช้อะไร

1
ฉันจะประเมินความแตกต่างของเฟสระหว่างอนุกรมเวลาสองช่วงได้อย่างไร
ฉันมีซีรีย์ 2 เวลาต่อวันนาน 6 ปี ในขณะที่มีเสียงรบกวนพวกเขาทั้งสองอย่างชัดเจนเป็นระยะ (มีความถี่ ~ 1 ปี) แต่ดูเหมือนจะออกจากเฟส ฉันต้องการประเมินความแตกต่างของเฟสระหว่างอนุกรมเวลาเหล่านี้ ฉันได้พิจารณาเส้นโค้งที่เหมาะสมของแบบฟอร์มกับแต่ละชุดข้อมูลและเพิ่งเปรียบเทียบค่าที่แตกต่างกันสองค่าสำหรับ b แต่ฉันสงสัยว่ามีความสง่างามมากขึ้น ( และวิธีการที่เข้มงวด! สำหรับการทำสิ่งนี้ (อาจใช้การแปลงฟูริเยร์?) ฉันยังต้องการที่จะมีแนวคิดบางอย่างเกี่ยวกับความไม่แน่นอนในการประมาณความต่างเฟสของฉันหากเป็นไปได้บาป( 2 π365t - b )asin⁡(2π365t−b)a\sin(\frac{2\pi}{365}t - b) อัปเดต : ภูมิภาคที่แรเงาคือ 95% CIs ตัวอย่างการเชื่อมโยงระหว่างสองอนุกรมเวลา:

1
ขนาดของต้นไม้ในการไล่ระดับต้นไม้ไล่สี
การไล่ระดับต้นไม้แบบไล่ตามที่เสนอโดยฟรีดแมนใช้ต้นไม้ตัดสินใจด้วยJโหนดขั้ว (= ใบ) เป็นผู้เรียนพื้นฐาน มีหลายวิธีในการปลูกต้นไม้ที่มีJจุดตรงตัวอย่างเช่นสามารถปลูกต้นไม้ในแบบลึกแรกหรือแบบกว้างแรก ... มีวิธีการที่กำหนดไว้ในการปลูกต้นไม้ด้วยJโหนดเทอร์มินัลสำหรับการไล่ระดับสีต้นไม้หรือไม่? ฉันตรวจสอบขั้นตอนการปลูกต้นไม้ของgbmแพ็คเกจของ R และดูเหมือนว่ามันจะขยายต้นไม้ในลักษณะที่ลึกเป็นอันดับแรกและใช้การวิเคราะห์แบบฮิวริสติกโดยปรับปรุงข้อผิดพลาดเพื่อเลือกว่าจะขยายโหนดด้านซ้ายหรือโหนดลูกที่ถูกต้องหรือไม่
10 r  cart  boosting 

4
วิธีการตีความสัมประสิทธิ์การแปลงลอการิทึมในการถดถอยเชิงเส้น?
สถานการณ์ของฉันคือ ฉันมีตัวแปรพึ่งพาอย่างต่อเนื่อง 1 ตัวและตัวแปรทำนายต่อเนื่อง 1 ตัวที่ฉันเปลี่ยนลอการิทึมเพื่อทำให้ปกติเหลืออยู่สำหรับการถดถอยเชิงเส้นอย่างง่าย ฉันขอขอบคุณความช่วยเหลือใด ๆ เกี่ยวกับวิธีที่ฉันสามารถเชื่อมโยงตัวแปรที่แปลงสภาพเหล่านี้กับบริบทดั้งเดิมของพวกเขา ฉันต้องการใช้การถดถอยเชิงเส้นเพื่อทำนายจำนวนวันที่นักเรียนพลาดโรงเรียนในปี 2011 ตามจำนวนวันที่พวกเขาพลาดในปี 2010 นักเรียนส่วนใหญ่พลาด 0 วันหรือเพียงไม่กี่วันข้อมูลจะเอียงไปทางซ้าย ดังนั้นจึงจำเป็นต้องมีการแปลงสภาพเพื่อใช้การถดถอยเชิงเส้น ฉันใช้ log10 (var + 1) สำหรับทั้งสองตัวแปร (ฉันใช้ +1 สำหรับนักเรียนที่ไม่ได้เรียน 0 วัน) ฉันกำลังใช้การถดถอยเพราะฉันต้องการเพิ่มในปัจจัยการจัดหมวดหมู่ - เพศ / เชื้อชาติ ฯลฯ ปัญหาของฉันคือ: ผู้ชมที่ฉันต้องการย้อนกลับไปจะไม่เข้าใจ log10 (y) = log (ค่าคงที่) + บันทึก (var2) x (และตรงไปตรงมาไม่ทำฉัน) คำถามของฉันคือ: a) มีวิธีที่ดีกว่าในการตีความตัวแปรที่ถูกแปลงในการถดถอยหรือไม่? เช่นเคยพลาด …


1
สมมติฐานว่างในการทดสอบแมนน์ - วิทนีย์คืออะไร?
ให้เป็นค่าสุ่มจากการกระจาย 1 และให้เป็นค่าสุ่มจากการกระจาย 2. ผมคิดว่าสมมติฐานสำหรับการทดสอบ Mann-Whitney เป็น&lt;X_1)X1X1X_1X2X2X_2P(X1&lt;X2)=P(X2&lt;X1)P(X1&lt;X2)=P(X2&lt;X1)P(X_1 < X_2) = P(X_2 < X_1) ถ้าฉันใช้การจำลองการทดสอบ Mann-Whitney กับข้อมูลจากการแจกแจงแบบปกติที่มีค่าเฉลี่ยเท่ากันและผลต่างที่เท่ากันด้วยฉันจะได้รับอัตราความผิดพลาด Type I ซึ่งใกล้เคียงกับ 0.05 มาก อย่างไรก็ตามถ้าฉันทำให้ความแปรปรวนไม่เท่ากัน (แต่ให้ค่าเฉลี่ยเท่ากัน) สัดส่วนของการจำลองที่สมมติฐานว่างถูกปฏิเสธมีขนาดใหญ่กว่า 0.05 ซึ่งฉันไม่ได้คาดหวังเนื่องจากยังคงอยู่ นี้เกิดขึ้นเมื่อผมใช้ในการวิจัยโดยไม่คำนึงว่าฉันมี, หรือα=0.05α=0.05\alpha=0.05P(X1&lt;X2)=P(X2&lt;X1)P(X1&lt;X2)=P(X2&lt;X1)P(X_1 < X_2) = P(X_2 < X_1)wilcox.testexact=TRUEexact=FALSE, correct=TRUEexact=FALSE, correct=FALSE สมมุติฐานว่างนั้นแตกต่างจากที่ฉันเขียนไว้ข้างต้นหรือว่าการทดสอบนั้นไม่ถูกต้องในแง่ของความผิดพลาดประเภทที่ 1 หากความแปรปรวนไม่เท่ากัน?

3
จำนวนที่คาดว่าจะโยนเหรียญเพื่อให้ N ติดต่อกันตามลำดับ M
สัมภาษณ์มี CodeSprint ที่สองของพวกเขาในเดือนมกราคมที่รวมคำถามด้านล่าง คำตอบแบบเป็นโปรแกรมจะโพสต์ แต่ไม่มีคำอธิบายทางสถิติ (คุณสามารถดูปัญหาดั้งเดิมและวิธีแก้ปัญหาที่โพสต์ได้โดยลงชื่อเข้าใช้เว็บไซต์ Interviewstreet ด้วยเครดิต Google จากนั้นไปที่ปัญหา Coin Tosses จากหน้านี้) โยนเหรียญ คุณมีเหรียญที่ไม่ฝักใฝ่ฝ่ายใดซึ่งคุณต้องการที่จะโยนต่อไปจนกว่าจะได้รับ N หัวติดต่อกัน คุณได้โยนเหรียญ M ครั้งและน่าประหลาดใจการโยนทั้งหมดทำให้เกิดหัว จำนวนที่ต้องการเพิ่มเติมของการโยนจนกว่าคุณจะได้รับ N หัวติดต่อกันคืออะไร? อินพุต: บรรทัดแรกมีจำนวนเคส T แต่ละบรรทัด T ถัดไปมีสองตัวเลข N และ M เอาต์พุต: บรรทัดเอาต์พุต T ที่มีคำตอบสำหรับกรณีทดสอบที่สอดคล้องกัน พิมพ์คำตอบที่ถูกปัดเศษเป็นทศนิยม 2 ตำแหน่ง ตัวอย่างอินพุต: 4 2 0 2 1 3 3 3 2 ตัวอย่างผลลัพธ์: …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.