สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
วิธีรับค่า p-pooled จากการทดสอบที่ทำในชุดข้อมูลหลายชุด
เมื่อใช้ Amelia ใน R ฉันได้รับชุดข้อมูลหลายชุด หลังจากนั้นฉันทำการทดสอบซ้ำใน SPSS ตอนนี้ฉันต้องการรวมผลการทดสอบ ฉันรู้ว่าฉันสามารถใช้กฎของ Rubin (ดำเนินการผ่านแพ็คเกจการใส่หลาย ๆ แบบใน R) เพื่อรวมหมายถึงและข้อผิดพลาดมาตรฐาน แต่ฉันจะรวมค่า p ได้อย่างไร เป็นไปได้ไหม? มีฟังก์ชั่นใน R ที่จะทำเช่นนั้น? ขอบคุณล่วงหน้า.

4
วิธีการเลือกจำนวนของต้นไม้ในรูปแบบการถดถอยที่เพิ่มขึ้นทั่วไป?
มีกลยุทธ์ในการเลือกจำนวนต้นไม้ใน GBM หรือไม่? โดยเฉพาะntreesการโต้แย้งในRเรื่องgbmฟังก์ชั่น ฉันไม่เห็นว่าทำไมคุณไม่ควรตั้งค่าntreesที่เหมาะสมที่สุด ฉันสังเกตเห็นว่าต้นไม้จำนวนมากขึ้นลดความแปรปรวนของผลลัพธ์ได้จากหลาย GBM อย่างชัดเจน ฉันไม่คิดว่าต้นไม้จำนวนมากจะนำไปสู่การ overfitting ความคิดใด ๆ

2
การตั้งค่าใดที่จะมั่นใจได้ว่าช่วงเวลาจะไม่ดีขึ้นเมื่อขนาดตัวอย่างเพิ่มขึ้น
ในโพสต์บล็อกฉันพบการอ้างสิทธิ์นั้น "ฉันเชื่อ WG Cochrane จุดแรก (ประมาณ 1970's) ว่าด้วยช่วงความเชื่อมั่นในการตั้งค่าการสังเกตขนาดของตัวอย่างขนาดเล็กส่งผลให้การครอบคลุมที่ดีขึ้นด้วยตัวอย่างที่มีขนาดใหญ่พอให้ใกล้ศูนย์ครอบคลุม! ตอนนี้ฉันคิดว่าความกว้างของ CI ควรเข้าหา 0 ด้วยการเพิ่มขนาดตัวอย่าง แต่ความคิดที่ว่าความครอบคลุมจะแย่ลงพร้อมกันไม่น่าเชื่อถือสำหรับฉัน การเรียกร้องนี้เป็นจริงและภายใต้สถานการณ์ใด หรือฉันอ่านผิด ฉันใช้การจำลองโดยใช้ข้อมูลที่กระจายแบบสุ่มที่มีขนาดตัวอย่างจาก 10,000 ถึง 1000000 (ทดสอบหนึ่งตัวอย่าง, 95% CI), 1,000 เรียกใช้ในทุกขนาดตัวอย่างและความครอบคลุมไม่เลวร้ายสำหรับขนาดตัวอย่างที่สูงขึ้น (แทนฉันพบอัตราข้อผิดพลาดที่คาดว่าจะใกล้ ~ 5%)

2
การจำแนกอนุกรมเวลา - ผลลัพธ์ที่แย่มาก
ฉันกำลังทำงานเกี่ยวกับปัญหาการจำแนกอนุกรมเวลาที่อินพุตเป็นข้อมูลการใช้เสียงอนุกรมเวลา (เป็นวินาที) สำหรับ 21 วันแรกของบัญชีโทรศัพท์มือถือ ตัวแปรเป้าหมายที่สอดคล้องกันคือยกเลิกบัญชีนั้นในช่วง 35-45 วันหรือไม่ ดังนั้นมันจึงเป็นปัญหาการจำแนกเลขฐานสอง ฉันได้รับผลลัพธ์ที่แย่มากจากวิธีการทั้งหมดที่ฉันได้ลองมา (จนถึงระดับที่แตกต่างกัน) ก่อนอื่นฉันลองจำแนก k-NN (ด้วยการดัดแปลงต่าง ๆ ) และได้ผลลัพธ์ที่แย่มาก สิ่งนี้นำฉันไปสู่การแยกคุณลักษณะต่างๆจากอนุกรมเวลา - นั่นคือค่าเฉลี่ยความแปรปรวนค่าสูงสุดนาทีค่าศูนย์รวมจำนวนวันที่เป็นศูนย์ทั้งหมดความแตกต่างระหว่างค่าเฉลี่ยครึ่งปีแรกและค่าเฉลี่ยครึ่งปีหลังเป็นต้น วันเป็นศูนย์และศูนย์วันทั้งหมดต่อท้าย (โดยใช้อัลกอริทึมการจำแนกประเภทต่างๆ) สิ่งนี้ทำได้ดีที่สุด แต่ประสิทธิภาพก็ยังไม่ดีนัก กลยุทธ์ต่อไปของฉันคือการใช้งานอินสแตนซ์เชิงลบในชุดการฝึกอบรมของฉันเนื่องจากมีจำนวนน้อยมาก สิ่งนี้ส่งผลให้การทำนายการยกเลิกถูกต้องมากขึ้น ฉันเริ่มคิดว่าบางทีข้อมูลการใช้อนุกรมเวลาอาจไม่สามารถคาดการณ์ได้มากนัก (แม้ว่าสามัญสำนึกบอกว่าควรจะเป็น) บางทีอาจมีตัวแปรแฝงที่ฉันไม่ได้พิจารณา การดูข้อมูลยังแสดงพฤติกรรมแปลก ๆ นั่นคือตัวอย่างบางส่วนแสดงการใช้งานน้อยมากหรือลดลง (หรือบางครั้งไม่มีเลย) และอย่ายกเลิกและบางคนแสดงการใช้งานที่เพิ่มขึ้นซึ่งยกเลิก บางทีพฤติกรรมที่ขัดแย้งนี้ไม่ได้สร้างขอบเขตการตัดสินใจที่ชัดเจนมากสำหรับตัวจําแนก แหล่งที่มาที่เป็นไปได้สำหรับข้อผิดพลาดคือข้อเท็จจริงที่ว่าตัวอย่างการฝึกอบรมจำนวนมากกระจัดกระจายมาก (เช่นหลายวันที่มีการใช้งาน 0 ครั้ง) แนวคิดหนึ่งที่ฉันยังไม่ได้ลองคือการแบ่งซีรีย์เวลาออกเป็นเซ็กเมนต์และสร้างคุณลักษณะบางอย่างในแบบนั้น แต่ฉันไม่มีความหวังสูง

1
ตัวอย่างการประมาณหลังสูงสุด
ฉันได้อ่านเกี่ยวกับการประมาณความเป็นไปได้สูงสุดและการประมาณหลังสูงสุดและจนถึงตอนนี้ฉันได้พบตัวอย่างที่เป็นรูปธรรมเท่านั้นด้วยการประมาณความเป็นไปได้สูงสุด ฉันได้พบตัวอย่างนามธรรมของการประมาณค่าสูงสุดหลัง แต่ก็ยังไม่มีตัวเลขที่เป็นรูปธรรม: S มันสามารถครอบงำได้มากทำงานเฉพาะกับตัวแปรและฟังก์ชั่นที่เป็นนามธรรมและเพื่อไม่ให้จมน้ำตายในความเป็นนามธรรมนี้มันเป็นเรื่องดีที่จะเชื่อมโยงสิ่งต่าง ๆ เข้ากับโลกแห่งความจริงเป็นครั้งคราว แต่แน่นอนนี่เป็นเพียงการสังเกตของฉัน (และคนอื่น ๆ ) :) ดังนั้นทุกคนสามารถให้ฉันตัวอย่างง่ายๆ แต่เป็นรูปธรรมเกี่ยวกับการประมาณ Posteriori สูงสุดด้วยตัวเลขบน? นั่นจะช่วยได้มาก :) ขอบคุณ! ฉันได้โพสต์คำถามนี้ไว้ที่ MSE แต่ไม่สามารถหาคำตอบได้ที่นั่น: /math/449386/example-of-maximum-a-posteriori-estimation ฉันได้ทำตามคำแนะนำที่ให้ไว้ที่นี่ในการโพสต์ข้าม: http://meta.math.stackexchange.com/questions/5028/how-do-i-move-a-post-to-another-forum-like-cv-stats

1
จะตีความสัมประสิทธิ์การถดถอยเชิงเส้นเชิงลบสำหรับตัวแปรผลลัพธ์ที่บันทึกไว้ได้อย่างไร?
ฉันมีรูปแบบการถดถอยเชิงเส้นที่ตัวแปรตามถูกบันทึกไว้และตัวแปรอิสระเป็นเชิงเส้น ค่าสัมประสิทธิ์ความลาดชันสำหรับตัวแปรอิสระที่สำคัญคือลบ: -.0564ไม่แน่ใจว่าจะตีความอย่างไร- .0564-0.0564-.0564 ฉันจะใช้ค่าสัมบูรณ์แล้วเปลี่ยนเป็นค่าลบเช่นนี้ ( ประสบการณ์( 0.0564 ) - 1 ) ⋅ 100 = 5.80(ประสบการณ์⁡(0.0564)-1)⋅100=5.80(\exp(0.0564)-1) \cdot 100 = 5.80 หรือ ฉันจะเสียบสัมประสิทธิ์เชิงลบเช่นนี้: ( ประสบการณ์( - 0.0564 ) - 1 ) ⋅ 100 = - 5.48(ประสบการณ์⁡(-0.0564)-1)⋅100=-5.48(\exp(-0.0564)-1) \cdot 100 = -5.48 กล่าวอีกนัยหนึ่งฉันจะใช้ตัวเลขสัมบูรณ์แล้วเปลี่ยนมันให้เป็นลบหรือฉันจะเสียบสัมประสิทธิ์เชิงลบหรือไม่? ฉันจะวลีที่ค้นพบของฉันในแง่ของการเพิ่มขึ้นหนึ่งหน่วยใน X ที่เกี่ยวข้องกับการลดลงร้อยละ __ ใน Y? อย่างที่คุณเห็นสูตรสองสูตรนี้ให้คำตอบที่ต่างกัน 2 ข้อ

1
จำนวนครั้งที่คาดว่าค่าเฉลี่ยเชิงประจักษ์จะเกินค่า
เมื่อพิจารณาลำดับของตัวแปรสุ่มของ iid ให้พูดว่าสำหรับฉันกำลังพยายามที่จะคาดเดาจำนวนครั้งที่ค่าเฉลี่ยเชิงประจักษ์จะเกินค่า, , ในขณะที่เรายังคงดึงตัวอย่างนั่นคือ: ฉัน= 1 , 2 , . . , n 1Xผม∈ [ 0 , 1 ]Xi∈[0,1]X_i \in [0,1]ฉัน= 1 , 2 , . . , ni=1,2,...,ni = 1,2,...,nc≥0T d e f = n ∑ j=1P({ 11nΣni = 1Xผม1n∑i=1nXi\frac{1}{n}\sum_{i=1}^n X_ic ≥ 0c≥0c \geq 0T=def∑j=1nP({1j∑i=1jXi≥c})T=def∑j=1nP({1j∑i=1jXi≥c}) \mathcal{T} \overset{def}{=} \sum_{j=1}^n …

1
R neuralnet - คำนวณให้คำตอบคงที่
ฉันกำลังพยายามใช้neuralnetแพ็คเกจของ R (เอกสารที่นี่ ) เพื่อคาดการณ์ นี่คือสิ่งที่ฉันพยายามทำ: library(neuralnet) x <- cbind(runif(50, min=1, max=500), runif(50, min=1, max=500)) y <- x[, 1] * x[, 2] train <- data.frame(x, y) n <- names(train) f <- as.formula(paste('y ~', paste(n[!n %in% 'y'], collapse = ' + '))) net <- neuralnet(f, train, hidden = c(5, 5), threshold=0.01) …

5
พื้นหลังทางคณิตศาสตร์สำหรับเครือข่ายประสาท
ไม่แน่ใจว่าสิ่งนี้เหมาะสมสำหรับไซต์นี้หรือไม่ แต่ฉันเริ่มต้น MSE ของฉันในสาขาวิทยาศาสตร์คอมพิวเตอร์ (BS ในคณิตศาสตร์ประยุกต์) และต้องการที่จะมีพื้นฐานที่แข็งแกร่งในการเรียนรู้ของเครื่อง หนึ่งในความสนใจย่อยของฉันคือเครือข่ายประสาท พื้นหลังทางคณิตศาสตร์ที่ดีสำหรับ ANNs คืออะไร เช่นเดียวกับในด้านอื่น ๆ ของการเรียนรู้ของเครื่องฉันคิดว่าพีชคณิตเชิงเส้นมีความสำคัญ แต่ส่วนอื่น ๆ ของคณิตศาสตร์มีความสำคัญอย่างไร ผมวางแผนที่จะอ่านโครงข่ายประสาท: บทนำอย่างเป็นระบบหรือโครงข่ายประสาทเทียมสำหรับการจดจำรูปแบบ ใครบ้างมีคำแนะนำการป้อนข้อมูลหรือคำแนะนำอื่น ๆ

1
ความแปรปรวนของผลตอบแทนประจำปีขึ้นอยู่กับความแปรปรวนของผลตอบแทนรายเดือน
ฉันพยายามที่จะเข้าใจความแตกต่างทั้งหมด / ข้อผิดพลาดมาตรฐานของชุดเวลาของผลตอบแทนทางการเงินและฉันคิดว่าฉันติดอยู่ ฉันมีชุดข้อมูลการส่งคืนสินค้ารายเดือน (เรียกว่า ) ซึ่งคาดว่ามีค่า 1.00795 และผลต่าง 0.000228 (std. dev คือ 0.01512) ฉันพยายามคำนวณกรณีเลวร้ายที่สุดของผลตอบแทนรายปี (สมมุติว่ามูลค่าที่คาดหวังลบด้วยข้อผิดพลาดมาตรฐานสองเท่า) วิธีไหนเป็นวิธีที่ดีที่สุดที่จะทำ? ก . คำนวณเป็นเดือนเดียว ( ) แล้วคูณด้วยตัวมันเอง 12 ครั้ง (= 0.7630 ) ข . สมมติว่าเดือนมีความเป็นอิสระกำหนด 12 ครั้งพบว่าเป็นค่าที่คาดหวังXXX μX−2⋅σX=0.977μX−2⋅σX=0.977\mu_X-2\cdot \sigma_X=0.977 Y=X⋅X⋅...⋅XY=X⋅X⋅...⋅XY=X\cdot X\cdot ...\cdot XE[Y]=(E[X])12E[Y]=(E[X])12E[Y]=(E[X])^{12}) และความแปรปรวน{12} สำหรับการพัฒนามาตรฐานในกรณีนี้คือ 0.0572 และค่าที่คาดหวังลบสองมาตรฐาน. dev เป็น0.9853 . ซี . คูณมาตรฐานรายเดือน. dev …

3
วิธีการฉายอวกาศมิติสูงในระนาบสองมิติ?
ฉันมีชุดของจุดข้อมูลในช่องว่าง N- มิติ นอกจากนี้ฉันยังมีเซนทรอยด์ในพื้นที่ N-มิติเดียวกัน มีวิธีใดบ้างที่อนุญาตให้ฉันฉายจุดข้อมูลเหล่านี้ลงในพื้นที่สองมิติในขณะที่เก็บข้อมูลระยะทางสัมพัทธ์ไว้ในพื้นที่เดิม PCA ถูกต้องหรือไม่

2
ตัวชี้วัดสำหรับเมทริกซ์ความแปรปรวนร่วม: ข้อเสียและจุดแข็ง
ตัวชี้วัด "ที่ดีที่สุด" สำหรับเมทริกซ์ความแปรปรวนร่วมคืออะไรและเพราะเหตุใด เป็นที่ชัดเจนสำหรับฉันว่า Frobenius & c ไม่เหมาะสมและการกำหนดมุมมีปัญหาเช่นกัน อย่างสังหรณ์ใจอาจต้องการประนีประนอมระหว่างสองคนนี้ แต่ฉันอยากจะรู้ว่ามีแง่มุมอื่น ๆ ที่ต้องจำไว้และอาจเป็นมาตรฐานที่ดี ตัวชี้วัดทั่วไปมีข้อบกพร่องต่าง ๆ เนื่องจากมันไม่เป็นธรรมชาติสำหรับเมทริกซ์ความแปรปรวนร่วมเช่นพวกเขามักจะไม่ลงโทษเมทริกซ์ PSD ที่ไม่ใช่หรือไม่ได้ทำอันดับ wrt ที่ดี (ลองดูรูปไข่หมุนรอบสองระดับต่ำ - หมุนระดับกลางให้มีระยะทางที่ต่ำกว่าค่าเฉลี่ยตามองค์ประกอบซึ่งไม่ใช่กรณีที่มีและอาจเป็น Frobenius โปรดแก้ไขให้ฉันด้วยที่นี่) นอกจากนี้นูนไม่รับประกันเสมอ มันจะเป็นการดีหากได้เห็นสิ่งเหล่านี้และปัญหาอื่น ๆ ที่ได้รับการแก้ไขโดยการวัด "ดี"L1L1L_1 นี่คือการสนทนาที่ดีของบางประเด็นตัวอย่างหนึ่งจากการเพิ่มประสิทธิภาพเครือข่ายและจากวิสัยทัศน์คอมพิวเตอร์ และนี่คือคำถามที่คล้ายกันที่ได้รับการวัดอื่น ๆ แต่ไม่มีการอภิปราย

1
โจรติดอาวุธหลายคนสำหรับการแจกรางวัลทั่วไป
ฉันกำลังทำงานกับปัญหาโจรติดอาวุธที่เราไม่มีข้อมูลเกี่ยวกับการแจกรางวัล ฉันพบเอกสารจำนวนมากที่รับประกันขอบเขตเสียใจสำหรับการแจกจ่ายที่มีขอบเขตที่ทราบและสำหรับการแจกแจงทั่วไปที่มีการสนับสนุนใน [0,1] ฉันต้องการทราบว่ามีวิธีการทำงานได้ดีในสภาพแวดล้อมที่การแจกรางวัลไม่ได้รับประกันเกี่ยวกับการสนับสนุนหรือไม่ ฉันพยายามคำนวณขีดจำกัดความอดทนแบบไม่ใช้พารามิเตอร์และใช้ตัวเลขนั้นเพื่อปรับการกระจายรางวัลเพื่อให้ฉันสามารถใช้อัลกอริทึม 2 ที่ระบุไว้ในบทความนี้ ( http://jmlr.org/proceedings/papers/v23/agrawal12/agrawal12.pdf ) ไม่มีใครคิดว่าวิธีนี้จะใช้งานได้? ถ้าไม่ทุกคนสามารถชี้ให้ฉันไปยังจุดที่เหมาะสม? ขอบคุณมัด!

3
ช่วงความเชื่อมั่นสำหรับผลิตภัณฑ์ของสองพารามิเตอร์
ให้เราสมมติเรามีสองพารามิเตอร์และP_2นอกจากนี้เรายังมีตัวประมาณค่าความน่าจะเป็นสูงสุดสองตัวและและสองช่วงความมั่นใจสำหรับพารามิเตอร์เหล่านี้ มีวิธีสร้างช่วงความมั่นใจสำหรับหรือไม่p1p1p_1p2p2p_2p1^p1^\hat{p_1}p2^p2^\hat{p_2}p1p2p1p2p_1p_2

1
การคำนวณตัวแปรคอนทราสต์พหุนาม
โปรดให้ฉันทราบวิธีการ recode ตัวแปรเด็ดขาด (ปัจจัย) อย่างมีประสิทธิภาพในชุดของตัวแปรความแตกต่างของพหุนาม orthogonal สำหรับตัวแปรความคมชัดหลายประเภท (เช่นส่วนเบี่ยงเบนง่ายเฮลเมอร์ ฯลฯ ) การผ่านคือ: เขียนเมทริกซ์สัมประสิทธิ์ความคมชัดสอดคล้องกับประเภท ผกผันหรือวางนัยทั่วไปเพื่อให้ได้เมทริกซ์ของรหัส ตัวอย่างเช่น: Suppose there is 3-group factor and we want to recode it into a set of deviation contrast variables. The last group is treated as reference. Then the contrast coefficients matrix L is Group1 Group2 Group3 var1 …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.