สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
Scikit predict_proba การตีความผลลัพธ์
ฉันทำงานกับห้องสมุด scikit เรียนรู้ในหลาม ในโค้ดด้านล่างนี้ฉันกำลังทำนายความน่าจะเป็น แต่ฉันไม่รู้วิธีอ่านเอาต์พุต ข้อมูลการทดสอบ from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) แยกชุดข้อมูล X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, random_state=0) คำนวณความน่าจะเป็น clf = RF() clf.fit(X_train,y_train) pred_pro = clf.predict_proba(X_test) print pred_pro ผลลัพธ์ [[ 1. 0.] [ 1. 0.] [ …

1
การเลือกช่วงและความหนาแน่นของกริดสำหรับพารามิเตอร์การทำให้เป็นมาตรฐานใน LASSO
ฉันกำลังศึกษาLASSO (อย่างน้อยการหดตัวแบบสัมบูรณ์และผู้ดำเนินการคัดเลือก) ในเวลาเดียวกัน ฉันเห็นว่าค่าที่ดีที่สุดสำหรับพารามิเตอร์การทำให้เป็นมาตรฐานสามารถเลือกได้โดยการตรวจสอบความถูกต้องข้าม ฉันเห็นด้วยในการถดถอยของสันเขาและวิธีการมากมายที่ใช้การทำให้เป็นมาตรฐานเราสามารถใช้ CV เพื่อค้นหาพารามิเตอร์การทำให้เป็นมาตรฐานที่ดีที่สุด (การลงโทษ) ตอนนี้คำถามของฉันเกี่ยวกับค่าเริ่มต้นสำหรับขอบเขตบนและล่างของพารามิเตอร์และวิธีการกำหนดความยาวของลำดับ จะเฉพาะเจาะจงเช่นสมมติเรามีปัญหา Lasso และเราต้องการที่จะหาค่าที่ดีที่สุดสำหรับการลงโทษ\แล้วเราจะเลือกขอบเขตล่างและบนสำหรับอย่างไร และมีค่าเท่าไรที่แยกระหว่างสองค่า ? λ λ ∈ [ = ? , b = ? ] ( b - a )L o กรัมLฉันk อีลิตรฉันชั่วโมงo o d= ( y- x β)'( y- x β) + λ ∑ | β|1LogLikelihood=(y−xβ)′(y−xβ)+λ∑|β|1 LogLikelihood = (y-x\beta)'(y-x\beta) …

2
ค่าที่คาดหวังของ x ในการแจกแจงแบบปกติให้ค่าที่ต่ำกว่าค่าที่แน่นอน
เพียงแค่สงสัยว่าเป็นไปได้หรือไม่ที่จะหาค่าที่คาดหวังของ x หากมีการแจกแจงตามปกติโดยมีค่าต่ำกว่าค่าที่แน่นอน (ตัวอย่างเช่นต่ำกว่าค่าเฉลี่ย)

1
เหตุใดการวิเคราะห์อนุกรมเวลาจึงไม่ถือว่าเป็นอัลกอริทึมการเรียนรู้ของเครื่อง
เหตุใดการวิเคราะห์อนุกรมเวลาจึงไม่ถือว่าเป็นอัลกอริทึมการเรียนรู้ของเครื่อง (ต่างจากการถดถอยเชิงเส้น) การวิเคราะห์การถดถอยและอนุกรมเวลาเป็นวิธีการพยากรณ์ เหตุใดคนหนึ่งจึงคิดว่าเป็นอัลกอริธึมการเรียนรู้ แต่ไม่ใช่อีกข้อหนึ่ง

1
การทดสอบที่แม่นยำของฟิชเชอร์ให้ค่า p ที่ไม่สม่ำเสมอ
ฉันกำลังพยายามใช้การทดสอบที่แน่นอนของฟิชเชอร์ในปัญหาพันธุศาสตร์จำลอง แต่ค่า p ดูเหมือนจะเอียงไปทางขวา ในฐานะนักชีววิทยาฉันคิดว่าฉันขาดอะไรบางอย่างที่ชัดเจนกับนักสถิติทุกคนดังนั้นฉันจะขอขอบคุณสำหรับความช่วยเหลือของคุณ การตั้งค่าของฉันคือ: (การตั้งค่า 1, ระยะขอบคงที่) สองตัวอย่างของ 0s และ 1s ถูกสร้างแบบสุ่มใน R แต่ละตัวอย่าง n = 500 ความน่าจะเป็นของการสุ่มตัวอย่าง 0 และ 1 จะเท่ากัน จากนั้นฉันจะเปรียบเทียบสัดส่วน 0/1 ในแต่ละตัวอย่างด้วยการทดสอบที่แน่นอนของฟิชเชอร์ (เพียงแค่fisher.testลองซอฟต์แวร์อื่นที่มีผลลัพธ์คล้ายกัน) การสุ่มตัวอย่างและการทดสอบซ้ำแล้วซ้ำอีก 30,000 ครั้ง ผลลัพธ์ค่า p จะถูกกระจายดังนี้: ค่าเฉลี่ยของค่า p ทั้งหมดอยู่ที่ประมาณ 0.55, 5 เปอร์เซนต์ที่ 0.0577 แม้การกระจายจะปรากฏขึ้นทางด้านขวา ฉันได้อ่านทุกอย่างที่ทำได้ แต่ฉันไม่พบสิ่งบ่งชี้ว่าพฤติกรรมนี้เป็นเรื่องปกติ - ในทางกลับกันมันเป็นเพียงข้อมูลจำลองดังนั้นฉันจึงไม่เห็นแหล่งที่มาสำหรับอคติใด ๆ มีการปรับเปลี่ยนที่ฉันพลาดหรือไม่? ขนาดตัวอย่างเล็กเกินไปหรือไม่ หรือบางทีมันไม่ควรจะกระจายอย่างสม่ำเสมอและค่า …

1
บางส่วนควรรวม
ต่อไปนี้เป็นรูปแบบที่สร้างขึ้นจากmtcarsชุดข้อมูล: > ols(mpg~wt+am+qsec, mtcars) Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 0.850 sigma 2.4588 d.f. 3 R2 adj 0.834 d.f. 28 Pr(> chi2) 0.0000 g 6.456 Residuals Min 1Q Median …

3
Jeffreys ก่อนหน้าสำหรับการแจกแจงแบบปกติพร้อมค่าเฉลี่ยและความแปรปรวนที่ไม่รู้จัก
ฉันอ่านค่าการกระจายก่อนหน้านี้และฉันคำนวณ Jeffreys ก่อนหน้านี้สำหรับตัวอย่างของตัวแปรสุ่มแบบกระจายที่มีค่าเฉลี่ยไม่ทราบและความแปรปรวนที่ไม่รู้จัก จากการคำนวณของฉันรายการต่อไปนี้ของ Jeffreys ก่อนหน้านี้: ที่นี่เป็นเมทริกซ์ข้อมูลของฟิชเชอร์ ผมp ( μ , σ2) = de t ( ฉัน)-----√= de t ( 1 / σ2001 / ( 2 σ4))------------------√= 12 σ6----√∝ 1σ3.พี(μ,σ2)=dอีเสื้อ(ผม)=dอีเสื้อ(1/σ2001/(2σ4))=12σ6α1σ3. p(\mu,\sigma^2)=\sqrt{det(I)}=\sqrt{det\begin{pmatrix}1/\sigma^2 & 0 \\ 0 & 1/(2\sigma^4)\end{pmatrix}}=\sqrt{\frac{1}{2\sigma^6}}\propto\frac{1}{\sigma^3}.ผมผมI อย่างไรก็ตามฉันได้อ่านสิ่งพิมพ์และเอกสารที่ระบุด้วย p ( μ , σ2) ∝ 1 / σ2พี(μ,σ2)α1/σ2p(\mu,\sigma^2)\propto 1/\sigma^2ดูหัวข้อ 2.2 ในKass …

1
จะลดจำนวนผลบวกปลอมได้อย่างไร
ฉันกำลังพยายามที่จะแก้ปัญหางานที่เรียกว่าการตรวจจับคนเดินเท้าและฉันฝึก clasifer ไบนารีในสองประเภทบวก - คนลบ - พื้นหลัง ฉันมีชุดข้อมูล: จำนวนบวก = 3752 จำนวนลบ = 3800 ฉันใช้ train \ test split 80 \ 20% และRandomForestClassifier form scikit- เรียนรู้ ด้วยพารามิเตอร์: RandomForestClassifier(n_estimators=100, max_depth=50, n_jobs= -1) ฉันได้รับคะแนน: 95.896757% ทดสอบข้อมูลการฝึกอบรม (ทำงานได้อย่างสมบูรณ์): true positive: 3005 false positive: 0 false negative: 0 true negative: 3036 ทดสอบข้อมูลการทดสอบ: true positive: …

2
Binning ที่เหมาะสมที่สุดที่เกี่ยวข้องกับตัวแปรตอบกลับที่กำหนด
ฉันกำลังมองหาวิธีการ binning ที่ดีที่สุด (discretization) ของตัวแปรต่อเนื่องที่เกี่ยวข้องกับการตอบสนองที่กำหนด (เป้าหมาย) ตัวแปรไบนารีและมีจำนวนช่วงเวลาสูงสุดเป็นพารามิเตอร์ ตัวอย่าง: ฉันมีชุดการสังเกตของผู้ที่มี "ความสูง" (ต่อเนื่องเป็นตัวเลข) และ "has_back_pains" (ไบนารี) ตัวแปร ฉันต้องการแยกความสูงออกเป็น 3 ช่วง (กลุ่ม) อย่างน้อยที่สุดด้วยสัดส่วนที่แตกต่างกันของคนที่มีอาการปวดหลังดังนั้นอัลกอริทึมจึงเพิ่มความแตกต่างระหว่างกลุ่ม (ด้วยข้อ จำกัด ที่กำหนดเช่นแต่ละช่วงเวลามีการสังเกตอย่างน้อย x) ทางออกที่ชัดเจนสำหรับปัญหานี้คือใช้ต้นไม้ตัดสินใจ (โมเดลหนึ่งตัวแปรแบบง่าย) แต่ฉันไม่สามารถหาฟังก์ชั่นใด ๆ ใน R ที่จะมี "จำนวนสาขาสูงสุด" เป็นพารามิเตอร์ - พวกเขาทั้งหมดแบ่งตัวแปร เป็น 2 gropus (<= x และ> x) SAS miner มีพารามิเตอร์ "branch branch" แต่ฉันกำลังมองหาโซลูชันที่ไม่ใช่เชิงพาณิชย์ ตัวแปรบางตัวของฉันมีค่าเฉพาะไม่กี่ค่า (และสามารถถือว่าเป็นตัวแปรแบบแยก) …

1
ทำไมไม่ถดถอยอย่างหนักทุกครั้ง?
ตัวอย่างของการแสดงหน้านี้ว่าการถดถอยอย่างง่ายได้รับผลกระทบอย่างเห็นได้ชัดโดยค่าผิดปกติและสามารถเอาชนะได้โดยใช้เทคนิคของการถดถอยที่แข็งแกร่ง: http://www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ ฉันเชื่อว่า lmrob และ ltsReg เป็นเทคนิคการถดถอยที่มีประสิทธิภาพอื่น ๆ เหตุใดจึงไม่ควรทำการถดถอยที่มีประสิทธิภาพ (เช่น rlm หรือ rq) ทุกครั้งแทนที่จะทำการถดถอยง่าย (lm) มีข้อเสียของเทคนิคการถดถอยที่แข็งแกร่งเหล่านี้หรือไม่ ขอบคุณสำหรับความเข้าใจของคุณ

2
การใช้ตัวกรองคาลมานเพื่อกำหนดค่าที่ขาดหายไปในอนุกรมเวลา
ฉันสนใจว่าตัวกรองคาลมานสามารถใช้เพื่อระบุค่าที่หายไปในข้อมูลอนุกรมเวลาได้อย่างไร นอกจากนี้ยังสามารถใช้งานได้หากมีจุดเวลาติดต่อกันขาดหายไป? ฉันไม่พบอะไรมากในหัวข้อนี้ คำอธิบายความคิดเห็นและลิงค์ใด ๆ ยินดีต้อนรับและชื่นชม!

2
มิติ VC ของตัวแบบการถดถอย
ในชุดการเรียนรู้การบรรยายจากข้อมูลอาจารย์กล่าวว่ามิติ VC วัดความซับซ้อนของแบบจำลองว่ามีจุดแตกต่างกันอย่างไร ดังนั้นวิธีนี้ใช้งานได้ดีอย่างสมบูรณ์แบบสำหรับการจำแนกประเภทที่เราสามารถบอกได้ว่าไม่มีคะแนน N หากตัวแยกประเภทสามารถจำแนกคะแนน k ได้อย่างมีประสิทธิภาพการวัดขนาด VC จะเป็น K แต่ก็ไม่ชัดเจนสำหรับฉัน ?

1
การเชื่อมต่อระหว่างการทำให้เป็นมาตรฐานและวิธีการคูณตัวคูณ lagrange คืออะไร?
เพื่อป้องกันไม่ให้คน overfitting คนเพิ่มระยะ normalization (สัดส่วนกับผลรวมกำลังสองของพารามิเตอร์ของแบบจำลอง) ด้วยพารามิเตอร์ normalizationไปยังฟังก์ชันต้นทุนของการถดถอยเชิงเส้น พารามิเตอร์นี้เหมือนกับตัวคูณ lagrange หรือไม่? การทำให้เป็นมาตรฐานเป็นเช่นเดียวกับวิธีการของตัวคูณ lagrange หรือไม่? หรือวิธีการเหล่านี้เชื่อมต่อกันอย่างไร? λλλ\lambdaλλ\lambda

1
การแปลงเชิงเส้นของตัวแปรสุ่มโดยเมทริกซ์สี่เหลี่ยมสูง
สมมติว่าเรามีความสุ่มเวกเตอร์ , ดึงออกมาจากการกระจายกับฟังก์ชั่นความหนาแน่นของความน่าจะเป็น{x}) ถ้าเราแปลงเชิงเส้นโดยอันดับเต็มเมทริกซ์เพื่อรับดังนั้นความหนาแน่นของจะถูกกำหนดโดยX⃗ ∈RnX→∈Rn\vec{X} \in \mathbb{R}^nfX⃗ (x⃗ )fX→(x→)f_\vec{X}(\vec{x})n×nn×nn \times nAAAY⃗ =AX⃗ Y→=AX→\vec{Y} = A\vec{X}Y⃗ Y→\vec{Y}fY⃗ (y⃗ )=1|detA|fX⃗ (A−1y⃗ ).fY→(y→)=1|detA|fX→(A−1y→). f_{\vec{Y}}(\vec{y}) = \frac{1}{\left|\det A\right|}f_{\vec{X}}(A^{-1}\vec{y}). ตอนนี้บอกว่าเราเปลี่ยนX⃗ X→\vec{X}แทนโดยm×nm×nm \times nเมทริกซ์BBBกับm>nm>nm > nให้Z⃗ =BX⃗ Z→=BX→\vec{Z} = B\vec{X}{X} เห็นได้ชัดว่าZ∈RmZ∈RmZ \in \mathbb{R}^mแต่มัน "ชีวิตในที่" nnnมิติสเปซG⊂RmG⊂RmG \subset \mathbb{R}^mเมตร อะไรคือความหนาแน่นของเงื่อนไขของZ⃗ Z→\vec{Z}ให้ที่เรารู้ว่ามันอยู่ในGGG ? สัญชาตญาณแรกของฉันคือการใช้หลอกผกผันของBBBBถ้าB=USVTB=USVTB = U S V^Tคือการสลายตัวมูลค่าเอกพจน์BBBแล้วB+=VS+UTB+=VS+UTB^+ = …

2
วิธีสร้างข้อมูลการอยู่รอดของของเล่น (เวลากับเหตุการณ์) ด้วยการเซ็นเซอร์ที่ถูกต้อง
ฉันต้องการสร้างข้อมูลการอยู่รอดของของเล่น (เวลาต่อเหตุการณ์) ซึ่งถูกตรวจสอบอย่างถูกต้องและติดตามการกระจายบางอย่างที่มีสัดส่วนที่เป็นอันตรายและอันตรายพื้นฐานคงที่ ฉันสร้างข้อมูลดังต่อไปนี้ แต่ฉันไม่สามารถรับอัตราส่วนความเป็นอันตรายโดยประมาณที่ใกล้เคียงกับค่าที่แท้จริงหลังจากติดตั้งโมเดลอันตรายตามสัดส่วนของ Cox กับข้อมูลจำลอง ฉันทำผิดอะไร? รหัส R: library(survival) #set parameters set.seed(1234) n = 40000 #sample size #functional relationship lambda=0.000020 #constant baseline hazard 2 per 100000 per 1 unit time b_haz <-function(t) #baseline hazard { lambda #constant hazard wrt time } x = cbind(hba1c=rnorm(n,2,.5)-2,age=rnorm(n,40,5)-40,duration=rnorm(n,10,2)-10) B = c(1.1,1.2,1.3) # …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.