สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

4
การอ้างอิงการเพิ่มประสิทธิภาพเชิงตัวเลขสำหรับนักสถิติ
ฉันกำลังมองหาการอ้างอิงที่มั่นคง (หรือการอ้างอิง) เกี่ยวกับเทคนิคการเพิ่มประสิทธิภาพเชิงตัวเลขที่มุ่งเป้าไปที่นักสถิตินั่นคือมันจะใช้วิธีการเหล่านี้กับปัญหาเชิงอนุมานมาตรฐาน (เช่น MAP / MLE ในแบบจำลองทั่วไป) สิ่งต่าง ๆ เช่นการไล่ระดับสี (ตรงและสุ่ม), EM และ spinoffs / ภาพรวม, การจำลองการหลอม ฯลฯ ฉันหวังว่ามันจะมีบันทึกการใช้งานจริงบางอย่าง (มักขาดในเอกสาร) ไม่จำเป็นต้องชัดเจนอย่างสมบูรณ์ แต่อย่างน้อยก็ควรมีบรรณานุกรมที่เป็นของแข็ง การค้นหาคร่าวๆปรากฏขึ้นมาสองสามข้อความ: การวิเคราะห์เชิงตัวเลขสำหรับนักสถิติโดย Ken Lange และวิธีการเชิงตัวเลขของ John Monahan ความเห็นของแต่ละคนดูหลากหลาย (และกระจัดกระจาย) จากการตรวจสารบัญสองอย่างแสดงให้เห็นว่าหนังสือของ Lange ฉบับที่ 2 นั้นใกล้เคียงกับสิ่งที่ฉันทำมากที่สุด

4
ข้อผิดพลาดมาตรฐานที่ใช้คืออะไร
ฉันใช้บทช่วยสอนที่ฉันพบและวางแผนค่าเฉลี่ยพร้อมกับข้อผิดพลาดมาตรฐานเพื่อแสดงข้อมูลของฉัน แต่ฉันมีปัญหาเกี่ยวกับผลลัพธ์ พล็อตของฉันดังที่แสดงด้านล่าง: ข้อผิดพลาดมาตรฐานบางอย่าง (แสดงเป็นแถบข้อผิดพลาด) แตกต่างกันมากและบางข้อก็ใกล้เคียงกับศูนย์มาก

2
จะค้นหาความสัมพันธ์ระหว่างกิจกรรมประเภทต่างๆได้อย่างไร (กำหนดโดยตำแหน่ง 2D)
ฉันมีชุดข้อมูลของเหตุการณ์ที่เกิดขึ้นในช่วงเวลาเดียวกัน แต่ละเหตุการณ์มีประเภท (มีหลายประเภทที่แตกต่างกันน้อยกว่าสิบ) และสถานที่ซึ่งแสดงเป็นจุด 2D ฉันต้องการตรวจสอบว่ามีความสัมพันธ์ระหว่างประเภทของกิจกรรมหรือระหว่างประเภทและตำแหน่ง ตัวอย่างเช่นเหตุการณ์ประเภท A มักจะไม่เกิดขึ้นเมื่อมีกิจกรรมประเภท B หรือบางทีในบางพื้นที่มีเหตุการณ์ส่วนใหญ่เป็นประเภท C ฉันสามารถใช้เครื่องมือชนิดใดในการทำสิ่งนี้ เป็นมือใหม่ในการวิเคราะห์ทางสถิติความคิดแรกของฉันคือการใช้ PCA (การวิเคราะห์ส่วนประกอบหลัก) ในชุดข้อมูลนี้เพื่อดูว่าเหตุการณ์แต่ละประเภทมีองค์ประกอบของตัวเองหรือบางคนแบ่งปันเหมือนกัน (เช่นมีความสัมพันธ์กัน) ฉันต้องพูดถึงว่าชุดข้อมูลของฉันมีลำดับ 500,000 คะแนนจึงทำให้การจัดการกับเรื่องยากขึ้นเล็กน้อย( x , y, t yp e )(x,Y,เสื้อYพีอี)(x, y, type) แก้ไข: ตามที่ระบุไว้ในคำตอบด้านล่างและความคิดเห็นวิธีที่จะไปคือการทำแบบจำลองนี้เป็นกระบวนการจุดที่ถูกทำเครื่องหมายแล้วใช้ R เพื่อยกของหนักทั้งหมดดังอธิบายในรายละเอียดในรายงานการประชุมเชิงปฏิบัติการนี้: http: / /www.csiro.edu.au/resources/Spatial-Point-Patterns-in-R.html

3
การกระจายตัวมีเสถียรภาพเป็นบวกใน R
การแจกแจงที่เสถียรในเชิงบวกถูกอธิบายโดยพารามิเตอร์สี่ตัว ได้แก่ พารามิเตอร์ skewness , พารามิเตอร์ของมาตราส่วน\ sigma&gt; 0 , พารามิเตอร์ตำแหน่ง\ mu \ in (- \ infty, \ infty)และอื่น ๆ เรียกว่าพารามิเตอร์ดัชนี\ alpha \ in (0,2]เมื่อ\ betaเป็นศูนย์การกระจายจะสมมาตรรอบ\ muเมื่อมันเป็นบวก (การตอบสนองเชิงลบ) การกระจายจะเบ้ไปทางขวา (ไปทางซ้าย) . การกระจายที่เสถียรช่วยให้ไขมันหางเมื่อ\ alphaลดลงβ∈[−1,1]β∈[−1,1]\beta\in[-1,1]σ&gt;0σ&gt;0\sigma>0μ∈(−∞,∞)μ∈(−∞,∞)\mu\in(-\infty,\infty)α∈(0,2]α∈(0,2]\alpha\in(0,2]ββ\betaμμ\muαα\alpha เมื่อαα\alphaเป็นอย่างเคร่งครัดน้อยกว่าหนึ่งและβ=1β=1\beta=1การสนับสนุนของข้อกำหนดด้านการจัดจำหน่ายไปยัง(μ,∞)(μ,∞)(\mu,\infty)infty) ฟังก์ชั่นความหนาแน่นมีเพียงนิพจน์แบบปิดสำหรับการรวมค่าพารามิเตอร์ เมื่อμ=0μ=0\mu=0 , α&lt;1α&lt;1\alpha<1 , β=1β=1\beta=1 , และσ=ασ=α\sigma=\alphaมันคือ (ดูสูตร (4.4) ที่นี่ ): f(y)=−1πy∑∞k=1Γ(kα+1)k!(−y−α)ksin(αkπ)f(y)=−1πy∑k=1∞Γ(kα+1)k!(−y−α)ksin⁡(αkπ)f(y) = -\frac{1}{\pi y} \sum_{k=1}^{\infty} …

6
ชื่อสามัญที่ดีสำหรับแผนภูมิของสิ่งต่าง ๆ ตามเวลาของวันคืออะไร
เรากำลังสร้างแผนภูมิที่แสดงปริมาณการใช้งานตามช่วงเวลาของวันในช่วงเวลาที่กำหนด ดังนั้นแกน y คือการรับส่งข้อมูล, แกน x คือเที่ยงคืน, 1am, 2am, และมันอาจเป็นวันในสัปดาห์ ชื่อสามัญของแผนภูมิประเภทนี้คืออะไร? ฉันมากับ "แผนภูมิวงกลม" เป็นมาตรฐานหรือไม่ มีไหม ปรับปรุง: เพียงเพิ่มความชัดเจนมากขึ้นสิ่งที่แสดงในแผนภูมิบนสุดไม่ใช่วันเดียวเป็นการรวมหลายวัน เช่นเมื่อเดือนที่แล้วมีค่าเฉลี่ย 6 โมงเช้าต่ำกว่าเที่ยง ในทำนองเดียวกันในแผนภูมิด้านล่างในปีที่ผ่านมาการจราจรลดลงในวันเสาร์

2
เป็นไปได้ไหมที่จะใช้ kernel PCA สำหรับการเลือกคุณสมบัติ?
เป็นไปได้หรือไม่ที่จะใช้การวิเคราะห์องค์ประกอบหลักของเคอร์เนล (kPCA) สำหรับ Latent Semantic Indexing (LSI) ในลักษณะเดียวกับที่ใช้ PCA ฉันดำเนินการ LSI ใน R โดยใช้prcompฟังก์ชั่น PCA และแยกคุณสมบัติด้วยการโหลดสูงสุดจากองค์ประกอบแรก โดยที่ฉันได้รับคุณสมบัติการอธิบายองค์ประกอบที่ดีที่สุดkkk ฉันพยายามใช้kpcaฟังก์ชั่น (จากkernlibแพ็คเกจ) แต่ไม่สามารถดูวิธีการเข้าถึงน้ำหนักของคุณสมบัติไปยังส่วนประกอบหลัก เป็นไปได้โดยรวมเมื่อใช้วิธีเคอร์เนล?

3
การใช้งานของค่ามัธยฐานขัดสำหรับการเลือกคุณสมบัติ
ในกระดาษที่ฉันอ่านเมื่อเร็ว ๆ นี้ฉันเจอบิตต่อไปนี้ในส่วนการวิเคราะห์ข้อมูล: จากนั้นตารางข้อมูลจะถูกแบ่งออกเป็นเนื้อเยื่อและเส้นของเซลล์และทั้งสอง subtables แยกเป็นค่ามัธยฐานขัด (แถวและคอลัมน์ถูกปรับซ้ำ ๆ เพื่อให้มีค่ามัธยฐาน 0) ก่อนที่จะรวมกันเป็นตารางเดียว ในที่สุดเราก็เลือกส่วนย่อยของยีนที่มีการแสดงออกแตกต่างกันอย่างน้อย 4 เท่าจากค่ามัธยฐานในตัวอย่างนี้ตั้งค่าในตัวอย่างอย่างน้อยสามตัวอย่าง ฉันต้องบอกว่าฉันไม่ได้ทำตามเหตุผลจริงๆที่นี่ ฉันสงสัยว่าถ้าคุณสามารถช่วยฉันตอบคำถามสองข้อต่อไปนี้: เหตุใดจึงเป็นที่ต้องการ / เป็นประโยชน์ในการปรับค่ามัธยฐานในชุดข้อมูล? ทำไมมันควรทำแยกต่างหากสำหรับตัวอย่างประเภทต่างๆ สิ่งนี้ไม่ได้แก้ไขข้อมูลการทดลองอย่างไร นี่เป็นวิธีที่รู้จักกันดีในการเลือกจำนวนยีน / ตัวแปรจากชุดข้อมูลขนาดใหญ่หรือค่อนข้างเป็นแบบ adhoc ขอบคุณ

2
ฉันจะตีความผลลัพธ์ของการทดสอบ Breusch – Pagan ได้อย่างไร
ในRฉันสามารถทำการทดสอบ Breusch – Pagan สำหรับ heteroscedasticity โดยใช้ncvTestฟังก์ชันของcarแพ็คเกจ การทดสอบ Breusch – Pagan เป็นประเภทของการทดสอบไคสแควร์ ฉันจะตีความผลลัพธ์เหล่านี้ได้อย่างไร: &gt; require(car) &gt; set.seed(100) &gt; x1 = runif(100, -1, 1) &gt; x2 = runif(100, -1, 1) &gt; ncvTest(lm(x1 ~ x2)) Non-constant Variance Score Test Variance formula: ~ fitted.values Chisquare = 0.2343406 Df = 1 p = 0.6283239 …

1
การวัดความสัมพันธ์ของโครงข่ายประสาทเทียมที่ได้รับการฝึกอบรม
ฉันกำลังฝึกอบรมโครงข่ายประสาทเทียม (backpropagation, feed-forward) พร้อมกับข้อมูลที่ไม่ได้กระจายทั่วไป นอกเหนือจากค่าเฉลี่ยความคลาดเคลื่อนกำลังสองวรรณคดีมักเสนอแนะว่าสัมประสิทธิ์สหสัมพันธ์ของเพียร์สันสำหรับการประเมินคุณภาพของตาข่ายที่ผ่านการฝึกอบรม แต่สัมประสิทธิ์สหสัมพันธ์ของเพียร์สันนั้นสมเหตุสมผลหรือไม่ถ้าข้อมูลการฝึกอบรมไม่ได้ถูกแจกจ่ายตามปกติ? มันจะไม่สมเหตุสมผลหรือไม่ที่จะใช้การวัดความสัมพันธ์ตามระดับเช่น Spearman rho?

1
ฉันสามารถประเมินความถี่ของเหตุการณ์โดยพิจารณาจากการสุ่มตัวอย่างเหตุการณ์ที่เกิดขึ้นได้หรือไม่
มีการแก้ไขบางอย่าง ... คำถามนี้มีไว้เพื่อความสนุกเท่านั้นดังนั้นหากมันไม่สนุกโปรดอย่าเพิกเฉย ฉันได้รับความช่วยเหลือมากมายจากไซต์นี้ดังนั้นฉันจึงไม่ต้องการกัดมือที่เลี้ยงฉัน มันขึ้นอยู่กับตัวอย่างในชีวิตจริงและเป็นเพียงสิ่งที่ฉันสงสัยเกี่ยวกับหลายอย่าง ฉันไปเยี่ยมโดโจในพื้นที่ของฉันเพื่อฝึกซ้อมแบบสุ่มเป็นหลักในวันจันทร์ถึงวันศุกร์ สมมติว่าฉันไปเยี่ยมสัปดาห์ละสองครั้ง ซึ่งหมายความว่าฉันไปเยี่ยมสองครั้งทุกสัปดาห์โดยมีเพียงสองวันเท่านั้นที่เปลี่ยนแปลง มีใครคนหนึ่งที่เกือบจะทุกครั้งที่ฉันอยู่ที่นั่น หากเขามาในวันเดียวกันกับฉันฉันก็จะเห็นเขา สมมติว่าเขาอยู่ที่นั่น 90% ของเวลาเมื่อฉันอยู่ที่นั่น ฉันอยากรู้สองสิ่ง: 1) เขาฝึกบ่อยแค่ไหน 2) ไม่ว่าเขาจะมาแบบสุ่มหรือในวันที่กำหนดของสัปดาห์ ฉันเดาว่าบางทีเราต้องสมมติให้เดาอีกอัน ฉันไม่เคยได้รับสิ่งนี้เลย ฉันแค่คิดเกี่ยวกับมันในการอุ่นเครื่องทุกสัปดาห์และงงงันอีกครั้ง แม้ว่าบางคนให้วิธีคิดเกี่ยวกับปัญหาที่ฉันจะขอบคุณมากที่สุด ไชโย!

1
การใช้สัมประสิทธิ์การกำหนดบางส่วน
ใครบ้างมีคำแนะนำหรือแพ็คเกจที่จะคำนวณค่าสัมประสิทธิ์ของการตัดสินใจบางส่วน? สัมประสิทธิ์ของการตัดสินใจบางส่วนสามารถกำหนดเป็นร้อยละของการเปลี่ยนแปลงที่ไม่สามารถอธิบายได้ในรูปแบบที่ลดลง แต่สามารถอธิบายได้โดยตัวทำนายที่ระบุไว้ในแบบจำลอง (เอ้อ) สัมประสิทธิ์นี้ใช้เพื่อให้เข้าใจว่าตัวทำนายเพิ่มเติมหนึ่งตัวหรือมากกว่านั้นอาจมีประโยชน์ในตัวแบบการถดถอยที่ระบุอย่างสมบูรณ์ การคำนวณสำหรับ r ^ 2 บางส่วนนั้นค่อนข้างตรงไปตรงมาหลังจากการประเมินสองโมเดลของคุณและสร้างตาราง ANOVA สำหรับพวกเขา การคำนวณสำหรับ r ^ 2 บางส่วนคือ: (SSEreduced - SSEfull) / SSEreduced ฉันได้เขียนฟังก์ชันที่ค่อนข้างง่ายซึ่งจะคำนวณสิ่งนี้สำหรับตัวแบบถดถอยเชิงเส้นหลายแบบ ฉันไม่คุ้นเคยกับโครงสร้างรุ่นอื่น ๆ ใน R ที่ฟังก์ชั่นนี้อาจทำงานได้ไม่ดี: partialR2 &lt;- function(model.full, model.reduced){ anova.full &lt;- anova(model.full) anova.reduced &lt;- anova(model.reduced) sse.full &lt;- tail(anova.full$"Sum Sq", 1) sse.reduced &lt;- tail(anova.reduced$"Sum Sq", 1) pR2 &lt;- …
9 r  regression  anova 

2
ฉันระบุรุ่น lmer ของฉันถูกต้องหรือไม่
ฉัน scoured Google และเว็บไซต์นี้และฉันยังคงสับสนเกี่ยวกับฟังก์ชัน lmer ในไลบรารี lme4 ฉันมีข้อมูลบางอย่างที่เก็บรวบรวมจากหอผู้ป่วยจิตเวชที่แตกต่างกันซึ่งมีโครงสร้างหลายระดับ เพื่อให้ง่ายขึ้นฉันจะเลือกตัวแปรสองระดับ 2 และสองระดับ 1 แม้ว่าฉันจะมีอีกไม่กี่ตัว Level 2- WardSize [นี่คือจำนวนผู้คนในวอร์ด] &amp; WAS [นี่คือการวัดความดี "วอร์ด" ของวอร์ด] ตัวแปรการจัดกลุ่มที่บอก R ว่าใครในวอร์ดเรียกว่า "วอร์ด" ระดับหนึ่ง - เพศ [นี่คือเพศชัดเจน] &amp; BSITotal [นี่คือการวัดความรุนแรงของอาการ] ผลลัพธ์คือ Selfreject ซึ่งอีกครั้งคือสิ่งที่ดูเหมือน ฉันมีสูตรนี้: ความช่วยเหลือ = lmer (สูตร = Selfreject ~ WardSize + WAS + เพศ + …

1
ผลของขอบเขตในการวิเคราะห์ความละเอียดแบบหลายเวฟเล็ต
วิธีการลดผลกระทบของขอบเขตในการย่อยสลายเวฟเล็ตคืออะไร? ผมใช้ R และแพคเกจwaveslim ฉันได้พบเช่นฟังก์ชั่น ?brick.wall แต่ ฉันไม่ได้ใช้วิธีการใช้เช่นกัน ฉันไม่แน่ใจว่าทางออกที่ดีที่สุดคือการลบค่าสัมประสิทธิ์ ฉันเคยอ่านที่ไหนสักแห่งว่ามันมีเวฟเล็ตบางตัวที่ไม่เหมือนกันทุกหนทุกแห่ง ความคิดใด ๆ

4
จะค้นหาขั้นตอนทางสถิติใน R ได้อย่างไร
มีแพ็คเกจเว็บไซต์หรือคำสั่ง R ที่จะอนุญาตให้หนึ่งค้นหาขั้นตอนทางสถิติเฉพาะที่ต้องการหรือไม่ ตัวอย่างเช่นหากฉันต้องการค้นหาแพ็คเกจที่มีการแปลง Box-Cox เว็บไซต์ / แพ็คเกจ / คำสั่งอาจส่งคืน "MASS" และแนะนำฉันไปที่boxcox()ฟังก์ชัน มันค่อนข้างตรงไปตรงมากับบางสิ่งบางอย่างเช่น Box-Cox แต่ฉันหวังว่ามันจะช่วยให้ฉันค้นหาขั้นตอนที่ยากขึ้นหรือค้นหาสิ่งที่ฟังก์ชันทำ ("การต่อคอลัมน์เข้ากับเฟรมข้อมูล" อาจปรากฏขึ้นcbind()) สิ่งนี้มีอยู่จริงหรือไม่?
9 r 

2
เริ่มต้นใช้งานด้วยจักรยานเสือภูเขา
ฉันได้ทำการค้นคว้าทางอินเทอร์เน็ตเกี่ยวกับจักรยานเสือหมอบ (ฉันได้อ่านบทความ Wiki หลายครั้ง) จนถึงตอนนี้ดูเหมือนว่ามีคำจำกัดความหรือคำศัพท์มาตรฐานน้อย ฉันสงสัยว่ามีเอกสารหรือหนังสือมาตรฐานใด ๆ ที่ใครก็ตามที่สนใจในอัลกอริทึมสำหรับการค้นหาผู้มาฮันทางควรอ่าน เป็นไปได้ไหมที่จะบอกว่าสถานะของศิลปะในทุ่งนาคืออะไร? ฉันรู้สึกทึ่งกับความคิดในการค้นหาผู้มีส่วนร่วมทางจักรยานโดยใช้อัลกอริทึมทางพันธุกรรมดังนั้นฉันขอขอบคุณความคิดเห็นเกี่ยวกับวิธีการนั้นโดยเฉพาะอย่างยิ่งในบริบทของวิธีการอื่น ๆ โดยปกติในการจัดกลุ่มเป้าหมายคือการแบ่งพาร์ติชันชุดข้อมูลเป็นกลุ่มที่แต่ละองค์ประกอบอยู่ในบางกลุ่ม อัลกอริทึม bicluster พยายามหาองค์ประกอบทั้งหมดในกลุ่มเฉพาะหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.