สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
ฉันจะทำให้ข้อมูลเซ็นเซอร์ accelerometer เป็นปกติได้อย่างไร
ฉันกำลังทำงานกับชุดข้อมูล accelerometer ขนาดใหญ่ที่รวบรวมด้วยเซ็นเซอร์หลายตัวที่สวมใส่โดยหลาย ๆ วิชา น่าเสียดายที่ไม่มีใครที่นี่ดูเหมือนจะรู้ข้อกำหนดทางเทคนิคของอุปกรณ์และฉันไม่คิดว่าพวกเขาได้รับการปรับเทียบใหม่ ฉันไม่มีข้อมูลมากมายเกี่ยวกับอุปกรณ์ ฉันกำลังทำงานเกี่ยวกับวิทยานิพนธ์ปริญญาโทของฉันเครื่องเร่งความเร็วถูกยืมมาจากมหาวิทยาลัยอื่นและสถานการณ์โดยรวมนั้นค่อนข้างไม่โปร่งใส ดังนั้นการประมวลผลล่วงหน้าบนอุปกรณ์? ไม่มีเงื่อนงำ สิ่งที่ฉันรู้ก็คือพวกมันเป็นเครื่องเร่งความเร็วสามแกนที่มีอัตราการสุ่มตัวอย่าง 20Hz; MEMS แบบดิจิทัลและน่าจะเป็น ฉันสนใจพฤติกรรมอวัจนภาษาและการแสดงท่าทางซึ่งแหล่งอ้างอิงของฉันส่วนใหญ่ควรสร้างกิจกรรมในช่วง 0.3-3.5Hz การทำให้ข้อมูลเป็นปกติน่าจะค่อนข้างจำเป็น แต่ฉันไม่แน่ใจว่าจะใช้อะไร ส่วนใหญ่ของข้อมูลอยู่ใกล้กับค่าที่เหลือ (ค่าดิบของ ~ 1000 จากแรงโน้มถ่วง) แต่มีสุดขั้วบางอย่างเช่นสูงถึง 8000 ในบันทึกบางส่วนหรือแม้กระทั่ง 29000 ในอื่น ๆ ดูภาพด้านล่าง ฉันคิดว่านี่เป็นความคิดที่ไม่ดีที่จะหารด้วยค่าสูงสุดหรือค่ามาตรฐานเพื่อทำให้เป็นมาตรฐาน อะไรคือวิธีการปกติในกรณีเช่นนี้? หารด้วยค่ามัธยฐาน? ค่าเปอร์เซ็นต์ไทล์ อื่น ๆ อีก? ในฐานะที่เป็นปัญหาด้านข้างฉันไม่แน่ใจเช่นกันว่าฉันควรจะตัดค่าที่มากที่สุดออกมา .. ขอบคุณสำหรับคำแนะนำใด ๆ ! แก้ไข : นี่คือพล็อตของข้อมูลประมาณ 16 นาที (ตัวอย่าง 20,000) เพื่อให้คุณมีความคิดในการกระจายข้อมูล

1
parellel ระหว่าง LSA และ pLSA
ในเอกสารต้นฉบับของpLSAผู้เขียนโทมัสฮอฟแมนวาดเส้นขนานระหว่าง pLSA และ LSA โครงสร้างข้อมูลที่ฉันต้องการจะพูดคุยกับคุณ พื้นหลัง: การได้รับแรงบันดาลใจจากการค้นคืนสารสนเทศคาดว่าเรามีการรวบรวม NNN เอกสาร D={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbrace และคำศัพท์ของ MMM เงื่อนไข Ω={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, ..., \omega_M \rbrace คลัง XXX สามารถแสดงโดย N×MN×MN \times M เมทริกซ์ของการอยู่ร่วมกัน ในการวิเคราะห์ความหมายแฝงโดยSVDเมทริกซ์XXX เป็นตัวประกอบในสามเมทริกซ์: X=UΣVTX=UΣVTX = U \Sigma V^T ที่ไหน Σ=diag{σ1,...,σs}Σ=diag{σ1,...,σs}\Sigma = diag \lbrace \sigma_1, ..., \sigma_s …

5
การจัดกลุ่มล่วงหน้าช่วยในการสร้างแบบจำลองการทำนายที่ดีขึ้นหรือไม่?
สำหรับภารกิจของการปั่นแบบจำลองฉันกำลังพิจารณา: คำนวณ k กลุ่มสำหรับข้อมูล สร้างโมเดล k สำหรับแต่ละคลัสเตอร์แยกกัน เหตุผลก็คือว่าไม่มีอะไรที่จะพิสูจน์ว่าประชากรของผู้ใต้บังคับบัญชาเป็นเนื้อเดียวกันดังนั้นจึงมีเหตุผลที่จะคิดว่ากระบวนการสร้างข้อมูลอาจแตกต่างกันสำหรับ "กลุ่ม" ที่แตกต่างกัน คำถามของฉันคือมันเป็นวิธีการที่เหมาะสมหรือไม่ มันละเมิดอะไรหรือไม่หรือถือว่าไม่ดีด้วยเหตุผลบางอย่าง? ถ้าเป็นเช่นนั้นทำไม ถ้าไม่คุณจะแบ่งปันแนวทางปฏิบัติที่ดีที่สุดเกี่ยวกับปัญหานั้นหรือไม่ และสิ่งที่สอง - เป็นการดีกว่าหรือแย่กว่าการทำ preclustering กว่าโมเดลต้นไม้ (ตามที่กำหนดไว้ใน Witten, Frank - ต้นไม้จำแนก / ถดถอยด้วยแบบจำลองที่ใบไม้) สังหรณ์ใจดูเหมือนว่าสเตจต้นไม้ตัดสินใจเป็นเพียงรูปแบบการรวมกลุ่มอื่น idk หากมีข้อได้เปรียบเหนือการจัดกลุ่ม "ปกติ")

2
สมมติฐานการพึ่งพา Benjamini-Hochberg เป็นธรรม?
ฉันมีชุดข้อมูลที่ฉันทดสอบความแตกต่างอย่างมีนัยสำคัญระหว่างสามประชากรที่เกี่ยวกับตัวแปรที่แตกต่างกัน 50 รายการ ฉันทำสิ่งนี้โดยใช้การทดสอบ Kruskal-Wallis บนมือข้างหนึ่งและโดยการทดสอบอัตราส่วนความน่าจะเป็นของโมเดล GLM แบบซ้อนกันพอดี (ที่มีและไม่มีประชากรเป็นตัวแปรอิสระ) ในอีกด้านหนึ่ง เป็นผลให้ฉันมีรายชื่อ Kruskal-Wallis ppp- ค่าในมือข้างหนึ่งและสิ่งที่ฉันคิดว่าเป็นไคสแควร์ ppp- ค่าจากการเปรียบเทียบ LRT ที่อื่น ๆ ฉันต้องทำการแก้ไขการทดสอบหลายรูปแบบบางรูปแบบเนื่องจากมีการทดสอบมากกว่า 50 รายการและ Benjamini-Hochberg FDR ดูเหมือนว่าเป็นตัวเลือกที่เหมาะสมที่สุด อย่างไรก็ตามตัวแปรอาจไม่เป็นอิสระโดยมี "แคลน" หลายตัวที่สัมพันธ์กัน คำถามคือ: ฉันจะบอกได้อย่างไรว่าชุดของสถิติพื้นฐานสำหรับฉันppp- ค่าตอบสนองความต้องการของการพึ่งพาในเชิงบวกที่จำเป็นสำหรับกระบวนการ Benjamini-Hochberg ที่จะยังคงผูกพันกับ FDR? กระดาษ Benjamini-Hochberg-Yekutieli จากปี 2544 ระบุว่าสภาพ PRDS มีไว้สำหรับการแจกแจงแบบปกติหลายตัวแปรและการแจกแจงแบบนักศึกษา สิ่งที่เกี่ยวกับการทดสอบอัตราส่วนความน่าจะเป็นของฉันค่าไคสแควร์สำหรับการเปรียบเทียบแบบจำลอง? เกี่ยวกับppp- ค่าที่ฉันมีสำหรับการทดสอบ Kruskal-Wallis? ฉันสามารถใช้การแก้ไข FDR ที่เลวร้ายที่สุดกรณี Benjamini-Hochberg-Yekutieli ที่ไม่มีอะไรขึ้นอยู่กับการพึ่งพา …

2
การกระจายในส่วนย่อยของหรือไม่
ฉันสงสัยว่าถ้ามีทุกประเภทของการกระจายมาตรฐานในส่วนย่อยของจำนวนเต็มใด ๆ\} เท่าที่เราจะได้แสดงนี้เป็นการกระจายบนเป็นเวกเตอร์ความยาวของผลไบนารีเช่นถ้าแล้วสอดคล้องกับเวกเตอร์1){1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) สิ่งที่ฉันกำลังมองหาคือการกระจายตัวซึ่งมาจากครอบครัวที่จัดทำดัชนีโดยพารามิเตอร์มิติ จำกัดที่จะกระจายมวลของมันในวิธีที่เวกเตอร์ไบนารีสองและจะมีความคล้ายคลึงกัน ความน่าจะเป็นถ้าพวกเขา "ปิด" ด้วยกันเช่นและมีความน่าจะเป็นที่คล้ายกัน จริงๆสิ่งที่ผมมุ่งมั่นที่จะทำหวังว่าจะใส่ก่อนในเช่นว่าถ้าฉันรู้ว่าที่มีขนาดใหญ่พอสมควรแล้วเป็นญาติอาจจะมีขนาดใหญ่เพื่อเวกเตอร์ห่างไกลจากr_1νθ(⋅)νθ(⋅)\nu_\theta (\cdot)θθ\thetar1r1r_1r2r2r_2r1=(0,0,1,0,1)r1=(0,0,1,0,1)r_1 = (0, 0, 1, 0, 1)r2=(0,0,1,1,1)r2=(0,0,1,1,1)r_2 = (0, 0, 1, 1, 1)θθ\thetaνθ(r1)νθ(r1)\nu_\theta (r_1)νθ(r2)νθ(r2)\nu_\theta (r_2)r1r1r_1 กลยุทธ์อย่างหนึ่งที่อยู่ในใจก็คือการวางมาตรวัดหรือการวัดการกระจายตัวอื่น ๆ บนบนจากนั้นใช้หรืออะไรที่คล้ายกัน ตัวอย่างที่ชัดเจนจะเป็นในการเปรียบเทียบกับการแจกแจงแบบปกติ ไม่เป็นไร แต่ฉันหวังว่าจะมีสิ่งที่เป็นมาตรฐานและคล้อยตามการวิเคราะห์แบบเบย์ ด้วยสิ่งนี้ฉันไม่สามารถเขียนค่าคงที่ normalizing ได้dθdθd_\theta{0,1}J{0,1}J\{0, 1\}^Jνθ(r)∝exp(−dθ(r,μ))νθ(r)∝exp⁡(−dθ(r,μ))\nu_\theta (r) \propto \exp (-d_\theta (r, …

2
ตัวแปรเอียงใน PCA หรือการวิเคราะห์ปัจจัย
ฉันต้องการทำการวิเคราะห์องค์ประกอบหลัก (การวิเคราะห์ปัจจัย) บน SPSS โดยใช้ตัวแปร 22 ตัว อย่างไรก็ตามตัวแปรบางตัวของฉันเบ้มาก (ความเบ้คำนวณจาก SPSS อยู่ในช่วง 2-80!) ดังนั้นนี่คือคำถามของฉัน: ฉันควรเก็บตัวแปรที่เอียงเหล่านั้นไว้หรือฉันสามารถเปลี่ยนตัวแปรในการวิเคราะห์องค์ประกอบหลักได้หรือไม่ ถ้าใช่ฉันจะตีความคะแนนตัวประกอบอย่างไร ฉันควรเปลี่ยนรูปแบบใด log10 หรือ ln เดิมที KMO ของฉัน (Kaiser – Meyer – Olkin) คือ 0.413 วรรณกรรมจำนวนมากแนะนำขั้นต่ำ 0.5 ฉันยังคงทำการวิเคราะห์ปัจจัยหรือฉันต้องลบตัวแปรเพื่อเพิ่ม KMO ของฉันเป็น 0.5 หรือไม่

4
วิธีพล็อตข้อมูล 20 ปีต่อวันในอนุกรมเวลา
ฉันมีชุดข้อมูลต่อไปนี้: https://dl.dropbox.com/u/22681355/ORACLE.csv และต้องการพล็อตการเปลี่ยนแปลงรายวันใน 'เปิด' ตาม 'วันที่' ดังนั้นฉันจึงทำสิ่งต่อไปนี้: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") และฉันได้รับต่อไปนี้: ตอนนี้เห็นได้ชัดว่าไม่ใช่พล็อตที่อร่อยที่สุดเท่าที่เคยมีมาดังนั้นฉันสงสัยว่าวิธีการที่ถูกต้องที่จะใช้เมื่อทำการพล็อตข้อมูลรายละเอียดนั้นคืออะไร?

1
สถิติที่ใช้บ่อยสำหรับคนที่มีความเชี่ยวชาญในทฤษฎีความน่าจะเป็นสมัยใหม่
มาจากพื้นฐานที่เข้มงวดในการวิเคราะห์และทฤษฎีความน่าจะเป็นที่ทันสมัยฉันพบว่าสถิติแบบเบย์ตรงไปตรงมาและเข้าใจง่ายและสถิติบ่อยครั้งทำให้เกิดความสับสนและไม่เข้าใจง่ายอย่างเหลือเชื่อ ดูเหมือนว่าผู้ใช้บ่อยกำลังทำสถิติแบบเบย์จริง ๆ ยกเว้น "นักบวชลับ" ที่ไม่มีแรงจูงใจหรือคำจำกัดความที่ดี ในทางกลับกันนักสถิติที่ยอดเยี่ยมจำนวนมากที่เข้าใจทั้งสองมุมมองได้อธิบายมุมมองของผู้ใช้บ่อยดังนั้นจึงต้องมีบางสิ่งที่ฉันไม่เข้าใจ แทนที่จะยอมแพ้และประกาศตัวเองเป็นชาวเบย์ฉันต้องการเรียนรู้เพิ่มเติมเกี่ยวกับมุมมองของผู้ใช้บ่อย ๆ เพื่อพยายาม "หาความรู้" อย่างแท้จริง อะไรคือการอ้างอิงที่ดีสำหรับการเรียนรู้สถิติผู้ใช้บ่อยจากมุมมองที่เข้มงวด นึกคิดฉันกำลังมองหาหนังสือประเภทนิยามทฤษฎีบทพิสูจน์หรือปัญหาที่ยากอาจกำหนดว่าโดยการแก้ไขพวกเขาฉันจะได้รับความคิดที่ถูกต้อง ฉันได้อ่าน "เนื้อหาเชิงปรัชญา" มากกว่านี้แล้วอาจพบว่าการค้นหาทางอินเทอร์เน็ต - หน้าวิกิ, ไฟล์ PDF สุ่มจาก. edu / ~ ไซต์สุ่มสุ่ม ฯลฯ - และมันไม่ได้ช่วยอะไรเลย

3
ช่วงความเชื่อมั่นกับขนาดตัวอย่าง?
ฉันยังใหม่กับสถิติและช่วงเวลาของความมั่นใจ ดังนั้นนี่อาจเป็นเรื่องเล็กน้อยหรือแม้แต่เสียงโง่ ฉันจะขอบคุณถ้าคุณสามารถช่วยฉันเข้าใจหรือชี้แนะฉันไปที่วรรณกรรม / ข้อความ / บล็อกที่อธิบายสิ่งนี้ดีกว่า ฉันเห็นในเว็บไซต์ข่าวต่าง ๆ เช่น CNN, Fox News, Politico ฯลฯ เกี่ยวกับการสำรวจของพวกเขาเกี่ยวกับการแข่งขันชิงตำแหน่งประธานาธิบดีสหรัฐอเมริกา 2012 แต่ละหน่วยงานดำเนินการสำรวจและรายงานสถิติบางส่วนของแบบฟอร์ม: ซีเอ็นเอ็น: ความนิยมของโอบามาคือ X% โดยมี margin ของ error +/- x1% ขนาดตัวอย่าง 600 FOX: ความนิยมของโอบามาคือ Y% โดยมีระยะขอบของข้อผิดพลาด +/- y1% ขนาดตัวอย่าง 800 XYZ: ความนิยมของโอบามาคือ Z% โดยมีระยะห่างของข้อผิดพลาด +/- z1% ขนาดตัวอย่าง 300 นี่คือข้อสงสัยของฉัน: ฉันจะตัดสินใจเลือกที่จะเชื่อถือได้อย่างไร มันควรจะขึ้นอยู่กับช่วงความมั่นใจหรือฉันควรสมมติว่าเนื่องจาก Fox มีขนาดตัวอย่างที่ใหญ่กว่าการประมาณการจึงน่าเชื่อถือมากขึ้น …

2
การกำหนดผู้มีส่วนร่วมมากที่สุดในกลุ่ม
ฉันไม่รู้สถิติเกี่ยวกับตัวฉันมากนัก สมมติว่าฉันมีพนักงาน 1,000 คน ฉันต้องการทราบว่าใครคือคนงานที่ยากที่สุด แต่ฉันสามารถวัดปริมาณงานที่ต้องทำในกลุ่มที่ 1-100 มากกว่าหนึ่งชั่วโมงต่อการทำงาน สมมติว่าคนงานแต่ละคนทำงานในปริมาณที่เท่ากันเสมอกว่าการทดลองและการรวมกันเป็นจำนวนมากฉันจะจัดอันดับคนงานของฉันโดยใครที่ทำงานหนักที่สุด หมายเหตุ: นี่เป็นเพียงคำอุปมาจึงไม่ต้องกังวลกับการทดสอบจริง ๆ เพียงแค่สมมติว่าฉันมีชุดข้อมูลจำนวนมากแล้ว แก้ไข: เมื่อฉันพูดว่า "สมมติว่าคนงานแต่ละคนทำงานด้วยปริมาณงานที่เท่ากันเสมอ" ฉันหมายถึงแต่ละคนทำงานในปริมาณที่เท่ากันในแต่ละวัน ดังนั้นโจอี้จะทำงานประมาณ 100 หน่วยในแต่ละวันและเกร็กจะทำประมาณ 50 งานปัญหาคือฉันสามารถสังเกตจำนวนหน่วยของงานที่ทำโดยกลุ่มเท่านั้น การแก้ไขเพิ่มเติม: เกี่ยวกับจำนวนของคนงานที่ทำงานในคราวเดียวและความถี่ของพวกเขาที่ทำงาน อาจมีคนงานจำนวนเท่าใดก็ได้ที่ทำงานในเวลาเดียวกัน คนงานบางคนอาจจะจบลงด้วยการทำงานมากกว่าคนอื่น ๆ นั่นก็คือเราสามารถสันนิษฐานได้ว่าคนงานบางคนจะทำงานเกือบ 90% ของเวลาและคนอื่น ๆ แทบจะไม่เคยเลย ฉันรู้ว่ามันทำให้ยาก แต่ฉันจะมีชุดข้อมูลที่มีขนาดใหญ่มากหวังว่าจะทำให้ง่ายขึ้นเล็กน้อย ในแต่ละชั่วโมงเรารู้ว่าคนงานคนใดกำลังทำงานและทำงานเป็นจำนวนเท่าใด จากข้อมูลนั้นฉันต้องการทราบว่าใครทำผลงานได้ดีที่สุด หากข้อมูลอยู่ในรูปแบบ JSON จะมีลักษณะดังนี้: [ { "work_done": 12345, "Workers": [ "andy", "bob", "cameron", "david" ] …

3
เปรียบเทียบอัตราอุบัติการณ์
ฉันต้องการเปรียบเทียบกับอัตราการเกิดระหว่างสองกลุ่ม (กลุ่มที่ไม่มีโรคและอีกกลุ่มด้วย) ฉันวางแผนที่จะคำนวณอัตราส่วนอัตราอุบัติการณ์ (IRR) เช่นกลุ่มอัตราอุบัติการณ์กลุ่ม B / อัตราอุบัติการณ์ A แล้วทดสอบว่าอัตรานี้เท่ากับ 1 และสุดท้ายคำนวณช่วงเวลา 95% CI สำหรับ IRR ฉันพบวิธีการคำนวณ 95% CI ในหนังสือ ( ความรู้พื้นฐานด้านชีวสถิติของ Rosner ): ประสบการณ์[บันทึก( IRR ) ± 1.96( 1 /a1) + ( 1 /a2)------------√]ประสบการณ์⁡[เข้าสู่ระบบ⁡(IRR)±1.96(1/a1)+(1/a2)]\exp\left[\log(\text{IRR}) \pm 1.96\sqrt{(1/a_1)+(1/a_2)}\right] โดยที่และคือจำนวนของกิจกรรม แต่การประมาณนี้ใช้ได้กับขนาดตัวอย่างที่ใหญ่พอเท่านั้นและฉันคิดว่าจำนวนของเหตุการณ์ที่ฉันมีคือเล็ก (อาจใช้สำหรับการเปรียบเทียบทั้งหมดโดยรวมก็โอเค)a1a1a_1a2a2a_2 ดังนั้นฉันคิดว่าฉันควรใช้วิธีอื่น Im ใช้ R และexactcipoisson.test()แพคเกจและพบว่าฉันสามารถอาจจะใช้ แต่ฟังก์ชั่นนี้มี 3 วิธีในการกำหนดค่า p-sided ทั้งสอง: …

1
การกระจายข้อผิดพลาดสำหรับการถดถอยเชิงเส้นและโลจิสติก
ด้วยข้อมูลอย่างต่อเนื่องการถดถอยเชิงเส้นถือว่าข้อผิดพลาดมีการกระจาย N (0, )Y=β1+β2X2+uY=β1+β2X2+uY=\beta_1+\beta_2X_2+uσ2σ2\sigma^2 1) เราคิดว่า Var (Y | x) เป็นเช่นเดียวกัน ~ N (0, ) หรือไม่σ2σ2\sigma^2 2) การกระจายข้อผิดพลาดนี้ในการถดถอยโลจิสติกคืออะไร? เมื่อข้อมูลอยู่ในรูปแบบของบันทึก 1 ต่อกรณีที่ "Y" คือ 1 หรือ 0 เป็นข้อผิดพลาดกระจาย Bernoulli (เช่นความแปรปรวนคือ p (1-p)) และเมื่อข้อมูลอยู่ในรูปแบบ # ประสบความสำเร็จจากการทดลอง #of มันถือว่าเป็นทวินาม (เช่นความแปรปรวนคือ np (1-p)) โดยที่ p คือความน่าจะเป็นที่ Y เป็น 1 หรือไม่

1
ความมั่นใจและช่วงการทำนายของตัวแบบการถดถอยเชิงเส้น
ตกลงดังนั้นฉันพยายามทำความเข้าใจการถดถอยเชิงเส้น ฉันมีชุดข้อมูลและดูเหมือนว่าจะไม่เป็นไร แต่ฉันก็สับสน นี่คือสรุปโมเดลเชิงเส้นของฉัน: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 Residual standard error: 0.04226 on 28 degrees of freedom Multiple R-squared: 0.6016, …
9 r  regression 

2
การคำนวณปัญหาการตีความ regsubsets และคำถามทั่วไปเกี่ยวกับขั้นตอนการเลือกรุ่น
regsubsets()ฉันต้องการที่จะเลือกใช้แบบจำลอง ฉันมีชื่อไฟล์ชื่อ olympiadaten (อัปโหลดข้อมูลแล้ว: http://www.sendspace.com/file/8e27d0 ) ฉันแนบไฟล์ข้อมูลนี้ก่อนแล้วจึงเริ่มวิเคราะห์รหัสของฉันคือ: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty + PopTotal + ExpEdu + ExpHealth, data=olympiadaten, nbest=2) summary(a) plot(a,scale="adjr2") summary(lm(Gesamt~ExpHealth)) สกรีนช็อตของพล็อต: ปัญหาคือตอนนี้ที่ฉันต้องการให้พอดีกับรุ่นที่ดีที่สุดอีกครั้ง "ด้วยตนเอง" และได้ดูมัน แต่ค่าของ R กำลังสองปรับไม่เหมือนในการส่งออก regsubsets? นี่เป็นกรณีสำหรับรุ่นอื่นเช่นเมื่อฉันทำแบบจำลองที่ง่ายที่สุดในกราฟิก: summary(lm(Gesamt~ExpHealth)) กราฟิกบอกว่ามันควรจะมีค่า R ที่ได้รับการปรับประมาณ …

2
การใช้พารามิเตอร์ Gamma พร้อมเครื่องเวกเตอร์สนับสนุน
เมื่อใช้libsvmพารามิเตอร์γγ\gammaเป็นพารามิเตอร์สำหรับฟังก์ชั่นเคอร์เนล ค่าเริ่มต้นของมันคือการตั้งค่าเป็นγ=1จำนวนคุณสมบัติγ=1number of features.\gamma = \frac{1}{\text{number of features.}} มีคำแนะนำเชิงทฤษฎีสำหรับการตั้งค่าพารามิเตอร์นี้นอกเหนือจากวิธีการที่มีอยู่เช่นการค้นหาแบบตารางหรือไม่?

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.