สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

2
การจัดกลุ่มเชิงพื้นที่ตามความหนาแน่นของแอปพลิเคชันที่มีการจัดกลุ่มเสียง (DBSCAN) ใน R
คำถามนี้เริ่มต้นเป็น "การจัดกลุ่มข้อมูลเชิงพื้นที่ใน R " และตอนนี้ย้ายไปยังคำถาม DBSCAN เนื่องจากการตอบคำถามแรกแนะนำให้ฉันค้นหาข้อมูลเกี่ยวกับ DBSCAN และอ่านเอกสารบางอย่างเกี่ยวกับ มีคำถามใหม่เกิดขึ้น DBSCAN ต้องการพารามิเตอร์บางตัวหนึ่งในนั้นคือ "ระยะทาง" เนื่องจากข้อมูลของฉันมีสามมิติลองจิจูดละติจูดและอุณหภูมิฉันควรใช้ "ระยะทาง" ใด มิติใดเกี่ยวข้องกับระยะทางนั้น ฉันควรจะเป็นอุณหภูมิ ฉันจะค้นหาระยะห่างขั้นต่ำเช่น R ได้อย่างไร พารามิเตอร์อื่นคือจำนวนจุดต่ำสุดที่ควรสร้างเป็นคลัสเตอร์ มีวิธีการหาหมายเลขนั้นหรือไม่? น่าเสียดายที่ฉันไม่พบ กำลังค้นหา Google ฉันไม่สามารถหาตัวอย่าง R สำหรับการใช้ dbscan ในชุดข้อมูลที่คล้ายกับของฉันคุณรู้จักเว็บไซต์ใดที่มีตัวอย่างประเภทนี้หรือไม่ ดังนั้นฉันสามารถอ่านและพยายามปรับให้เข้ากับกรณีของฉัน คำถามสุดท้ายคือความพยายามครั้งแรกของฉันกับ DBSCAN (ไม่มีคำตอบที่ถูกต้องสำหรับคำถามก่อนหน้า) ทำให้เกิดปัญหาหน่วยความจำ R บอกว่ามันไม่สามารถจัดสรรเวกเตอร์ได้ ฉันเริ่มต้นด้วยตารางที่เว้นระยะ 4 กม. ด้วย 779191 จุดที่สิ้นสุดในประมาณ 300,000 แถว x 3 คอลัมน์ (ละติจูดลองจิจูดและอุณหภูมิ) …
9 r  clustering  spatial 

2
รุ่น Tobit พร้อม R
มีใครรู้บ้างว่าจะหาแอปพลิเคชันและตัวอย่างที่ดีได้ที่ไหน (นอกเหนือจากคู่มือและหนังสือเศรษฐศาสตร์ที่ใช้กับ R) โดยใช้โมเดล tobit กับแพ็คเกจ AER แก้ไข ฉันกำลังค้นหาคำสั่งเพื่อคำนวณผลกระทบส่วนเพิ่มสำหรับ y (ไม่ใช่สำหรับตัวแปรแฝง y *) ดูเหมือนว่าโดยที่เป็นฟังก์ชันการแจกแจงสะสม std.n ปกติ แต่ฉันจะคำนวณผลกระทบเหล่านั้นด้วย R ได้อย่างไรϕ(xβ/σ)βϕ(xβ/σ)β\phi(x\beta/\sigma)\betaϕϕ\phi

6
การทดสอบความเสถียรในอนุกรมเวลา
มีวิธีมาตรฐาน (หรือดีที่สุด) สำหรับการทดสอบเมื่ออนุกรมเวลาที่กำหนดมีความเสถียรหรือไม่? แรงจูงใจบางอย่าง ฉันมีระบบแบบไดนามิกสุ่มที่ผลค่าในแต่ละขั้นตอนเวลา{N} ระบบนี้มีพฤติกรรมชั่วคราวจนกว่าจะถึงขั้นตอนแล้วทำให้ค่าเฉลี่ยโดยมีข้อผิดพลาด ฉันไม่ทราบว่าเป็น ,หรือข้อผิดพลาดใด ๆ ฉันยินดีที่จะตั้งสมมติฐาน (เช่นข้อผิดพลาดแบบเกาส์รอบxเสื้อxเสื้อx_tt ∈ Nเสื้อ∈ยังไม่มีข้อความt \in \mathbb{N}เสื้อ* * * *เสื้อ* * * *t^*x* * * *x* * * *x^*เสื้อ* * * *เสื้อ* * * *t^*x* * * *x* * * *x^*x* * * *x* * * *x^*ตัวอย่างเช่น) แต่หากฉันต้องการสมมติฐานที่น้อยกว่าก็ยิ่งดี สิ่งเดียวที่ฉันรู้แน่นอนคือมีเพียงจุดเดียวที่ระบบเข้าหากันและความผันผวนรอบจุดคงที่นั้นเล็กกว่าความผันผวนในช่วงเวลาชั่วคราว กระบวนการนี้เป็นแบบ monotonic-ish ด้วยฉันสามารถสันนิษฐานได้ว่าเริ่มต้นใกล้และปีนขึ้นไปทาง …

3
แนะนำการอ้างอิงเกี่ยวกับน้ำหนักตัวอย่างของแบบสำรวจ
มาตั้งเป้าหมายไว้บ้างในระดับเกริ่นนำบทความและตำราบางเล่ม ใช้แล้วมีประโยชน์มากกว่ารวมถึงรหัส R นั้นยอดเยี่ยม ขอบคุณ!

4
ลำดับของตัวแปรมีความสำคัญในการถดถอยเชิงเส้นหรือไม่
ฉันกำลังตรวจสอบความสัมพันธ์ระหว่างตัวแปรสองตัว (x1x1x_1 และ x2x2x_2) มีความสัมพันธ์เชิงเส้นตรงมากระหว่างตัวแปรเหล่านี้ด้วยr > 0.9r>0.9r>0.9. จากลักษณะของปัญหาฉันไม่สามารถพูดอะไรเกี่ยวกับสาเหตุได้ (ไม่ว่าจะเป็นx1x1x_1 สาเหตุ x2x2x_2หรือวิธีอื่น ๆ ) ฉันต้องการศึกษาการเบี่ยงเบนจากเส้นการถดถอยเพื่อตรวจหาค่าผิดปกติ ในการทำเช่นนี้ฉันสามารถสร้างการถดถอยเชิงเส้นของx1x1x_1 เป็นหน้าที่ของ x2x2x_2หรือวิธีอื่น ๆ การเลือกคำสั่งผันแปรของฉันมีผลต่อผลลัพธ์ของฉันหรือไม่

3
จะเปลี่ยนชื่อคอลัมน์ใน data frame ใน R ได้อย่างไร? [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน6 ปีที่ผ่านมา names(mydat)[c(name)]<-c("newname") จากนี้ฉันรู้ว่าคอลัมน์ / ชื่อตัวแปร "ชื่อ" ของ data frame mydat จะถูกแทนที่ด้วย "newname" คำถามของฉันคือถ้าฉันต้องการทำสิ่งนี้ด้วยการวนซ้ำเพื่อที่ฉันจะได้สิ่งที่ชอบ: newname1 newname2 newname3 newname4 เป็นต้นฉันจะทำอย่างไร นี่คือสิ่งที่ทำและไม่ได้ผล: for(i in 1:4){ names(mydat)[c(name)]<-c("newname"i) } มีวิธีการรหัสนี้หรือไม่? ขอบคุณมากสำหรับทุกคนที่สามารถช่วยได้ Owusu Isaac
9 r 

3
ทำไมความสามารถในการแลกเปลี่ยนของตัวแปรสุ่มจึงมีความสำคัญในตัวแบบเบย์เซียนแบบลำดับชั้น?
ทำไมความสามารถในการแลกเปลี่ยนของตัวแปรสุ่มจึงจำเป็นสำหรับการสร้างแบบจำลองแบบเบย์แบบลำดับชั้น?

2
ข้อดีของการเข้าถึงปัญหาโดยกำหนดฟังก์ชันต้นทุนที่ปรับให้เหมาะสมทั่วโลก
นี่เป็นคำถามที่ค่อนข้างทั่วไป (นั่นคือไม่เฉพาะเจาะจงกับสถิติ) แต่ฉันได้สังเกตเห็นแนวโน้มในการเรียนรู้ของเครื่องและวรรณกรรมทางสถิติที่ผู้เขียนต้องการทำตามวิธีการต่อไปนี้: วิธีที่ 1 : หาวิธีแก้ไขปัญหาที่เกิดขึ้นจริงโดยกำหนดฟังก์ชันต้นทุนที่เป็นไปได้ (เช่นจากจุดยืนการคำนวณ) เพื่อค้นหาโซลูชันที่เหมาะสมที่สุดทั่วโลก (เช่นโดยกำหนดฟังก์ชันต้นทุนนูน) ค่อนข้างมากกว่า: วิธีที่ 2 : หาวิธีแก้ไขปัญหาเดียวกันโดยกำหนดฟังก์ชั่นต้นทุนที่เราอาจไม่สามารถหาทางออกที่ดีที่สุดทั่วโลก (เช่นเราจะได้รับทางออกที่ดีที่สุดในท้องถิ่นเท่านั้น) โปรดทราบว่าการพูดอย่างจริงจังถึงปัญหาทั้งสองนั้นแตกต่างกัน สมมติฐานคือเราสามารถหาทางออกที่ดีที่สุดทั่วโลกสำหรับคนแรก แต่ไม่ใช่สำหรับคนที่สอง ข้อควรพิจารณาอื่น ๆ นอกเหนือจาก (เช่นความเร็วความง่ายในการใช้งาน ฯลฯ ) ฉันกำลังมองหา: คำอธิบายของแนวโน้มนี้ (เช่นข้อโต้แย้งทางคณิตศาสตร์หรือประวัติศาสตร์) ประโยชน์ที่ได้รับ (ในทางปฏิบัติและ / หรือเชิงทฤษฎี) สำหรับการปฏิบัติตามแนวทางที่ 1 แทน 2 เมื่อแก้ปัญหาในทางปฏิบัติ

1
การทดสอบการเปลี่ยนแปลงแบบสุ่มสำหรับการเลือกคุณสมบัติ
ฉันสับสนเกี่ยวกับการวิเคราะห์การเปลี่ยนแปลงสำหรับการเลือกคุณสมบัติในบริบทการถดถอยโลจิสติก คุณสามารถให้คำอธิบายที่ชัดเจนเกี่ยวกับการทดสอบการเปลี่ยนรูปแบบสุ่มและนำไปใช้กับการเลือกคุณสมบัติได้อย่างไร อาจเป็นไปได้ด้วยอัลกอริทึมและตัวอย่างที่แน่นอน ในที่สุดมันเปรียบเทียบกับวิธีการหดตัวแบบอื่นเช่น Lasso หรือ LAR อย่างไร

1
จะตีความผลลัพธ์ของการลดขนาด / การปรับหลายมิติได้อย่างไร
ฉันทำการแยกย่อย SVD และมาตราส่วนหลายมิติของเมทริกซ์ข้อมูล 6 มิติเพื่อทำความเข้าใจโครงสร้างของข้อมูลให้ดีขึ้น น่าเสียดายที่ค่าเอกพจน์ทั้งหมดนั้นอยู่ในลำดับเดียวกันซึ่งหมายความว่าขนาดของข้อมูลเป็นจริง 6 อย่างไรก็ตามฉันอยากจะตีความค่าของเวกเตอร์เอกพจน์ได้ ตัวอย่างเช่นคนแรกดูเหมือนจะมากหรือน้อยเท่ากันในแต่ละมิติ (เช่น(1,1,1,1,1,1)) และที่สองก็มีโครงสร้างที่น่าสนใจ (เช่น(1,-1,1,-1,-1,1)) ฉันจะตีความเวกเตอร์เหล่านี้ได้อย่างไร คุณช่วยชี้ให้ฉันดูวรรณกรรมในเรื่องนี้ได้ไหม

2
การกระจายของชิ้นส่วน 'ไม่ได้ผสม' ตามคำสั่งของการผสม
สมมติว่าฉันได้จับคู่ข้อสังเกตวาด iid เป็น Xผม∼ N( 0 ,σ2x) ,Yผม∼ N( 0 ,σ2Y) ,Xผม~ยังไม่มีข้อความ(0,σx2),Yผม~ยังไม่มีข้อความ(0,σY2),X_i \sim \mathcal{N}\left(0,\sigma_x^2\right), Y_i \sim \mathcal{N}\left(0,\sigma_y^2\right), สำหรับ i = 1 , 2 , … , nผม=1,2,...,ni=1,2,\ldots,n. ปล่อยZผม=Xผม+Yผม,Zผม=Xผม+Yผม,Z_i = X_i + Y_i, และแสดงโดย ZผมJZผมJZ_{i_j} JJjค่าที่สังเกตได้มากที่สุดคือ ZZZ. การกระจาย (เงื่อนไข) ของคืออะไรXผมJXผมJX_{i_j}? (หรือเทียบเท่าจากYผมJYผมJY_{i_j}) นั่นคืออะไรคือการกระจายตัวของ XผมXผมX_i เงื่อนไข ZผมZผมZ_i เป็น JJjที่ใหญ่ที่สุดของ nnn ค่าสังเกตของ ZZZ? ฉันเดาว่าเป็น …

3
การขี่จักรยานในอัลกอริทึม k-mean
ตามที่วิกิพีเดียลู่เกณฑ์ใช้กันอย่างแพร่หลายคือ "มอบหมายไม่ได้เปลี่ยนแปลง" ฉันสงสัยว่าการขี่จักรยานอาจเกิดขึ้นได้หรือไม่ถ้าเราใช้เกณฑ์การลู่เข้าเช่นนี้ ฉันยินดีถ้ามีคนอ้างอิงถึงบทความที่ให้ตัวอย่างของการขี่จักรยานหรือพิสูจน์ว่าเป็นไปไม่ได้

5
การกำหนดเกณฑ์อัตโนมัติสำหรับการตรวจจับความผิดปกติ
ฉันกำลังทำงานกับอนุกรมเวลาของคะแนนความผิดปกติ (พื้นหลังคือการตรวจจับความผิดปกติในเครือข่ายคอมพิวเตอร์) ทุกนาทีฉันได้รับคะแนนความผิดปกติซึ่งบอกฉันว่า "ไม่คาดฝัน" หรือผิดปกติสถานะปัจจุบันของเครือข่ายคืออะไร ยิ่งคะแนนสูงเท่าไรสถานะปัจจุบันก็ยิ่งผิดปกติมากเท่านั้น คะแนนที่ใกล้เคียงกับ 5 เป็นไปได้ในทางทฤษฎี แต่เกิดขึ้นแทบจะไม่เคยเกิดขึ้นเลยxเสื้อ∈ [ 0 , 5 ]xเสื้อ∈[0,5]x_t \in [0, 5] ตอนนี้ฉันต้องการอัลกอริธึมหรือสูตรที่กำหนดเกณฑ์โดยอัตโนมัติสำหรับอนุกรมเวลาผิดปกตินี้ ทันทีที่คะแนนผิดปกติเกินเกณฑ์นี้สัญญาณเตือนจะเริ่มทำงาน การแจกแจงความถี่ด้านล่างเป็นตัวอย่างสำหรับอนุกรมเวลาที่ผิดปกติมากกว่า 1 วัน อย่างไรก็ตามมันไม่ปลอดภัยที่จะสมมติว่าซีรีย์ความผิดปกติทุกครั้งจะมีลักษณะเช่นนั้น ในตัวอย่างพิเศษนี้เกณฑ์ความผิดปกติเช่น. 99-quantile จะเข้าท่าเนื่องจากคะแนนไม่กี่อันทางขวามากถือได้ว่าเป็นความผิดปกติ และการแจกแจงความถี่เดียวกันกับอนุกรมเวลา (ช่วงนั้นมีค่าตั้งแต่ 0 ถึง 1 เนื่องจากไม่มีคะแนนความผิดปกติสูงกว่าในอนุกรมเวลา): แต่น่าเสียดายที่การแจกแจงความถี่อาจมีรูปร่างที่ .99-quantile คือไม่ได้มีประโยชน์ ตัวอย่างด้านล่าง หางขวาอยู่ในระดับต่ำมากดังนั้นหากใช้. 99-quantile เป็นจุดเริ่มต้นสิ่งนี้อาจส่งผลให้เกิดผลบวกปลอมหลายอย่าง การแจกแจงความถี่นี้ดูเหมือนจะไม่มีความผิดปกติดังนั้นเกณฑ์ควรอยู่นอกการกระจายที่ประมาณ 0.25 สรุปแล้วความแตกต่างระหว่างสองตัวอย่างนี้คือตัวอย่างแรกดูเหมือนว่าจะมีความผิดปกติในขณะที่อีกอันหนึ่งไม่มี จากมุมมองที่ไร้เดียงสาของฉันอัลกอริทึมควรพิจารณาสองกรณีนี้: หากการแจกแจงความถี่มีหางขวาขนาดใหญ่ (เช่นคะแนนผิดปกติสองเท่า) ดังนั้น. 99-quantile อาจเป็นเกณฑ์ที่ดี หากการแจกแจงความถี่มีหางขวาสั้นมาก …

3
การจัดกลุ่มที่ประหยัดพื้นที่
อัลกอริธึมการจัดกลุ่มส่วนใหญ่ที่ฉันเคยเห็นเริ่มต้นด้วยการสร้างระยะห่างแต่ละจุดระหว่างจุดทั้งหมดซึ่งกลายเป็นปัญหาในชุดข้อมูลขนาดใหญ่ มีคนที่ไม่ทำเหรอ? หรือมันเป็นวิธีการบางส่วน / โดยประมาณ / เซ? อัลกอริทึมการจัดกลุ่ม / การใช้งานใดที่ใช้พื้นที่น้อยกว่า O (n ^ 2) มีรายการอัลกอริทึมและข้อกำหนดด้านเวลาและสถานที่อยู่หรือไม่?

1
ฉันจะประเมิน GEE / logistic model ได้อย่างไรเมื่อเพื่อนร่วมทุนมีข้อมูลที่ขาดหายไป
ฉันมีโมเดลสมการการประมาณ (GEE) สองแบบทั่วไปกับข้อมูลของฉัน: 1) โมเดลที่ 1: ผลลัพธ์คือระยะยาวใช่ / ไม่ใช่ตัวแปร (A) (ปี 1,2,3,4,5) พร้อมตัวทำนายแบบต่อเนื่องตามยาว (B) เป็นเวลา 1 ปี 1,2,3,4,5 2) รุ่นที่ 2: ผลลัพธ์เป็นตัวแปรตามยาวเหมือนกันใช่ / ไม่ใช่ (A) แต่ตอนนี้ตัวทำนายของฉันได้รับการแก้ไขที่ค่าปี 1 นั่นคือบังคับให้เป็นค่าคงที่เวลา (B) เนื่องจากการวัดที่ขาดหายไปในตัวทำนายระยะยาวของฉันในเวลาไม่กี่จุดสำหรับกรณีที่แตกต่างกันจำนวนจุดข้อมูลในรุ่น 2 จึงสูงกว่าในรุ่น 1 ฉันต้องการทราบว่าการเปรียบเทียบใดที่ฉันสามารถทำได้อย่างถูกต้องระหว่างอัตราส่วนอัตราต่อรองค่า p และความพอดีของทั้งสองรุ่นเช่น: หาก OR สำหรับตัวทำนาย B มีขนาดใหญ่กว่าในโมเดล 1 ฉันสามารถพูดได้อย่างถูกต้องหรือไม่ว่าความสัมพันธ์ระหว่าง A และ B นั้นแข็งแกร่งกว่าใน model1 ฉันจะประเมินได้อย่างไรว่าโมเดลใดดีกว่าสำหรับข้อมูลของฉัน ฉันถูกต้องในการคิดหรือไม่ว่าการเปรียบเทียบหลอกหลอก …
9 logistic  gee 

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.