สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล


7
วิธีการคำนวณการวัดจากศูนย์กลางในเครือข่าย 4 ล้าน edge โดยใช้ R?
ฉันมีไฟล์ CSV กับ 4 ล้านขอบของเครือข่ายผู้กำกับที่เป็นตัวแทนของคนสื่อสารกับแต่ละอื่น ๆ (เช่นจอห์นส่งข้อความไปยังแมรี่แมรี่ส่งข้อความไปยังแอนจอห์นส่งอีกข้อความถึงแมรี่, ฯลฯ ) ฉันต้องการทำสองสิ่ง: ค้นหาการศึกษาระดับปริญญา, ระหว่างและ (อาจ) มาตรการศูนย์กลาง eigenvector สำหรับแต่ละคน รับภาพของเครือข่าย ฉันต้องการทำสิ่งนี้ในบรรทัดคำสั่งบนเซิร์ฟเวอร์ Linux เนื่องจากแล็ปท็อปของฉันมีพลังงานไม่มาก ฉันได้ติดตั้ง R ไว้บนเซิร์ฟเวอร์นั้นและไลบรารี statnet ฉันพบโพสต์ของคนที่มีความสามารถมากกว่าฉันที่พยายามทำสิ่งเดียวกันและมีปัญหา ดังนั้นฉันจึงสงสัยว่าถ้ามีคนอื่นที่มีพอยน์เตอร์เกี่ยวกับวิธีการทำเช่นนี้โดยเฉพาะอย่างยิ่งพาฉันทีละขั้นตอนเพราะฉันรู้วิธีการโหลดไฟล์ CSV และไม่มีอะไรอื่น เพียงให้แนวคิดแก่คุณนี่คือลักษณะของไฟล์ CSV ของฉัน: $ head comments.csv "src","dest" "6493","139" "406705","369798" $ wc -l comments.csv 4210369 comments.csv

1
รหัสตัวแปรในฟังก์ชั่น nlm ()
ใน R มีฟังก์ชั่นnlm ()ซึ่งดำเนินการย่อขนาดของฟังก์ชั่น f โดยใช้อัลกอริทึม Newton-Raphson โดยเฉพาะอย่างยิ่งฟังก์ชั่นที่ส่งออกค่าของรหัสตัวแปรที่กำหนดไว้ดังต่อไปนี้: รหัสจำนวนเต็มระบุว่าทำไมกระบวนการปรับให้เหมาะสมสิ้นสุดลง 1: การไล่ระดับสีสัมพัทธ์ใกล้กับศูนย์การวนซ้ำในปัจจุบันอาจเป็นวิธีแก้ปัญหา 2: ต่อเนื่องซ้ำภายในความอดทนกระแสซ้ำอาจเป็นวิธีแก้ปัญหา 3: ขั้นตอนส่วนกลางครั้งสุดท้ายล้มเหลวในการค้นหาจุดที่ต่ำกว่าค่าประมาณ การประมาณเป็นค่าต่ำสุดในท้องถิ่นโดยประมาณของฟังก์ชันหรือ steptol นั้นเล็กเกินไป 4: เกินขีด จำกัด การทำซ้ำ 5: stepmax ขนาดขั้นตอนสูงสุดเกินห้าครั้งติดต่อกัน ฟังก์ชันไม่ได้ถูก จำกัด ด้านล่างกลายเป็น asymptotic เป็นค่า จำกัด จากด้านบนในบางทิศทางหรือ stepmax มีขนาดเล็กเกินไป ใครสามารถอธิบายฉันได้ (อาจใช้ภาพประกอบง่าย ๆ ที่มีฟังก์ชั่นของตัวแปรเพียงตัวเดียว) กับสถานการณ์ที่ 1-5? ตัวอย่างเช่นสถานการณ์ 1 อาจสอดคล้องกับภาพต่อไปนี้: ขอบคุณล่วงหน้า!
9 r  minimum 

1
การทดสอบ Tukey HSD จะเป็นสัญญาณได้อย่างไรมากกว่าค่า P ที่ไม่ถูกต้องของ t.test
ฉันมาโดยโพสต์ " การเปรียบเทียบ Pairwise แบบโพสต์ทูของ ANOVA สองทาง " (ตอบกลับโพสต์นี้ ) ซึ่งแสดงสิ่งต่อไปนี้: dataTwoWayComparisons <- read.csv("http://www.dailyi.org/blogFiles/RTutorialSeries/dataset_ANOVA_TwoWayComparisons.csv") model1 <- aov(StressReduction~Treatment+Age, data =dataTwoWayComparisons) summary(model1) # Treatment is signif pairwise.t.test(dataTwoWayComparisons$StressReduction, dataTwoWayComparisons$Treatment, p.adj = "none") # no signif pair TukeyHSD(model1, "Treatment") # mental-medical is the signif pair. (เอาท์พุทที่แนบมาร้อง) ใครช่วยอธิบายหน่อยได้ไหมว่าทำไม Tukey HSD ถึงสามารถจับคู่ที่สำคัญได้ในขณะที่ t-test ที่จับคู่ (ปรับค่าไม่ได้) ไม่สามารถทำเช่นนั้นได้? …

3
ฉันจะเพิ่มความเร็วในการคำนวณผลกระทบคงที่ใน GLMM ได้อย่างไร
ฉันกำลังทำการศึกษาแบบจำลองที่ต้องใช้การประเมินการบูตแบบจำลองที่ได้จากโมเดลเชิงเส้นเชิงเส้นแบบทั่วไป ในการทำการศึกษาให้ดีนั้นจะต้องใช้แบบจำลองประมาณ 1,000 ครั้งโดยมี 1,000 หรือ 1,500 บูตสแตรปแบบจำลองในแต่ละครั้ง คอมพิวเตอร์ของฉันใช้เวลานานพอสมควร (หลายวัน) How can I speed up the computation of these fixed effects? โดยเฉพาะอย่างยิ่งฉันมีวิชาที่วัดซ้ำ ๆ ในสามวิธีก่อให้เกิดตัวแปร X, M, และ Y โดยที่ X และ M ต่อเนื่องและ Y เป็นเลขฐานสอง เรามีสมการการถดถอยสองตัว Y ^ * = \ beta_0 + \ beta_1X + \ beta_2M + \ …
9 r  mixed-model 

1
การแก้ปัญหาชั่วคราวสำหรับการทดสอบนัยสำคัญของอนุกรมเวลาคืออะไร?
ฉันต้องการคำแนะนำบางอย่างเกี่ยวกับระดับที่เหมาะสมของการรวมกำไรเพื่อใช้สำหรับความแตกต่างของวิธีการทดสอบกับข้อมูลอนุกรมเวลา ฉันเป็นห่วงเกี่ยวกับการจำลองแบบทางโลกและแบบบูชายัญซึ่งดูเหมือนจะตึงเครียดในแอปพลิเคชันนี้ นี่คือการอ้างอิงถึงการศึกษาเกี่ยวกับบุรุษมากกว่าการทดลองบิดเบือน พิจารณาแบบฝึกหัดการติดตาม : ระบบเซ็นเซอร์ตรวจวัดปริมาณออกซิเจนละลาย (DO) ในหลาย ๆ สถานที่ทั่วทั้งความกว้างและความลึกของบ่อ การวัดสำหรับเซ็นเซอร์แต่ละตัวจะถูกบันทึกวันละสองครั้งเนื่องจาก DO รู้จักกันในแต่ละวัน ค่าสองค่าจะถูกเฉลี่ยเพื่อบันทึกค่ารายวัน สัปดาห์ละครั้งผลลัพธ์รายวันจะถูกรวมเข้าด้วยกันเพื่อมาถึงระดับความเข้มข้นของ DO ในแต่ละสัปดาห์สำหรับบ่อทั้งหมด ผลลัพธ์รายสัปดาห์เหล่านั้นจะถูกรายงานเป็นระยะและรวมต่อไป - ผลลัพธ์รายสัปดาห์จะถูกเฉลี่ยเพื่อให้ความเข้มข้น DO รายเดือนสำหรับบ่อ ผลลัพธ์รายเดือนถูกเฉลี่ยเพื่อให้ค่ารายปี ค่าเฉลี่ยรายปีจะเฉลี่ยตัวเองเพื่อรายงานความเข้มข้น DO ที่ลดลงสำหรับบ่อ เป้าหมายคือเพื่อตอบคำถามเช่น: ความเข้มข้นของ DO ในสระน้ำในปี X สูงกว่า, ต่ำกว่าหรือเท่ากับความเข้มข้นในปี Y หรือไม่ ความเข้มข้นของ DO เฉลี่ยในช่วงสิบปีที่ผ่านมานั้นแตกต่างจากทศวรรษที่ผ่านมาหรือไม่? ความเข้มข้นของ DO ในบ่อตอบสนองต่ออินพุตที่มีขนาดใหญ่จำนวนมากและแตกต่างกันมาก จำเป็นต้องมีการทดสอบที่สำคัญ วิธีการคือการใช้การเปรียบเทียบการทดสอบ T- วิธีการ ระบุว่าค่าของ decadal เป็นค่าเฉลี่ยของค่าประจำปีและค่ารายปีเป็นค่าเฉลี่ยของค่ารายเดือนสิ่งนี้ดูเหมือนจะเหมาะสม นี่คือคำถาม - …

1
การใช้การสลายตัวของค่าเอกฐานเพื่อคำนวณความแปรปรวนร่วมแปรปรวนเมทริกซ์จากตัวแบบการถดถอยเชิงเส้น
ฉันมีเมทริกซ์การออกแบบของ p regressors, การสังเกต n และฉันพยายามคำนวณเมทริกซ์ความแปรปรวนร่วม - ความแปรปรวนร่วมตัวอย่างของพารามิเตอร์ ฉันพยายามคำนวณโดยตรงโดยใช้ svd ฉันใช้ R เมื่อฉันใช้เมทริกซ์การออกแบบฉันจะได้สามองค์ประกอบ: เมทริกซ์ ยูUU ซึ่งเป็น n × pn×pn \times pเมทริกซ์ DDD ซึ่งเป็น 1 × 31×31\times 3 (ค่าลักษณะเฉพาะน่าจะเป็น) และเมทริกซ์ VVV ซึ่งเป็น 3 × 33×33\times 3. ฉันทแยงมุมDDDทำให้มันเป็น 3 × 33×33\times 3 เมทริกซ์ที่มี 0 อยู่ในแนวทแยงมุม คาดคะเนสูตรการแปรปรวนร่วมคือ: VD2V'VD2V′V D^2 V'แต่เมทริกซ์ไม่ตรงและไม่เป็นมันได้ใกล้เคียงกับ R vcovที่สร้างขึ้นในฟังก์ชั่น ใครบ้างมีคำแนะนำ …
9 r  regression 

1
การถดถอยมุมน้อยทำให้ค่าสหสัมพันธ์ลดลงและโยงกัน?
ฉันพยายามที่จะแก้ปัญหาอย่างน้อยการถดถอยมุม (LAR) นี่เป็นปัญหา3.23ในหน้า97ของHastie et al., องค์ประกอบของการเรียนรู้ทางสถิติ, อันดับที่ 2 เอ็ด (พิมพ์ครั้งที่ 5) พิจารณาปัญหาการถดถอยกับตัวแปรทั้งหมดและการตอบสนองที่มีค่าเฉลี่ยเป็นศูนย์และส่วนเบี่ยงเบนมาตรฐานหนึ่ง สมมติว่าตัวแปรแต่ละตัวมีความสัมพันธ์แบบสัมบูรณ์เหมือนกันกับการตอบสนอง: 1ยังไม่มีข้อความ| ⟨xJ, y ⟩ | = λ , J = 1 , . . , p1N|⟨xj,y⟩|=λ,j=1,...,p \frac{1}{N} | \left \langle \bf{x}_j, \bf{y} \right \rangle | = \lambda, j = 1, ..., p ปล่อยเป็นสัมประสิทธิ์กำลังสองน้อยที่สุดของใน\ mathbf {X}และปล่อยให้\ mathbf {u} …

2
การประเมินความสำคัญของสหสัมพันธ์
ฉันมีตัวแปรสองตัวและฉันสามารถคำนวณได้เช่นความสัมพันธ์แบบเพียร์สันระหว่างพวกเขา แต่ฉันอยากจะรู้อะไรบางอย่างที่คล้ายคลึงกับการทดสอบแบบทีจะให้ฉัน สิ่งนั้นมีอยู่จริงหรือไม่?

2
R: อัปเดตกราฟแบบไดนามิก [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามดังนั้นจึงเป็นหัวข้อสำหรับการตรวจสอบข้าม ปิดให้บริการใน8 เดือนที่ผ่านมา นี่เป็นคำถามการสร้างภาพข้อมูล ฉันมีฐานข้อมูลที่มีข้อมูลบางอย่างที่มีการแก้ไขอย่างต่อเนื่อง (อัพเดตออนไลน์) อะไรคือวิธีที่ดีที่สุดใน R ในการอัปเดตกราฟทุกครั้งที่บอกว่า 5 หรือ 10 วินาที (โดยไม่ต้องวางแผนใหม่ทุกสิ่งเป็นไปได้)? เฟร็ด

2
น้ำหนักระบบการให้คะแนนเพื่อให้รายการที่ได้รับการจัดอันดับสูงขึ้นจากผู้คนจำนวนมากกว่ารายการที่จัดอันดับสูงโดยมีผู้คนน้อยลงหรือไม่
ขอบคุณล่วงหน้าสำหรับการแบกกับฉันฉันไม่ได้เป็นนักสถิติทุกประเภทและไม่รู้วิธีอธิบายสิ่งที่ฉันจินตนาการดังนั้น Google จึงไม่ได้ช่วยฉันที่นี่ ... ฉันรวมระบบการให้คะแนนในเว็บแอปพลิเคชันที่ฉันทำงานอยู่ ผู้ใช้แต่ละคนสามารถให้คะแนนแต่ละรายการได้หนึ่งครั้ง ฉันจินตนาการถึงมาตราส่วนด้วยค่า 4 ค่า: "ไม่ชอบอย่างยิ่ง", "ไม่ชอบ", "ชอบ" และ "ขอชอบมาก" และฉันวางแผนที่จะกำหนดค่าเหล่านี้เป็น -5, -2, +2 และ +5 ตามลำดับ . ตอนนี้ถ้าทุกรายการจะมีคะแนนเท่ากันฉันก็จะค่อนข้างสบายใจกับระบบการให้คะแนนนี้ซึ่งแตกต่างอย่างชัดเจนจากรายการที่ชอบมากที่สุดและรายการที่ชอบน้อยที่สุด อย่างไรก็ตามรายการจะไม่มีการจัดอันดับจำนวนเท่ากันและความไม่เท่าเทียมกันระหว่างจำนวนคะแนนโหวตของภาพถ่ายที่แตกต่างกันอาจค่อนข้างน่าทึ่ง ในกรณีนี้การเปรียบเทียบคะแนนสะสมของสองรายการหมายความว่ารายการเก่าที่มีคะแนนปานกลางมากจะมีคะแนนสูงกว่ารายการใหม่ที่ยอดเยี่ยมที่มีคะแนนโหวตน้อยกว่ามาก สิ่งแรกที่ชัดเจนที่ฉันคิดว่าเราใช้โดยเฉลี่ย ... แต่ตอนนี้หากรายการมีการจัดอันดับเดียวที่ "5" จะมีค่าเฉลี่ยที่ดีกว่ารายการที่มีคะแนน 99 "+5" และ 1 "+2" ให้คะแนน โดยสังหรณ์ที่ไม่ได้เป็นตัวแทนที่ถูกต้องของความนิยมของรายการ ฉันคิดว่าปัญหานี้เป็นเรื่องปกติและพวกคุณไม่ต้องการให้ฉันเชื่อในตัวอย่างอีกดังนั้นฉันจะหยุดที่จุดนี้และอธิบายอย่างละเอียดในความคิดเห็นหากจำเป็น คำถามของฉันคือ: ปัญหาแบบนี้เรียกว่าอะไรและมีศัพท์สำหรับเทคนิคที่ใช้ในการแก้ปัญหานี้หรือไม่? ฉันอยากรู้สิ่งนี้เพื่อที่ฉันจะได้อ่านมันได้ หากคุณรู้ว่ามีแหล่งข้อมูลที่เป็นมิตรในเรื่องใดฉันจะขอขอบคุณลิงค์ สุดท้ายนี้ฉันขอขอบคุณข้อเสนอแนะอื่น ๆ เกี่ยวกับวิธีการรวบรวมและวิเคราะห์ข้อมูลประเภทนี้อย่างมีประสิทธิภาพ
9 scales  rating 

1
ฉันควรสลับข้อมูลของฉันอีกครั้งหรือไม่
เรามีตัวอย่างชีวภาพชุดหนึ่งที่ค่อนข้างแพง เราวางตัวอย่างเหล่านี้ผ่านชุดการทดสอบเพื่อสร้างข้อมูลที่ใช้สำหรับสร้างแบบจำลองการทำนาย เพื่อจุดประสงค์นี้เราได้แบ่งกลุ่มตัวอย่างเป็นชุดฝึกอบรม (70%) และชุดทดสอบ (30%) เราสร้างแบบจำลองได้สำเร็จและนำไปใช้กับชุดการทดสอบเพื่อค้นหาว่าประสิทธิภาพนั้น "น้อยกว่าความเหมาะสม" ผู้ทำการทดลองต้องการปรับปรุงการทดสอบทางชีวภาพเพื่อสร้างแบบจำลองที่ดีขึ้น โดยมีเงื่อนไขว่าเราไม่สามารถรับตัวอย่างใหม่ได้คุณขอแนะนำให้เราสุ่มตัวอย่างใหม่เพื่อสร้างชุดการฝึกอบรมและการตรวจสอบความถูกต้องใหม่หรือติดกับส่วนเดิม (เราไม่มีข้อบ่งชี้ว่าการแบ่งนั้นเป็นปัญหาอย่างหนึ่ง)

1
อะไรคือความแตกต่างในทางปฏิบัติและการตีความระหว่างทางเลือกและการถดถอยโลจิสติก?
คำถามล่าสุดเกี่ยวกับทางเลือกในการถดถอยโลจิสติกใน Rให้ผลหลากหลายของคำตอบรวมถึง randomForest, gbm, rpart, bayesglm และโมเดลเสริมทั่วไป อะไรคือความแตกต่างในทางปฏิบัติและการตีความระหว่างวิธีการเหล่านี้กับการถดถอยโลจิสติก พวกเขาตั้งสมมติฐานอะไรบ้าง (หรือไม่ทำให้) สัมพันธ์กับการถดถอยโลจิสติกส์? เหมาะสำหรับการทดสอบสมมติฐานหรือไม่? เป็นต้น

1
ขนาดตัวอย่างสำหรับสัดส่วนในการวัดซ้ำ
ฉันพยายามช่วยนักวิทยาศาสตร์ในการออกแบบการศึกษาสำหรับการเกิดขึ้นของเชื้อจุลินทรีย์เชื้อ Salmonella เขาต้องการเปรียบเทียบสูตรยาต้านจุลชีพที่ทดลองกับคลอรีน (สารฟอกขาว) ที่ฟาร์มสัตว์ปีก เนื่องจากอัตราพื้นหลังของเชื้อซัลโมเนลล่าแตกต่างกันไปตามกาลเวลาเขาจึงวางแผนที่จะวัด% สัตว์ปีกด้วยซัลโมเนลลาก่อนการรักษาและหลังการรักษา ดังนั้นการวัดจะเป็นความแตกต่างของ% salmonella ก่อน / หลังสำหรับสูตรการทดลองกับคลอรีน ใครสามารถให้คำแนะนำเกี่ยวกับวิธีการประเมินขนาดตัวอย่างที่จำเป็น? สมมุติว่าอัตราพื้นหลัง 50%; หลังจากฟอกสีเป็น 20%; และเราต้องการตรวจสอบว่าสูตรการทดลองเปลี่ยนอัตรา +/- 10% หรือไม่ ขอบคุณ แก้ไข: สิ่งที่ฉันกำลังดิ้นรนกับวิธีการรวมอัตราพื้นหลัง ลองเรียกพวกเขาว่า p3 และ p4 ซึ่งเป็นอัตรา "ก่อนหน้า" สำหรับเชื้อฟอกขาวและตัวอย่างทดลองตามลำดับ ดังนั้นสถิติที่จะประมาณคือความแตกต่างของความแตกต่าง: การทดลอง (หลัง - ก่อน) - Bleach (หลัง - ก่อน) = (p0-p2) - (p3-p1) หากต้องการพิจารณารูปแบบการสุ่มตัวอย่างทั้งหมดของ "ก่อน" อัตรา p2 และ …

2
การเรียนรู้ที่เพิ่มขึ้นสำหรับโมเดลอนุกรมเวลา LOESS
ขณะนี้ฉันกำลังทำงานกับข้อมูลอนุกรมเวลาฉันรู้ว่าฉันสามารถใช้แบบจำลอง LOESS / ARIMA ข้อมูลถูกเขียนไปยังเวกเตอร์ที่มีความยาว 1,000 ซึ่งเป็นคิวการอัพเดททุก 15 นาที ดังนั้นข้อมูลเก่าจะโผล่ออกมาในขณะที่ข้อมูลใหม่พุชในเวกเตอร์ ฉันสามารถรันโมเดลทั้งหมดบนตัวกำหนดตารางเวลาอีกครั้งเช่นฝึกอบรมใหม่ทุก ๆ 15 นาทีนั่นคือใช้ค่าทั้งหมด 1,000 เพื่อฝึกแบบจำลอง LOESS อย่างไรก็ตามมันไม่มีประสิทธิภาพมากเพราะทุกครั้งที่ใส่ค่าเพียงหนึ่งในขณะที่อีก 999 vlaues ยังคงเหมือนเดิม ดังนั้นฉันจะบรรลุประสิทธิภาพที่ดีขึ้นได้อย่างไร ขอบคุณมาก

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.