สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เป็นที่ยอมรับหรือไม่ที่เรียกใช้โมเดลเชิงเส้นสองชุดในชุดข้อมูลเดียวกัน
สำหรับการถดถอยเชิงเส้นที่มีหลายกลุ่ม (กลุ่มธรรมชาติที่กำหนดเบื้องต้น) เป็นที่ยอมรับหรือไม่ที่จะเรียกใช้สองรุ่นที่แตกต่างกันในชุดข้อมูลเดียวกันเพื่อตอบคำถามสองข้อต่อไปนี้ แต่ละกลุ่มมีความชันที่ไม่เป็นศูนย์และการสกัดกั้นที่ไม่ใช่ศูนย์และพารามิเตอร์สำหรับแต่ละกลุ่มภายในการถดถอยกลุ่มคืออะไร? มีไม่ว่าจะเป็นสมาชิกกลุ่มแนวโน้มที่ไม่เป็นศูนย์และการสกัดกั้นที่ไม่เป็นศูนย์หรือไม่และพารามิเตอร์สำหรับการถดถอยแบบกลุ่มนี้คืออะไร? ใน R, รุ่นแรกจะเป็นเพื่อให้ค่าสัมประสิทธิ์ประมาณอาจตีความได้โดยตรงขณะที่ตัดและความลาดชันสำหรับแต่ละรุ่นที่สองจะเป็นlm(y ~ group + x:group - 1) group.Thelm(y ~ x + 1) ทางเลือกจะเป็นlm(y ~ x + group + x:group + 1)ซึ่งส่งผลในตารางสรุปค่าสัมประสิทธิ์ที่ซับซ้อนภายในกลุ่มลาดและดักต้องคำนวณจากความแตกต่างในลาดและดักจากการอ้างอิงบางส่วน นอกจากนี้คุณต้องเรียงลำดับกลุ่มใหม่และเรียกใช้แบบจำลองเป็นครั้งที่สองต่อไปเพื่อรับค่า p สำหรับความแตกต่างของกลุ่มสุดท้าย (บางครั้ง) สิ่งนี้ใช้สองรุ่นแยกกันส่งผลเสียต่อการอนุมานในทางใดทางหนึ่งหรือการปฏิบัติตามมาตรฐานนี้หรือไม่? ในการพิจารณาเรื่องนี้ให้พิจารณาว่า x เป็นปริมาณยาและกลุ่มที่มีเชื้อชาติต่างกัน อาจเป็นเรื่องที่น่าสนใจที่จะทราบความสัมพันธ์ของการตอบสนองต่อขนาดยาสำหรับแพทย์เฉพาะทางหรือยาที่ใช้ในการแข่งขัน แต่บางครั้งก็น่าสนใจที่จะทราบความสัมพันธ์ของการตอบสนองต่อยาสำหรับประชากรทั้งหมด (มนุษย์) โดยไม่คำนึงถึงเชื้อชาติสำหรับเจ้าหน้าที่สาธารณสุข นี่เป็นเพียงตัวอย่างของวิธีการที่คนอาจสนใจทั้งภายในกลุ่มและระหว่างการถดถอยกลุ่ม ความสัมพันธ์ระหว่างปริมาณและการตอบสนองควรเป็นเชิงเส้นหรือไม่ไม่ใช่สิ่งสำคัญ

4
ฉันสามารถคำนวณเพียร์สันสถิติทดสอบสำหรับการขาดความพอดีกับรูปแบบการถดถอยโลจิสติกใน R?
อัตราส่วนความน่าจะเป็น (การเบี่ยงเบน aka)สถิติและการทดสอบแบบไม่พอดี (หรือความดีของความพอดี) นั้นค่อนข้างตรงไปตรงมาที่จะได้รับแบบจำลองการถดถอยแบบโลจิสติก (พอดีกับการใช้งาน) ในอาร์ ง่ายที่จะให้จำนวนเซลล์บางส่วนสิ้นสุดต่ำพอที่การทดสอบจะไม่น่าเชื่อถือ วิธีหนึ่งในการตรวจสอบความน่าเชื่อถือของการทดสอบอัตราส่วนความน่าจะเป็นสำหรับการขาดความพอดีคือการเปรียบเทียบสถิติการทดสอบและP- value กับการทดสอบไคสแควร์ของ Pearson (หรือ ) การทดสอบแบบไม่พอดีG2G2G^2glm(..., family = binomial)χ2χ2\chi^2 ทั้งglmวัตถุและsummary()วิธีการรายงานสถิติการทดสอบสำหรับการทดสอบไคสแควร์ของเพียร์สันสำหรับการขาดความพอดี ในการค้นหาของฉันสิ่งเดียวที่ฉันคิดไว้คือchisq.test()ฟังก์ชั่น (ในstatsแพ็คเกจ): เอกสารประกอบของมันบอกว่า " chisq.testทำการทดสอบตารางฉุกเฉินแบบไคสแควร์และการทดสอบความดีแบบพอดี" อย่างไรก็ตามเอกสารประกอบกระจัดกระจายในวิธีการทดสอบดังกล่าว: ถ้าxเป็นเมทริกซ์ที่มีหนึ่งแถวหรือคอลัมน์หรือถ้าxเป็นเวกเตอร์และyไม่ได้ให้ไว้จะทำการทดสอบความดี - พอดี ( xถือว่าเป็นตารางฉุกเฉินหนึ่งมิติ) รายการของxต้องเป็นจำนวนเต็มที่ไม่เป็นลบ ในกรณีนี้สมมติฐานที่ทดสอบคือความน่าจะเป็นของประชากรเท่ากับpหรือไม่เท่ากันทั้งหมดหากpไม่ได้รับ ฉันคิดว่าคุณสามารถใช้yส่วนประกอบของglmวัตถุสำหรับข้อโต้แย้งของx chisq.testอย่างไรก็ตามคุณไม่สามารถใช้fitted.valuesองค์ประกอบของglmวัตถุสำหรับการpโต้แย้งchisq.testเพราะคุณจะได้รับข้อผิดพลาด: " probabilities must sum to 1." อย่างน้อยฉันจะ (ใน R) คำนวณสถิติการทดสอบPearsonสำหรับการขาดความฟิตโดยไม่ต้องทำตามขั้นตอนด้วยตนเองได้อย่างไรχ2χ2\chi^2

2
แบบจำลองอนุกรมเวลาสำหรับการคาดการณ์เปอร์เซ็นต์ที่ผูกมัดด้วย (0,1) คืออะไร
สิ่งนี้จะต้องเกิดขึ้น --- การคาดการณ์ของสิ่งต่าง ๆ ที่ติดอยู่ระหว่าง 0 ถึง 1 ในซีรีส์ของฉันฉันสงสัยว่าองค์ประกอบการถดถอยอัตโนมัติและยังเป็นองค์ประกอบการคืนค่าเฉลี่ยดังนั้นฉันต้องการสิ่งที่ฉันสามารถตีความเหมือน ARIMA --- แต่ฉันไม่ต้องการให้มันยิงออกไปถึง 1,000% ในอนาคต . คุณเพิ่งใช้โมเดล ARIMA เป็นพารามิเตอร์ในการถดถอยโลจิสติกส์เพื่อ จำกัด ผลลัพธ์ระหว่าง 0 และ 1 หรือไม่ หรือฉันได้เรียนรู้ที่นี่ว่าการถดถอยเบต้าเหมาะสำหรับข้อมูล (0,1) มากกว่า ฉันจะใช้สิ่งนี้กับอนุกรมเวลาได้อย่างไร มีแพ็คเกจ R หรือฟังก์ชัน Matlab ที่เหมาะสมและคาดการณ์ได้ง่ายหรือไม่?

1
R ตัวแปรเชิงเส้นถดถอยหมวดหมู่ "ซ่อน" ค่า
นี่เป็นเพียงตัวอย่างที่ฉันเจอหลายครั้งดังนั้นฉันจึงไม่มีข้อมูลตัวอย่าง ใช้แบบจำลองการถดถอยเชิงเส้นใน R: a.lm = lm(Y ~ x1 + x2) x1เป็นตัวแปรต่อเนื่อง x2เป็นหมวดหมู่และมีสามค่าเช่น "ต่ำ", "ปานกลาง" และ "สูง" อย่างไรก็ตามเอาต์พุตที่กำหนดโดย R จะเป็นดังนี้: summary(a.lm) Estimate Std. Error t value Pr(>|t|) (Intercept) 0.521 0.20 1.446 0.19 x1 -0.61 0.11 1.451 0.17 x2Low -0.78 0.22 -2.34 0.005 x2Medium -0.56 0.45 -2.34 0.005 ฉันเข้าใจว่า R แนะนำการเข้ารหัสแบบหลอกบางอย่างเกี่ยวกับปัจจัยดังกล่าว ( …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

2
อัตราส่วนผู้ป่วย / ผู้ควบคุมที่เหมาะสมที่สุดในการศึกษากรณีศึกษา
อัตราส่วนกรณีและการควบคุมที่ดีที่สุดในการศึกษากรณีควบคุมคืออะไร? ทำไมหนังสือหรือเอกสารส่วนใหญ่ถึงแนะนำว่ามากกว่า 1 น้อยกว่า 1 (ข้อเสียคืออะไร) ขอบคุณ.

1
ฉันควรระวังปัญหาอะไรบ้างเมื่อรวมอนุกรมหลายเวลา
สมมติว่าฉันมีอนุกรมเวลาจำนวนหนึ่งเช่นจำนวนบันทึกอุณหภูมิจากสถานีต่าง ๆ ในภูมิภาค ฉันต้องการได้รับการบันทึกอุณหภูมิเดียวสำหรับทั้งภูมิภาคซึ่งฉันสามารถอธิบายลักษณะของภูมิอากาศในภูมิภาค วิธีการที่เข้าใจง่ายอาจเพียงแค่ใช้ค่าเฉลี่ยของทุกสถานีในแต่ละเวลา แต่ความรู้สึกทางสถิติของฉัน (ซึ่งฉันยังติดต่อไม่ได้ด้วย) บอกฉันว่านี่อาจไม่ใช่เรื่องง่าย โดยเฉพาะอย่างยิ่งฉันจินตนาการว่าค่าเฉลี่ยทั่วทั้งภูมิภาคจะลบจุดสุดยอดอุณหภูมิที่น่าสนใจบางส่วนและฉันอาจมีปัญหากับการพึ่งพาระหว่างสถานีปิด ฉันอาจประสบปัญหาอื่นใดอีกถ้าฉันลองใช้กลยุทธ์เช่นนี้และมีวิธีที่จะเอาชนะพวกเขาหรือวิธีการที่เหมาะสมกว่าในการรวมข้อมูลประเภทนี้ หมายเหตุ: คำตอบอาจกว้างกว่าตัวอย่างเชิงพื้นที่ที่ฉันให้ไว้

2
การกระจายข้อผิดพลาดรอบ ๆ ข้อมูลการเติบโตของโลจิสติกคืออะไร
ในระบบนิเวศน์เรามักใช้สมการการเติบโตโลจิสติกส์: Nt=KN0ertK+N0ert−1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} หรือ Nt=KN0N0+(K−N0)e−rtNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} ที่ไหน KKK คือขีดความสามารถในการบรรทุก (ถึงความหนาแน่นสูงสุด) N0N0N_0 คือความหนาแน่นเริ่มต้น rrr คืออัตราการเติบโต ttt เป็นเวลาตั้งแต่เริ่มต้น คุณค่าของ NtNtN_t มีขอบบนที่อ่อนนุ่ม (K)(K)(K) และขอบเขตที่ต่ำกว่า (N0)(N0)(N_0)มีขอบเขตล่างที่แข็งแกร่งที่ 000. นอกจากนี้ในบริบทเฉพาะของฉันการวัดของ NtNtN_t จะทำโดยใช้ความหนาแน่นของแสงหรือการเรืองแสงซึ่งทั้งสองมีทฤษฎีสูงสุดและทำให้ขอบเขตที่แข็งแกร่ง ข้อผิดพลาดรอบ ๆ NtNtN_t ดังนั้นจึงอาจอธิบายได้ดีที่สุดโดยการแจกแจงแบบมีขอบเขต ที่ค่าน้อย NtNtN_tการกระจายอาจมีความเบ้เป็นบวกอย่างมากขณะที่ค่าของ NtNtN_tเมื่อเข้าหา K …
10 r  distributions  pdf  ecology 

2
วิธีการปฏิบัติต่อจุดข้อมูลหลาย ๆ จุดอย่างถูกต้องในแต่ละหัวข้อ
ขณะนี้ฉันกำลังเถียงกับใครบางคนเกี่ยวกับวิธีการปฏิบัติต่อข้อมูลอย่างถูกต้องด้วยการวัดที่หลากหลายสำหรับแต่ละเรื่อง ในกรณีนี้ข้อมูลจะถูกรวบรวมสำหรับแต่ละเรื่องภายในเวลาอันสั้นสำหรับเงื่อนไขที่แตกต่างกันในแต่ละเรื่อง การวัดทั้งหมดรวบรวมตัวแปรเดียวกันอย่างแน่นอนเพียงหลายค่า ทางเลือกหนึ่งในขณะนี้คือการจัดกลุ่มข้อมูลตามเงื่อนไขและไม่สนใจว่าจุดข้อมูลหลายจุดมาจากเรื่องเดียว อย่างไรก็ตามจุดข้อมูลจากแต่ละเรื่องอาจไม่เป็นอิสระอย่างสมบูรณ์ อีกทางเลือกหนึ่งคือการใช้ค่าเฉลี่ยของการวัดทั้งหมดสำหรับแต่ละเงื่อนไขจากแต่ละเรื่องแล้วเปรียบเทียบค่าเฉลี่ย อย่างไรก็ตามสิ่งนี้อาจส่งผลกระทบต่อความสำคัญเนื่องจากในการวิเคราะห์ขั้นสุดท้ายไม่ได้นำมาพิจารณาว่าหมายถึงมีข้อผิดพลาดน้อยลง คุณจะวิเคราะห์ข้อมูลดังกล่าวได้อย่างถูกต้องอย่างไร? สิ่งนี้ได้รับการดูแลใน SPSS หรือไม่? โดยหลักการแล้วมันควรจะเป็นไปได้ที่จะคำนวณระยะขอบข้อผิดพลาดเมื่อทำการคำนวณค่าเฉลี่ยและมากกว่าการพิจารณาในการวิเคราะห์ขั้นสุดท้าย แต่ฉันไม่คิดว่า SPSS กำลังทำการคำนวณนี้อยู่ด้านหลังของฉัน

3
ความแปรปรวนร่วมที่ใช้ร่วมกันระหว่าง IV ทั้งหมดในสมการการถดถอยเชิงเส้นหลายเชิงเส้นคืออะไร?
ในสมการการถดถอยหลายแบบเชิงเส้นหากตุ้มน้ำหนักเบต้าสะท้อนการมีส่วนร่วมของตัวแปรอิสระแต่ละตัวมากกว่าและสูงกว่าการมีส่วนร่วมของ IV อื่น ๆ ทั้งหมดซึ่งในสมการการถดถอยคือความแปรปรวนที่แบ่งปันโดย IV ทั้งหมดที่ทำนาย DV? ตัวอย่างเช่นหากแผนภาพ Venn แสดงด้านล่าง (และนำมาจากหน้า 'เกี่ยวกับ' ของ CV ที่นี่: https://stats.stackexchange.com/about ) ได้รับการติดป้ายใหม่เป็น 3 IV และ 1 DV พื้นที่ที่มีเครื่องหมายดอกจันจะใส่เข้าไป ในสมการการถดถอยแบบหลายค่า?

3
โมเดลของมาร์คอฟที่มีความน่าจะเป็นไปตามเงื่อนไข
ก่อนอื่นให้ฉันรับทราบล่วงหน้าว่าฉันไม่เชี่ยวชาญในด้านสถิติและคณิตศาสตร์อย่างที่ฉันต้องการ บางคนอาจบอกว่ามีความรู้เพียงพอที่จะเป็นอันตราย : DI ขออภัยถ้าฉันไม่ได้ใช้คำศัพท์อย่างถูกต้อง ฉันพยายามจำลองความน่าจะเป็นของระบบที่เปลี่ยนจากสถานะหนึ่งไปเป็นอีกสถานะหนึ่ง โมเดลมาร์คอฟแบบง่ายเป็นการเริ่มต้นที่ดี (ชุดของรัฐชุดของความน่าจะเป็นของรัฐเริ่มต้นชุดของความน่าจะเป็นในการเปลี่ยนแปลงระหว่างรัฐ) อย่างไรก็ตามระบบที่ฉันสร้างแบบจำลองนั้นซับซ้อนกว่านั้น ความน่าจะเป็นในการเปลี่ยนผ่านที่นำไปสู่สถานะ ณ เวลา T นั้นแน่นอนที่สุดขึ้นอยู่กับตัวแปรอื่นที่ไม่ใช่สถานะที่ T-1 ตัวอย่างเช่น S1 -> S2 อาจมีความน่าจะเป็นการเปลี่ยนแปลง 40% เมื่อดวงอาทิตย์ส่องแสง แต่ความน่าจะเป็น S1 -> S2 จะอยู่ที่ 80% เมื่อฝนตก ข้อมูลเพิ่มเติมจากคำถามของผู้แสดงความคิดเห็น: รัฐสามารถสังเกตได้ จะมีเพียง 5-10 รัฐเท่านั้น ขณะนี้มีผู้ร่วมทุนประมาณ 30 คนที่เราต้องการตรวจสอบแม้ว่าตัวแบบสุดท้ายจะมีน้อยกว่านี้อย่างแน่นอน โควาเรียตบางตัวต่อเนื่องและอื่น ๆ ไม่ต่อเนื่อง คำถามสามข้อ: ฉันจะรวมความน่าจะเป็นแบบเปลี่ยนแปลงเงื่อนไขเข้ากับโมเดลของฉันได้อย่างไร หรือมีมุมมองอื่นทั้งหมดที่ฉันควรแนวทางปัญหานี้? นอกจากนี้ฉันควรค้นหาคำหลัก / แนวคิดออนไลน์เพื่อเรียนรู้เพิ่มเติมเกี่ยวกับเรื่องนี้อย่างไร ฉันใช้เว็บค้นหาสิ่งต่าง ๆ เช่น "โมเดลมาร์คอฟที่มีความเป็นไปได้ในการเปลี่ยนแปลงตามเงื่อนไข" …

2
วิธีการจำลองผลลัพธ์หลายตัวแปรใน R?
ส่วนของสถานการณ์เราจะจัดการกับผลตอบสนอง / ตัวแปรเช่น+ อย่างไรก็ตามในบางสถานการณ์โดยเฉพาะอย่างยิ่งในข้อมูลทางคลินิกตัวแปรผลลัพธ์อาจเป็นมิติสูง / หลายตัวแปร เช่นโดยที่มีตัวแปร Y_1 , Y_2และY_3และผลลัพธ์เหล่านี้ล้วนมีความสัมพันธ์กัน หากxแทนการรับการรักษา (ใช่ / ไม่ใช่) ฉันจะจำลองข้อมูลประเภทนี้ใน R ได้อย่างไร?Y= a + b x + ϵy=a+bx+ϵy = a + bx +\epsilonY =βx + ϵY=βx+ϵ\mathsf{Y} = \beta{x} + \mathsf{\epsilon}YY\mathsf{Y}Y1Y1Y_1Y2Y2Y_2Y3Y3Y_3xxx ตัวอย่างในชีวิตจริงผู้ป่วยแต่ละรายได้รับการผ่าตัดบายพาสหนึ่งใน 2 ประเภทและนักวิจัยวัดผู้ป่วยแต่ละรายเกี่ยวกับความเจ็บปวดบวมความเหนื่อยล้า ... ฯลฯ หลังการผ่าตัดบายพาส ฉัน "ถือว่า" ผลลัพธ์ (ความรุนแรงของอาการ) เป็นหลายตัวแปรปกติ หวังว่าตัวอย่างจริงนี้สามารถทำให้คำถามของฉันชัดเจนขึ้น ขอบคุณมากล่วงหน้า

3
ระยะทาง Mahalanobis ผ่าน PCA เมื่อ
ฉันมีเมทริกซ์โดยที่คือจำนวนยีนและคือจำนวนผู้ป่วย ทุกคนที่ทำงานกับข้อมูลดังกล่าวรู้ว่านั้นใหญ่กว่าเสมอ โดยใช้การเลือกคุณลักษณะฉันมีอากาศลงไปจำนวนที่เหมาะสมมากขึ้น แต่ยังคงสูงกว่าnn×pn×pn\times ppppnnnpppnnnppppppnnn ฉันต้องการคำนวณความคล้ายคลึงกันของผู้ป่วยตามโปรไฟล์ทางพันธุกรรมของพวกเขา ฉันสามารถใช้ระยะทางแบบยุคลิดได้ แต่มาฮาโลโนบิสดูเหมือนจะเหมาะสมกว่าเพราะมันเกี่ยวข้องกับความสัมพันธ์ระหว่างตัวแปร ปัญหาที่เกิดขึ้น (ตามที่ระบุไว้ในนี้โพสต์ ) เป็นว่าระยะทาง Mahalanobis เฉพาะเมทริกซ์ความแปรปรวนร่วมไม่ทำงานเมื่อ&lt;p เมื่อฉันเรียกใช้ระยะทาง Mahalanobis ใน R ข้อผิดพลาดที่ฉันได้รับคือ:n&lt;pn&lt;pn < p Error in solve.default(cov, ...) : system is computationally singular: reciprocal condition number = 2.81408e-21 จนถึงตอนนี้ที่จะลองแก้ปัญหานี้ฉันใช้ PCA และแทนที่จะใช้ยีนฉันใช้ส่วนประกอบและดูเหมือนว่าจะทำให้ฉันคำนวณระยะทาง Mahalanobis ได้ 5 ส่วนประกอบแทนประมาณ 80% ของความแปรปรวนดังนั้นตอนนี้Pn&gt;pn&gt;pn > p คำถามของฉันคือ:ฉันสามารถใช้ PCA เพื่อให้ได้ระยะทาง Mahalanobis …

2
AUC ในการถดถอยโลจิสติกอันดับ
ฉันใช้การถดถอยโลจิสติก 2 ชนิด - ชนิดหนึ่งเป็นแบบง่ายสำหรับการจำแนกไบนารีและอีกประเภทหนึ่งคือการถดถอยโลจิสติกอันดับ สำหรับการคำนวณความแม่นยำของครั้งแรกฉันใช้การตรวจสอบความถูกต้องข้ามซึ่งฉันคำนวณ AUC สำหรับแต่ละเท่าและกว่าการคำนวณ AUC เฉลี่ย ฉันจะทำอย่างไรสำหรับการถดถอยโลจิสติกอันดับ ฉันได้ยินเกี่ยวกับ ROC ทั่วไปสำหรับเครื่องมือทำนายหลายระดับ แต่ฉันไม่แน่ใจว่าจะคำนวณได้อย่างไร ขอบคุณ!

3
วิธีสร้างระบบผู้แนะนำที่รวมทั้งตัวกรองการทำงานร่วมกันและคุณลักษณะเนื้อหาเข้าด้วยกัน
ฉันกำลังสร้างระบบผู้แนะนำและต้องการรวมทั้งการให้คะแนนของผู้ใช้ที่ "คล้ายกัน" และคุณสมบัติของรายการ เอาท์พุทเป็นคะแนนที่คาดการณ์ไว้ [0-1]. ฉันกำลังพิจารณาเครือข่ายประสาท (เริ่มต้นด้วย) ดังนั้นอินพุตจึงเป็นการรวมกันของคุณสมบัติของรายการและการจัดอันดับของผู้ใช้แต่ละคน สำหรับรายการ A และผู้ใช้ 1 ระบบสามารถฝึกอบรมกับข้อมูลที่รวมกัน A1 ได้ นี่จะเป็นตัวอย่างหนึ่งของการฝึกอบรม เกิดอะไรขึ้นถ้าผู้ใช้ 1 ยังให้คะแนนภาพยนตร์ B ด้วย จากนั้นข้อมูล B1 จะเป็นตัวอย่างการฝึกอบรมด้วยหรือไม่ มีปัญหาในการฝึกอบรมซ้ำกับคุณสมบัติของผู้ใช้ 1 ด้วยวิธีนี้หรือไม่? คุณมีข้อเสนอแนะใด ๆ เกี่ยวกับวิธีที่ดีกว่าในการเข้าถึงปัญหาหรือไม่

1
ไม่มีค่าในตัวแปรตอบกลับใน JAGS
Gelman &amp; Hill (2006) พูดว่า: ใน Bugs ผลลัพธ์ที่หายไปในการถดถอยสามารถจัดการได้อย่างง่ายดายโดยเพียงแค่รวมเวกเตอร์ข้อมูล, NA และทั้งหมด บักเป็นแบบจำลองตัวแปรผลลัพธ์อย่างชัดเจนและดังนั้นจึงเป็นเรื่องเล็กน้อยที่จะใช้โมเดลนี้ในการกำหนดค่าที่ขาดหายไปในแต่ละรอบ นี่เป็นวิธีที่ง่ายในการใช้ JAGS ในการทำนายผล แต่การสังเกตด้วยผลลัพธ์ที่หายไปยังส่งผลต่อการประมาณพารามิเตอร์ด้วยหรือไม่ หากเป็นเช่นนั้นจะมีวิธีง่ายๆในการเก็บการสังเกตเหล่านี้ไว้ในชุดข้อมูลที่ JAGS เห็น แต่จะไม่ส่งผลกระทบต่อค่าประมาณพารามิเตอร์หรือไม่ ฉันกำลังคิดเกี่ยวกับฟังก์ชั่นการตัด แต่มีให้เฉพาะใน BUGS ไม่ใช่ JAGS

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.