สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
เมื่อใดจึงควรใช้ Deming regression
ฉันกำลังทำงานเกี่ยวกับวิธีการแปลงค่าการทดสอบฟอสฟอรัสที่แตกต่างกันสองค่าให้กัน พื้นหลัง มีหลายวิธีในการวัดฟอสฟอรัสที่มีอยู่ในดิน ประเทศที่แตกต่างกันใช้วิธีการที่แตกต่างกันดังนั้นเพื่อเปรียบเทียบความอุดมสมบูรณ์ของ P ทั่วประเทศมีความจำเป็นต้องคำนวณค่าการทดสอบ P x ตามค่า P-test y และในทางกลับกัน ดังนั้นการตอบสนองและความแปรปรวนร่วมสามารถเปลี่ยนได้ ปริมาณ P ในสารสกัด 1 = P_CAL ใน [mg / 100 กรัมดิน] P จำนวนในสารสกัด 2 = P_DL ใน [mg / 100 กรัมดิน] เพื่อสร้าง "สมการการเปลี่ยนแปลง" ดังกล่าวเนื้อหา P ของตัวอย่างดิน 136 ตัวอย่างถูกวิเคราะห์ด้วยสารสกัดจาก CAL และ DL วัดพารามิเตอร์เพิ่มเติมเช่น pH ดินคาร์บอนอินทรีย์รวมไนโตรเจนทั้งหมดดินและคาร์บอเนต วัตถุประสงค์คือเพื่อให้ได้แบบจำลองการถดถอยอย่างง่าย ในขั้นตอนที่สองยังมีหลายรุ่น เพื่อให้ภาพรวมของข้อมูลที่ฉันแสดงให้คุณเห็นสอง …

4
ฉันจะตรวจสอบว่าสองสหสัมพันธ์มีความแตกต่างอย่างมีนัยสำคัญได้อย่างไร
ฉันต้องการพิจารณาว่าชุดข้อมูลสองชุดใด (B1, B2) ดีกว่าสัมพันธ์ (pearsons r) กับชุดอื่น (A) ไม่มีข้อมูลในชุดข้อมูลทั้งหมด ฉันจะทราบได้อย่างไรว่าความสัมพันธ์ที่เกิดขึ้นมีความแตกต่างอย่างมีนัยสำคัญหรือไม่? เช่นค่า 8426 มีทั้ง A และ B1, r = 0.74 8798 มีอยู่ทั้ง A และ B2, r = 0.72 ฉันคิดว่าคำถามนี้อาจช่วยได้ แต่ก็ยังไม่ได้รับคำตอบ: จะรู้ได้อย่างไรว่าระบบหนึ่งดีกว่าอีกระบบหนึ่งอย่างมาก

6
การใช้ค่า p เพื่อคำนวณความน่าจะเป็นของสมมติฐานที่เป็นจริง ต้องการอะไรอีก
คำถาม: ความเข้าใจผิดอย่างหนึ่งที่พบบ่อยของค่า p คือพวกมันเป็นตัวแทนของความน่าจะเป็นของสมมติฐานว่างเปล่าที่เป็นจริง ฉันรู้ว่าไม่ถูกต้องและฉันรู้ว่าค่า p แสดงถึงความน่าจะเป็นในการหาตัวอย่างมากเช่นนี้เนื่องจากสมมติฐานว่างเป็นจริง อย่างไรก็ตามอย่างสังหรณ์ใจคนหนึ่งควรจะได้รับมาจากคนหลัง ต้องมีเหตุผลว่าทำไมไม่มีใครทำเช่นนี้ ข้อมูลใดที่เราขาดหายไปซึ่ง จำกัด เราจากการได้รับความน่าจะเป็นของสมมติฐานที่เป็นจริงจากค่า p และข้อมูลที่เกี่ยวข้อง? ตัวอย่าง: สมมติฐานของเราคือ "วิตามินดีส่งผลต่ออารมณ์" (สมมติฐานว่างเปล่าว่าเป็น "ไม่มีผล") สมมติว่าเราทำการศึกษาทางสถิติที่เหมาะสมกับ 1,000 คนและค้นหาความสัมพันธ์ระหว่างอารมณ์และระดับวิตามิน สิ่งอื่น ๆ ที่เท่าเทียมกันค่า p-0.01 บ่งชี้ความเป็นไปได้ของสมมติฐานที่แท้จริงสูงกว่าค่า p-0.05 สมมุติว่าเราได้ค่า p เป็น 0.05 ทำไมเราไม่สามารถคำนวณความน่าจะเป็นจริงที่สมมติฐานของเราเป็นจริงได้ ข้อมูลอะไรที่เราขาดหายไป? คำศัพท์สำรองสำหรับนักสถิติประจำ: หากคุณยอมรับหลักฐานของคำถามของฉันคุณสามารถหยุดอ่านได้ที่นี่ ต่อไปนี้สำหรับผู้ที่ปฏิเสธที่จะยอมรับว่าสมมติฐานสามารถมีการตีความความน่าจะเป็น เรามาลืมคำศัพท์กันสักครู่ แทน... สมมติว่าคุณกำลังเดิมพันกับเพื่อนของคุณ เพื่อนของคุณแสดงการศึกษาทางสถิตินับพันเกี่ยวกับวิชาที่ไม่เกี่ยวข้อง สำหรับการศึกษาแต่ละครั้งคุณจะได้รับอนุญาตให้ดูที่ p-value ขนาดตัวอย่างและค่าเบี่ยงเบนมาตรฐานของตัวอย่าง สำหรับการศึกษาแต่ละครั้งเพื่อนของคุณเสนอโอกาสที่จะเดิมพันว่าสมมติฐานที่นำเสนอในการศึกษาเป็นจริง คุณสามารถเลือกที่จะเดิมพันหรือไม่ก็ได้ หลังจากที่คุณทำการเดิมพันสำหรับการศึกษาทั้งหมด 1,000 ครั้งแล้วออราเคิลก็ขึ้นไปหาคุณและบอกคุณว่าสมมติฐานใดถูกต้อง ข้อมูลนี้ช่วยให้คุณสามารถตัดสินการเดิมพัน …

3
การกำหนดนัยสำคัญทางสถิติของสัมประสิทธิ์การถดถอยเชิงเส้นในที่ที่มีความสัมพันธ์แบบหลายค่า
สมมติว่าฉันมีหลายเมืองที่มีขนาดประชากรแตกต่างกันและฉันต้องการที่จะดูว่ามีความสัมพันธ์เชิงบวกระหว่างจำนวนร้านขายเหล้าในเมืองและจำนวน DUIs หรือไม่ ที่ฉันกำหนดว่าความสัมพันธ์นี้มีความสำคัญหรือไม่ขึ้นอยู่กับ t-test ของสัมประสิทธิ์การถดถอยประมาณ ตอนนี้ชัดเจนป๊อป ขนาดของเมืองจะมีความสัมพันธ์เชิงบวกกับจำนวน DUIs และจำนวนร้านขายเหล้า ดังนั้นถ้าฉันเรียกใช้การถดถอยเชิงเส้นอย่างง่ายในร้านขายเหล้าและดูว่าค่าสัมประสิทธิ์การถดถอยนั้นมีนัยสำคัญทางสถิติหรือไม่ฉันอาจพบปัญหาหลายสายสัมพันธ์และประเมินผลกระทบของร้านขายสุราใน DUIs ฉันควรใช้วิธีใดในสองวิธีนี้เพื่อแก้ไขปัญหานี้ ฉันควรแบ่งจำนวนร้านขายเหล้าในเมืองด้วยจำนวนประชากรเพื่อที่จะได้รับร้านขายเหล้าต่อมูลค่าประชากรและจากนั้นถอยกลับไปที่ ฉันควรถอยกลับไปที่ร้านขายเหล้าและขนาดแล้วดูเพื่อดูว่าค่าสัมประสิทธิ์ร้านขายเหล้ามีความสำคัญเมื่อควบคุมขนาดหรือไม่ วิธีอื่นบ้าง ฉันไม่สามารถตัดสินใจได้ว่าอะไรจะสมเหตุสมผลกว่า ฉันโยกย้ายระหว่างพวกเขาขึ้นอยู่กับว่าฉันคิดว่าฉันสามารถโน้มน้าวตัวเองได้ว่าเป็นวิธีที่ถูกต้อง ในร้านขายสุรามือเดียวต่อหัวดูเหมือนว่าตัวแปรที่ถูกต้องที่จะใช้เนื่องจาก DUI มีความมุ่งมั่นของแต่ละบุคคล แต่นั่นไม่ได้ดูเข้มงวดมากนัก ในทางกลับกันการควบคุมขนาดดูเหมือนเข้มงวดทางสถิติ แต่ค่อนข้างทางอ้อม นอกจากนี้ถ้าฉันลดขนาดหลังจากคำนวณค่าเก็บเหล้าต่อหัวของประชากรฉันได้รับค่าสัมประสิทธิ์การถดถอยที่คล้ายกันมากระหว่างสองวิธี แต่วิธีที่ 1 ให้ค่า p น้อยลง

1
รูปแบบการเรียนรู้แบบลึกใดที่สามารถจำแนกหมวดหมู่ที่ไม่ได้เกิดร่วมกัน
ตัวอย่าง: ฉันมีประโยคในรายละเอียดงาน: "วิศวกรอาวุโสของ Java ในสหราชอาณาจักร" ฉันต้องการที่จะใช้รูปแบบการเรียนรู้ที่ลึกที่จะคาดการณ์ว่ามันเป็น 2 ประเภทและEnglish IT jobsถ้าฉันใช้รูปแบบการจำแนกแบบดั้งเดิมมันสามารถทำนายได้เพียง 1 ฉลากที่มีsoftmaxฟังก์ชั่นที่ชั้นสุดท้าย ดังนั้นฉันสามารถใช้โครงข่ายประสาทเทียม 2 แบบในการทำนาย "ใช่" / "ไม่" กับทั้งสองหมวดหมู่ แต่ถ้าเรามีหมวดหมู่มากขึ้นมันก็แพงเกินไป ดังนั้นเราจึงมีรูปแบบการเรียนรู้หรือการเรียนรู้ด้วยเครื่องเพื่อคาดการณ์ 2 หมวดหมู่ขึ้นไปพร้อมกันหรือไม่ "แก้ไข": ด้วย 3 ป้ายกำกับโดยวิธีดั้งเดิมมันจะถูกเข้ารหัสโดย [1,0,0] แต่ในกรณีของฉันมันจะถูกเข้ารหัสโดย [1,1,0] หรือ [1,1,1] ตัวอย่าง: หากเรามี 3 ป้ายกำกับและประโยคอาจเหมาะกับป้ายกำกับเหล่านี้ทั้งหมด ดังนั้นถ้าผลลัพธ์จากฟังก์ชัน softmax คือ [0.45, 0.35, 0.2] เราควรแบ่งมันออกเป็น 3 label หรือ 2 label หรืออาจเป็นหนึ่ง? ปัญหาหลักเมื่อเราทำคือ: …
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

1
Naive Bayes กำลังเป็นที่นิยมมากขึ้นหรือไม่? ทำไม?
นี่คือผลลัพธ์แนวโน้ม google ที่ได้รับสำหรับวลี "Naive Bayes" ตั้งแต่เดือนมกราคม 2004 ถึงเมษายน 2017 ( ลิงก์ ) จากตัวเลขนี้อัตราส่วนการค้นหาของ "Naive Bayes" ในเดือนเมษายน 2017 สูงกว่าค่าสูงสุดในช่วงเวลาทั้งหมดประมาณ 25% สิ่งนี้บอกเป็นนัยหรือไม่ว่าวิธีที่เรียบง่ายและเก่านี้ได้รับความสนใจมากขึ้น? ทำไม? คำอธิบายที่สมเหตุสมผล (ตามความเห็นของ Sycorax) คือความนิยมนี้เป็นผลทางอ้อมของการเพิ่มความสนใจในการเรียนรู้ของเครื่อง แต่ดูเหมือนว่าวิธีการบางอย่างเช่น Naive Bayes กำลังได้รับความสนใจมากกว่าวิธีอื่นเช่นต้นไม้ตัดสินใจและ SVM สามารถล้างได้จากตัวเลขต่อไปนี้:

2
การย่อยสลายความแปรปรวนแบบอคติ: คำที่คาดการณ์ข้อผิดพลาดกำลังสองน้อยกว่าข้อผิดพลาดลดลง
Hastie และคณะ "องค์ประกอบของการเรียนรู้ทางสถิติ" (2009) พิจารณากระบวนการสร้างข้อมูล กับและvarepsilon}Y= f( X) + εY=f(X)+ε Y = f(X) + \varepsilon E (ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0Var ( ε ) =σ2εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon} พวกเขานำเสนอการสลายตัวอคติ - แปรปรวนต่อไปนี้ของข้อผิดพลาดคาดการณ์กำลังสองที่จุด (หน้า 223 สูตร 7.9): ในของฉัน งานของตัวเองฉันไม่ได้ระบุแต่รับการคาดการณ์แบบสุ่มแทน (ถ้าเกี่ยวข้อง) คำถาม:ฉันกำลังมองหาคำว่า หรือแม่นยำยิ่งขึ้น x0x0x_0ข้อผิดพลาด(x0)= E ( [ y-ฉ^(x0)]2|X=x0)= ...=σ2ε+อคติ2(ฉ^(x0) ) + Var (ฉ^(x0) )= ข้อผิดพลาดลดลง +อคติ2+ แปรปรวนErr(x0)=E([y−f^(x0)]2|X=x0)=…=σε2+Bias2(f^(x0))+Var(f^(x0))=Irreducible error+Bias2+Variance.\begin{aligned} \text{Err}(x_0) &= …

1
ร้อยละไม่สามารถเพิ่มเป็นร้อยเป็นไปได้อย่างไร
ฉันกำลังอ่านบทความนี้เกี่ยวกับ aquaponics และสถิติบางอย่างไม่ได้มีเหตุผลใด ๆ เกี่ยวกับเปอร์เซ็นต์ที่ระบุไว้ วิธีการใดที่จะทำให้เปอร์เซ็นเหล่านี้มีอยู่ สัตว์น้ำที่เลี้ยงมากที่สุดโดยร้อยละคือปลานิล (69%) ปลาสวยงาม (43%) ปลาดุก (25%) สัตว์น้ำอื่น ๆ (18%) คอน (16%) บลูกิลล์ (15%) ปลาเทราท์ ( 10%) และเบส (7%) ~ http://www.sciencedirect.com/science/article/pii/S0044848614004724

4
ฉันจะตีความกราฟความอยู่รอดของโมเดลอันตราย Cox ได้อย่างไร
คุณจะตีความเส้นโค้งการอยู่รอดจากโมเดลอันตรายตามสัดส่วนของค็อกซ์ได้อย่างไร ในตัวอย่างของเล่นนี้สมมติว่าเรามีโมเดลอันตรายตามสัดส่วนในageตัวแปรในkidneyข้อมูลและสร้างเส้นโค้งการอยู่รอด library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() ตัวอย่างเช่น ณ เวลาคำสั่งใดเป็นจริง หรือทั้งสองอย่างผิดปกติ?200200200 คำแถลงที่ 1: เราจะเหลือวิชา 20% (เช่นถ้าเรามีคนโดยวันที่เราควรเหลืออีกประมาณ ) 100010001000200200200200200200 งบ 2: สำหรับคนที่ได้รับหนึ่งเขา / เธอมีมีโอกาสที่จะอยู่รอดได้ในวันที่20020%20%20\%200200200 ความพยายามของฉัน: ฉันไม่คิดว่าทั้งสองงบจะเหมือนกัน (แก้ไขฉันถ้าฉันผิด) เนื่องจากเราไม่ได้มีการสันนิษฐาน iid (เวลารอดสำหรับทุกคนไม่ได้มาจากการกระจายอย่างอิสระ) มันคล้ายกับการถดถอยโลจิสติกในคำถามของฉันที่นี่อัตราความเป็นอันตรายของแต่ละคนขึ้นอยู่กับสำหรับบุคคลนั้นβTxβTx\beta^Tx

3
PCA ช้าเกินไปเมื่อทั้ง n, p มีขนาดใหญ่: ทางเลือก?
การตั้งค่าปัญหา ฉันมีจุดข้อมูล (ภาพ) ที่มีมิติสูง (4096) ซึ่งฉันกำลังพยายามมองเห็นเป็น 2D ด้วยเหตุนี้ผมใช้เสื้อ sne ในลักษณะที่คล้ายกับต่อไปนี้โค้ดตัวอย่างโดย Karpathy เอกสาร scikit เรียนรู้แนะนำให้ใช้ PCA แรกลดขนาดของข้อมูล: ขอแนะนำให้ใช้วิธีการลดขนาดแบบอื่น (เช่น PCA สำหรับข้อมูลหนาแน่นหรือ TruncatedSVD สำหรับข้อมูลแบบเบาบาง) เพื่อลดจำนวนมิติเป็นจำนวนที่เหมาะสม (เช่น 50) หากจำนวนคุณลักษณะสูงมาก ฉันใช้รหัสนี้โดย Darks.Liu เพื่อดำเนินการ PCA ใน Java: //C=X*X^t / m DoubleMatrix covMatrix = source.mmul(source.transpose()).div(source.columns); ComplexDoubleMatrix eigVal = Eigen.eigenvalues(covMatrix); ComplexDoubleMatrix[] eigVectorsVal = Eigen.eigenvectors(covMatrix); ComplexDoubleMatrix eigVectors = …

1
ความหมายที่แท้จริงของ alpha ใน GLM กับครอบครัวแกมม่าคืออะไร?
ฉันเหมาะสมกับแบบจำลองหลายแบบ .. glm(DV ~ I(1/IV), family = Gamma(link = "log") .. และฉันกำลังมองหาวิธีการเปรียบเทียบแบบจำลองที่ได้รับสำหรับตัวแปรที่แตกต่างกัน ฉันสงสัยว่าค่าอัลฟานั้นมีประโยชน์หรือไม่? สำหรับสามแปลงต่ำกว่าค่าอัลฟาคือ 17.85, 9.03 และ 6.27 ค่าเหล่านี้มีข้อมูลใด ๆ ที่ช่วยให้ฉันตีความข้อมูลของฉันหรือเพื่อเปรียบเทียบตัวแปรต่าง ๆ ได้หรือไม่?

1
ข้อผิดพลาดที่กระจายตามปกติและทฤษฎีขีด จำกัด กลาง
ในเศรษฐศาสตรเบื้องต้นของ Wooldridge มีข้อความอ้างอิง: ข้อโต้แย้งที่แสดงให้เห็นถึงการแจกแจงปกติสำหรับข้อผิดพลาดมักจะทำสิ่งนี้: เพราะเป็นผลรวมของปัจจัยที่ไม่ได้สังเกตเห็นหลายอย่างที่มีผลต่อเราจึงสามารถเรียกทฤษฎีบทขีด จำกัด กลางเพื่อสรุปว่ามีการแจกแจงแบบปกติโดยประมาณuuuyyyuuu คำพูดนี้เกี่ยวข้องกับหนึ่งในสมมติฐานโมเดลเชิงเส้นคือ: u∼N(μ,σ2)u∼N(μ,σ2)u \sim N(μ, σ^2) โดยที่uuuคือคำผิดพลาดในตัวแบบประชากร ทีนี้เท่าที่ฉันรู้ทฤษฎีขีด จำกัด กลางระบุว่าการกระจายตัวของ Zi=(Yi¯¯¯¯¯−μ)/(σ/√n)Zi=(Yi¯−μ)/(σ/√n)Z_i=(\overline{Y_i}-μ)/(σ/√n) (โดยที่Yi¯¯¯¯¯Yi¯\overline{Y_i} เป็นค่าเฉลี่ยของกลุ่มตัวอย่างสุ่มจากประชากรใด ๆ ที่มีค่าเฉลี่ยμμμและความแปรปรวนσ2σ2σ^2 ) วิธีการที่ของตัวแปรปกติมาตรฐานn→∞n→∞n \rightarrow \infty\ คำถาม: ช่วยฉันเข้าใจว่ามาตรฐานความเป็นซีมโทติคของZiZiZ_iหมายถึงu∼N(μ,σ2)u∼N(μ,σ2)u \sim N(μ, σ^2)

1
สูตรการแจกแจงแบบปกติของ CDF ผกผันคืออะไร
ไม่มีใครรู้ว่าฟังก์ชันการกระจายแบบผกผันของการแจกแจงแบบปกติคืออะไร? มันมีการแสดงออกในรูปแบบปิดหรือไม่? ฉันไม่พบคำตอบที่ดีเมื่อใช้ Google

2
การอนุมานเชิงสถิติภายใต้การสะกดผิดโมเดล
ฉันมีคำถามเกี่ยวกับระเบียบวิธีทั่วไป อาจได้รับคำตอบก่อนหน้านี้ แต่ฉันไม่สามารถค้นหาเธรดที่เกี่ยวข้องได้ ฉันจะขอบคุณพอยน์เตอร์ถึงความซ้ำซ้อนที่เป็นไปได้ ( นี่คืออันที่ยอดเยี่ยม แต่ไม่มีคำตอบนี่ก็คล้าย ๆ กับวิญญาณแม้จะมีคำตอบ แต่อันหลังนั้นเฉพาะเจาะจงมากเกินไปจากมุมมองของฉันนี่ยังปิดอยู่ค้นพบหลังจากโพสต์คำถาม) รูปแบบที่มีวิธีการทำที่ถูกต้องอนุมานทางสถิติเมื่อรูปแบบสูตรก่อนที่จะเห็นข้อมูลไม่เพียงพอที่จะอธิบายขั้นตอนการสร้างข้อมูล คำถามทั่วไปมาก แต่ฉันจะเสนอตัวอย่างโดยเฉพาะเพื่ออธิบายประเด็น อย่างไรก็ตามฉันคาดหวังคำตอบที่จะมุ่งเน้นไปที่คำถามที่เกี่ยวกับระเบียบวิธีโดยทั่วไปมากกว่าที่จะพูดถึงเรื่องรายละเอียดของตัวอย่าง ลองพิจารณาตัวอย่างคอนกรีต: ในการตั้งค่าอนุกรมเวลาผมถือว่ากระบวนการผลิตข้อมูลที่จะ กับ2) ผมมุ่งมั่นที่จะทดสอบสมมติฐานเรื่องเรื่องที่ 1 ฉันใช้สิ่งนี้ในแง่ของแบบจำลองเพื่อให้ได้สถิติเชิงสถิติที่เป็นไปได้ของสมมติฐานในเรื่องของฉันและนี่คือ จนถึงตอนนี้ดีมาก แต่เมื่อฉันสังเกตข้อมูลฉันค้นพบว่าตัวแบบไม่ได้อธิบายข้อมูลอย่างเพียงพอ ให้เราบอกว่ามีแนวโน้มเชิงเส้นดังนั้นกระบวนการสร้างข้อมูลจริงคือ ด้วยyt=β0+β1xt+ut(1)(1)yt=β0+β1xt+ut y_t=\beta_0 + \beta_1 x_t+u_t \tag{1} ut∼i.i.N(0,σ2u)ut∼i.i.N(0,σu2)u_t \sim i.i.N(0,\sigma_u^2)dYdx= 1dydx=1\frac{dy}{dx}=1( 1 )(1)(1)H0: β1= 1H0: β1=1. H_0\colon \ \beta_1=1. Yเสื้อ=γ0+γ1xเสื้อ+γ2t +โวลต์เสื้อ(2)(2)yt=γ0+γ1xt+γ2t+vt y_t=\gamma_0 + \gamma_1 x_t+\gamma_2 t + v_t …

1
ความน่าจะเป็นของกระบวนการปัวซองอิสระขบวนอื่น
ฉันเคยถามคำถามนี้มาก่อนในรูปแบบอื่นบนสแต็คแลกเปลี่ยนอื่น ๆ ดังนั้นขออภัยสำหรับ repost ที่ค่อนข้าง ฉันถามอาจารย์และนักศึกษาปริญญาเอกสองคนถึงเรื่องนี้โดยไม่มีคำตอบที่ชัดเจน ฉันจะระบุปัญหาก่อนจากนั้นวิธีแก้ปัญหาที่เป็นไปได้ของฉันและปัญหาเกี่ยวกับวิธีแก้ปัญหาของฉันดังนั้นขอโทษสำหรับกำแพงข้อความ ปัญหา: สมมติสองอิสระ Poisson กระบวนการและกับและสำหรับช่วงเวลาเดียวกันอาจมีการ\ความน่าจะเป็นว่าที่จุดใด ๆ ในเวลาเป็นเวลาที่มีแนวโน้มที่จะอินฟินิตี้ที่การส่งออกรวมของกระบวนการคืออะไรมีขนาดใหญ่กว่าการส่งออกรวมของกระบวนการบวกคือD) หากต้องการแสดงตัวอย่างให้สมมติว่ามีสองสะพานและโดยเฉลี่ยแล้วรถและขับผ่านสะพานและMMMRRRλRλR\lambda_RλMλM \lambda_MλR>λMλR>λM\lambda_R>\lambda_MMMMRRRDDDP(M>R+D)P(M>R+D)P(M>R+D)RRRMMMλRλR\lambda_RλMλM\lambda_MRRRMMMตามลำดับต่อช่วงเวลาและ\รถยนต์ได้ขับแล้วข้ามสะพานเป็นสิ่งที่น่าจะเป็นที่ที่จุดใด ๆ ในเวลารถยนต์เพิ่มเติมทั้งหมดได้ขับข้ามสะพานกว่าRλR>λMλR>λM\lambda_R>\lambda_MDDDRRRMMMRRR วิธีแก้ไขปัญหานี้ของฉัน: ครั้งแรกที่เรากำหนดกระบวนการปัวซงสองกระบวนการ: M(I)∼Poisson(μM⋅I)R(I)∼Poisson(μR⋅I)M(I)∼Poisson⁡(μM⋅I)R(I)∼Poisson⁡(μR⋅I)M(I) \sim \operatorname{Poisson}(\mu_M\cdot I ) \\ R(I) \sim \operatorname{Poisson}(\mu_R\cdot I ) \\ ขั้นตอนต่อไปคือการค้นหาฟังก์ชั่นที่อธิบายหลังจากช่วงเวลากำหนด นี้จะเกิดขึ้นในกรณีเงื่อนไขในการส่งออกของสำหรับทุกค่าที่ไม่ใช่เชิงลบของkเพื่อแสดงให้เห็นว่าการส่งออกรวมของคือแล้วการส่งออกรวมของจะต้องมีขนาดใหญ่กว่า D ดังแสดงด้านล่างP(M>R+D)P(M>R+D)P(M>R+D)IIIM(I)>k+DM(I)>k+DM(I)>k+DR(I)=kR(I)=kR(I)=kkkkRRRXXXMMMX+DX+DX+D P(M(I))>R(I)+D)=∑k=0n[P(M(I)>k+D∪R(I)=k)]P(M(I))>R(I)+D)=∑k=0n[P(M(I)>k+D∪R(I)=k)]P(M(I))>R(I)+D)=\sum_{k=0}^n \bigg [P(M(I) >k+D\cup R(I)=k) \bigg] n→∞n→∞n\rightarrow \infty เนื่องจากความเป็นอิสระนี้สามารถเขียนใหม่เป็นผลิตภัณฑ์ของสององค์ประกอบที่องค์ประกอบแรกคือ 1-CDF ของการกระจาย Poisson และองค์ประกอบที่สองคือ Poisson PMF: …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.