สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
กระบวนการ Stochastic เช่นกระบวนการ Gaussian / กระบวนการ Dirichlet มีความหนาแน่นหรือไม่ หากไม่สามารถใช้กฎของเบย์กับพวกเขาได้อย่างไร
กระบวนการ Dirichlet Pocess และ Gaussian นั้นมักเรียกกันว่า ในกรณีนั้นฉันสามารถพูดถึงความหนาแน่นของฟังก์ชั่นภายใต้ GP ได้หรือไม่? นั่นคือกระบวนการ Gaussian หรือกระบวนการ Dirichlet มีแนวคิดเกี่ยวกับความหนาแน่นของความน่าจะเป็นหรือไม่? หากไม่เป็นเช่นนั้นเราจะใช้กฎของเบย์ในการเปลี่ยนจากก่อนหน้าไปยังด้านหลังได้อย่างไรหากความคิดของความน่าจะเป็นก่อนหน้านี้ของฟังก์ชั่นยังไม่ชัดเจน มีสิ่งต่าง ๆ เช่นการประมาณค่า MAP หรือ EAP ในโลกที่ไม่ใช่แบบเบย์ของ Bayesian หรือไม่? ขอบคุณมาก.

2
ขนาดตัวอย่างขั้นต่ำต่อคลัสเตอร์ในโมเดลเอฟเฟกต์แบบสุ่ม
มีเหตุผลสำหรับจำนวนของการสังเกตต่อกลุ่มในรูปแบบผลกระทบแบบสุ่ม? ฉันมีขนาดตัวอย่าง 1,500 กับ 700 คลัสเตอร์จำลองเป็นเอฟเฟกต์สุ่มที่แลกเปลี่ยนได้ ฉันมีตัวเลือกในการรวมกลุ่มเพื่อสร้างกลุ่มน้อยลง แต่มีขนาดใหญ่ขึ้น ฉันสงสัยว่าฉันจะเลือกขนาดตัวอย่างขั้นต่ำต่อคลัสเตอร์ได้อย่างไรเพื่อให้ได้ผลลัพธ์ที่มีความหมายในการทำนายเอฟเฟกต์แบบสุ่มสำหรับแต่ละคลัสเตอร์ มีกระดาษที่ดีที่อธิบายสิ่งนี้หรือไม่

2
ในการถดถอยเชิงเส้นเหตุใดเราจึงควรรวมเทอมกำลังสองเมื่อเราสนใจเฉพาะเงื่อนไขการโต้ตอบ
สมมติว่าฉันสนใจโมเดลการถดถอยเชิงเส้นสำหรับ Yผม=β0+β1x1+β2x2+β3x1x2Yi=β0+β1x1+β2x2+β3x1x2Y_i = \beta_0 + \beta_1x_1 + \beta_2x_2 + \beta_3x_1x_2เพราะฉันต้องการดูว่าปฏิสัมพันธ์ระหว่าง covariates ทั้งสองมีผลต่อ Y หรือไม่ ในบันทึกรายวิชาของอาจารย์ (ซึ่งฉันไม่ได้ติดต่อด้วย) จะกล่าวถึง: เมื่อรวมถึงคำศัพท์เชิงโต้ตอบคุณควรรวมคำศัพท์ระดับปริญญาที่สองของพวกเขาไว้ด้วย กล่าวคือYผม=β0+β1x1+β2x2+β3x1x2+β4x21+β5x22Yi=β0+β1x1+β2x2+β3x1x2+β4x12+β5x22Y_i = \beta_0 + \beta_1x_1 + \beta_2x_2 + \beta_3x_1x_2 +\beta_4x_1^2 + \beta_5x_2^2 ควรรวมอยู่ในการถดถอย ทำไมหนึ่งควรรวมถึงข้อกำหนดระดับที่สองเมื่อเราสนใจเฉพาะการโต้ตอบ?

1
ค้นหา UMVUE จาก
ให้เป็นตัวแปรสุ่มที่มี pdfX1,X2,...,XnX1,X2,...,XnX_1, X_2, . . . , X_n fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)f_X(x\mid\theta) =\theta(1 +x)^{−(1+\theta)}I_{(0,\infty)}(x) ที่ไหน θ>0θ>0\theta >0. ให้ UMVUE จาก1θ1θ\frac{1}{\theta} และคำนวณความแปรปรวน ฉันได้เรียนรู้เกี่ยวกับสองวิธีดังกล่าวเพื่อรับ UMVUE ของ: แครมเมอร์ - ราวล่าง (CRLB) Lehmann-Scheffe Thereom ฉันจะลองทำสิ่งนี้โดยใช้สองตัวแรก ฉันต้องยอมรับว่าฉันไม่เข้าใจสิ่งที่เกิดขึ้นที่นี่อย่างสมบูรณ์และฉันกำลังพยายามแก้ไขปัญหาตัวอย่าง ฉันมีสิ่งนั้นfX(x∣θ)fX(x∣θ)f_X(x\mid\theta) เป็นตระกูลเอ็กซ์โปเนนเชียลแบบพารามิเตอร์เดียวที่มี h(x)=I(0,∞)h(x)=I(0,∞)h(x)=I_{(0,\infty)}, c(θ)=θc(θ)=θc(\theta)=\theta, w(θ)=−(1+θ)w(θ)=−(1+θ)w(\theta)=-(1+\theta), t(x)=log(1+x)t(x)=log(1+x)t(x)=\text{log}(1+x) เนื่องจากไม่ใช่ศูนย์บนผล CRLB จึงถูกนำมาใช้ เรามีw′(θ)=1w′(θ)=1w'(\theta)=1ΘΘ\Theta log fX(x∣θ)=log(θ)−(1+θ)⋅log(1+x)log fX(x∣θ)=log(θ)−(1+θ)⋅log(1+x)\text{log }f_X(x\mid\theta)=\text{log}(\theta)-(1+\theta)\cdot\text{log}(1+x) ∂∂θlog fX(x∣θ)=1θ−log(1+x)∂∂θlog fX(x∣θ)=1θ−log(1+x)\frac{\partial}{\partial \theta}\text{log }f_X(x\mid\theta)=\frac{1}{\theta}-\text{log}(1+x) ∂2∂θ2เข้าสู่ระบบ ฉX( …

1
การตีความผลกระทบคงที่จากการถดถอยโลจิสติกส์ผลผสม
ฉันสับสนกับข้อความที่หน้าเว็บของ UCLAเกี่ยวกับการถดถอยโลจิสติกเอฟเฟกต์ พวกเขาแสดงตารางของสัมประสิทธิ์ผลกระทบคงที่จากการปรับแบบจำลองดังกล่าวและย่อหน้าแรกข้างล่างดูเหมือนจะตีความค่าสัมประสิทธิ์เหมือนการถดถอยโลจิสติกปกติ แต่เมื่อพวกเขาพูดถึงอัตราต่อรองพวกเขาบอกว่าคุณต้องตีความเงื่อนไขแบบสุ่มตามเงื่อนไข อะไรจะทำให้การตีความของอัตราต่อรองที่แตกต่างจากค่า exponentiated ของพวกเขา? จะไม่ต้อง "ถือทุกอย่างอื่นคงที่"? วิธีที่เหมาะสมในการตีความสัมประสิทธิ์ผลคงที่จากรุ่นนี้คืออะไร? ฉันอยู่ภายใต้ความประทับใจเสมอไม่มีอะไรเปลี่ยนแปลงจากการถดถอยโลจิสติก "ปกติ" เพราะเอฟเฟกต์แบบสุ่มมีความคาดหวังเป็นศูนย์ ดังนั้นคุณจึงตีความอัตราต่อรองของอัตราต่อรองและอัตราต่อรองเหมือนกันโดยมีหรือไม่มีเอฟเฟกต์แบบสุ่ม - เปลี่ยนเฉพาะ SE เท่านั้น การประมาณการสามารถตีความได้อย่างเป็นหลักเช่นเคย ตัวอย่างเช่นสำหรับ IL6 การเพิ่มขึ้นหนึ่งหน่วยใน IL6 จะสัมพันธ์กับการลดลงของ. 053 หน่วยในอัตราต่อรองที่คาดหวังของการให้อภัย ในทำนองเดียวกันคนที่แต่งงานแล้วหรืออาศัยอยู่ในฐานะแต่งงานได้รับการคาดหวังว่าจะมีอัตราการอยู่รอดสูงถึง. 26 มากกว่าคนที่โสด หลายคนชอบตีความอัตราต่อรอง อย่างไรก็ตามสิ่งเหล่านี้มีความหมายที่เหมาะสมยิ่งขึ้นเมื่อมีเอฟเฟกต์แบบผสม ในการถดถอยโลจิสติกปกติอัตราเดิมพันอัตราส่วนอัตราต่อรองที่คาดว่าจะถือทำนายอื่น ๆ ทั้งหมดได้รับการแก้ไข สิ่งนี้สมเหตุสมผลเมื่อเรามักจะสนใจในการปรับทางสถิติสำหรับเอฟเฟกต์อื่น ๆ เช่นอายุเพื่อให้ได้ผลที่ "บริสุทธิ์" ของการแต่งงานหรืออะไรก็ตามที่ผู้ทำนายหลักสนใจ เช่นเดียวกันกับโมเดลเอฟเฟ็กต์โลจิสติกส์เอฟเฟกต์ผสมที่มีการเพิ่มทุกอย่างที่คงที่ไว้ นั่นคืออัตราส่วนอัตราต่อรองที่นี่คืออัตราต่อรองแบบมีเงื่อนไขสำหรับคนที่อายุและค่าคงที่ IL6 เช่นเดียวกับคนที่มีแพทย์เดียวกันหรือแพทย์ที่มีเอฟเฟกต์แบบสุ่มเหมือนกัน

2
'' ตัวแปรที่สำคัญ '' ที่ไม่ได้ปรับปรุงการพยากรณ์นอกตัวอย่าง - จะตีความได้อย่างไร
ฉันมีคำถามที่ฉันคิดว่าจะค่อนข้างพื้นฐานสำหรับผู้ใช้จำนวนมาก ฉันใช้ตัวแบบการถดถอยเชิงเส้นเพื่อ (i) ตรวจสอบความสัมพันธ์ของตัวแปรอธิบายหลายตัวและตัวแปรตอบสนองของฉันและ (ii) ทำนายตัวแปรตอบสนองของฉันโดยใช้ตัวแปรอธิบาย ตัวแปรอธิบายอย่างใดอย่างหนึ่ง X ดูเหมือนจะส่งผลกระทบต่อตัวแปรตอบกลับของฉันอย่างมาก เพื่อทดสอบมูลค่าเพิ่มของตัวแปรอธิบายนี้เพื่อวัตถุประสงค์ในการคาดการณ์นอกตัวอย่างของตัวแปรตอบสนองของฉันฉันใช้สองแบบจำลอง: model (a) ซึ่งใช้ตัวแปรอธิบายและแบบจำลองทั้งหมด (b) ซึ่งใช้ตัวแปรทั้งหมด ยกเว้นตัวแปร X สำหรับทั้งสองรุ่นฉันรายงานประสิทธิภาพนอกตัวอย่างเท่านั้น ปรากฏว่าทั้งสองรุ่นมีประสิทธิภาพเกือบเหมือนกัน กล่าวอีกนัยหนึ่งการเพิ่มตัวแปรอธิบาย X ไม่ได้ปรับปรุงการพยากรณ์นอกตัวอย่าง โปรดทราบว่าฉันยังใช้ model (a) เช่นโมเดลที่มีตัวแปรอธิบายทั้งหมดเพื่อค้นหาว่าตัวแปรอธิบาย X ส่งผลกระทบอย่างมากต่อตัวแปรตอบกลับของฉัน คำถามของฉันคือ: จะตีความการค้นพบนี้ได้อย่างไร? ข้อสรุปที่ตรงไปตรงมาคือแม้ว่าตัวแปร X ดูเหมือนจะมีอิทธิพลต่อตัวแปรตอบสนองของฉันอย่างมีนัยสำคัญโดยใช้แบบจำลองที่อนุมานได้ แต่ก็ไม่ได้ปรับปรุงการทำนายนอกตัวอย่าง อย่างไรก็ตามฉันมีปัญหาในการอธิบายการค้นพบนี้เพิ่มเติม สิ่งนี้จะเป็นไปได้อย่างไรและอะไรคือคำอธิบายสำหรับการค้นพบนี้ ขอบคุณล่วงหน้า! ข้อมูลเพิ่มเติม: ด้วย 'อิทธิพลอย่างมีนัยสำคัญ' ฉันหมายความว่า 0 ไม่รวมอยู่ในช่วงความหนาแน่นหลังสูงสุด 95% ของการประมาณพารามิเตอร์ (ฉันใช้วิธีเบส์) ในแง่บ่อยๆสิ่งนี้มีความสัมพันธ์กับการมีค่า p ต่ำกว่า 0.05 …

2
ตัวประมาณค่าบวกที่ไม่เอนเอียงสำหรับกำลังสองของค่าเฉลี่ย
สมมติว่าเราสามารถเข้าถึงตัวอย่าง iid จากการแจกแจงด้วยค่าเฉลี่ยและความแปรปรวนจริง (ไม่ทราบ) μ ,σ2μ,σ2\mu, \sigma^2และเราต้องการประมาณ μ2μ2\mu^2. เราจะสร้างตัวประมาณค่าที่เป็นกลางและเป็นบวกของปริมาณนี้ได้อย่างไร? การยกกำลังสองของค่าเฉลี่ยตัวอย่าง μ~2μ~2\tilde{\mu}^2มีอคติและจะประเมินค่าสูงไปตามปริมาณ ถ้าμμ\mu ใกล้กับ 0 และ σ2σ2\sigma^2 มีขนาดใหญ่ นี่อาจเป็นคำถามที่ไม่สำคัญ แต่ความสามารถของ Google ทำให้ฉันผิดหวังเมื่อestimator of mean-squaredกลับมาเท่านั้นmean-squarred-error estimators ถ้ามันทำให้เรื่องง่ายขึ้นการแจกแจงแบบพื้นฐานนั้นสามารถสันนิษฐานว่าเป็นแบบเกาส์เซียน สารละลาย: มันเป็นไปได้ที่จะสร้างการประมาณที่เป็นกลาง μ2μ2\mu^2; ดูคำตอบของ knrumsey ไม่สามารถสร้างการประมาณที่เป็นกลางและเป็นบวกได้เสมอ μ2μ2\mu^2เนื่องจากข้อกำหนดเหล่านี้ขัดแย้งกันเมื่อค่าเฉลี่ยที่แท้จริงคือ 0; เห็นคำตอบของวิงก์

2
เหตุใดเราใช้เหลือเพื่อทดสอบสมมติฐานเกี่ยวกับข้อผิดพลาดในการถดถอย
สมมติว่าเรามีรูปแบบ Yi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiYi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiY_i = \beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + \dots + \beta_kX_{ik} + \epsilon_i. การถดถอยมีข้อสมมติฐานหลายประการเช่นข้อผิดพลาด ϵiϵi\epsilon_iควรกระจายตามปกติด้วยค่าเฉลี่ยศูนย์และความแปรปรวนคงที่ ฉันได้รับการสอนให้ตรวจสอบสมมติฐานเหล่านี้โดยใช้พล็อต QQ ปกติเพื่อทดสอบความเป็นไปได้ของส่วนที่เหลือei=Yi−Y^iei=Yi−Y^ie_i = Y_i - \hat{Y}_i และส่วนที่เหลือเทียบกับพล็อตที่ติดตั้งเพื่อตรวจสอบว่าส่วนที่เหลือแตกต่างกันไปรอบ ๆ ศูนย์ด้วยความแปรปรวนคงที่ อย่างไรก็ตามการทดสอบเหล่านี้ทั้งหมดเกี่ยวกับส่วนที่เหลือไม่ใช่ข้อผิดพลาด จากสิ่งที่ฉันเข้าใจข้อผิดพลาดหมายถึงการเบี่ยงเบนของการสังเกตแต่ละครั้งจากค่าเฉลี่ยที่แท้จริงของพวกเขา ดังนั้นเราสามารถเขียนϵi=Yi−E[Yi]ϵi=Yi−E[Yi]\epsilon_i = Y_i - \mathbb{E}[Y_i]. เราไม่สามารถสังเกตเห็นข้อผิดพลาดเหล่านี้ได้ * * * * คำถามของฉันคือสิ่งนี้: สิ่งที่เหลืออยู่ของงานทำอย่างไรในการเลียนแบบข้อผิดพลาด? หากสมมติฐานปรากฏว่าพอใจในส่วนที่เหลือหมายความว่าพวกเขามีความพึงพอใจต่อข้อผิดพลาดด้วยหรือไม่? มีวิธีอื่น ๆ (ดีกว่า) ในการทดสอบสมมติฐานเช่นการปรับโมเดลให้เหมาะกับชุดข้อมูลการทดสอบและรับส่วนที่เหลือจากที่นั่นหรือไม่? * นอกจากนี้สิ่งนี้ไม่ต้องการให้มีการระบุรุ่นอย่างถูกต้องหรือไม่? นั่นคือการตอบสนองจะมีความสัมพันธ์กับผู้ทำนายX1,X2,X1,X2,X_1, X_2, ฯลฯ …

4
วิธีการพิสูจน์ทางสถิติว่าคอลัมน์มีข้อมูลหมวดหมู่หรือไม่ใช้ Python
ฉันมี data frame ใน python ที่ฉันต้องการค้นหาตัวแปรเด็ดขาดทั้งหมด การตรวจสอบประเภทของคอลัมน์นั้นไม่ได้ผลเสมอไปเพราะintประเภทยังสามารถจัดหมวดหมู่ได้ ดังนั้นฉันจึงขอความช่วยเหลือในการค้นหาวิธีทดสอบสมมติฐานที่ถูกต้องเพื่อระบุว่าคอลัมน์นั้นเป็นหมวดหมู่หรือไม่ ฉันพยายามทดสอบไคสแควร์ด้านล่าง แต่ไม่แน่ใจว่าดีพอหรือไม่ import numpy as np data = np.random.randint(0,5,100) import scipy.stats as ss ss.chisquare(data) กรุณาแนะนำ

1
decision_function, predict_proba, และฟังก์ชันทำนายความแตกต่างของปัญหาการถดถอยโลจิสติกคืออะไร
ฉันได้อ่านเอกสารเกี่ยวกับ sklearn แล้ว แต่ฉันไม่สามารถเข้าใจวัตถุประสงค์ของฟังก์ชันเหล่านี้ในบริบทของการถดถอยโลจิสติกส์ เพราะdecision_functionมันบอกว่าระยะห่างระหว่างไฮเปอร์เพลนกับอินสแตนซ์การทดสอบ ข้อมูลเฉพาะนี้มีประโยชน์อย่างไร? และสิ่งนี้เกี่ยวข้องกับpredictและpredict-probaวิธีการอย่างไร

3
การถดถอยของกระบวนการแบบเกาส์สำหรับชุดข้อมูลขนาดใหญ่
ฉันได้รับการเรียนรู้เกี่ยวกับกระบวนการ Gaussian ถดถอยจากวิดีโอออนไลน์และเอกสารประกอบการบรรยายความเข้าใจของฉันก็คือว่าถ้าเรามีชุดข้อมูลที่มีจุดแล้วเราถือว่าข้อมูลที่มีการเก็บตัวอย่างจากมิติหลายตัวแปรแบบเกาส์ ดังนั้นคำถามของฉันคือในกรณีที่คือ 10 ในล้านคนการถดถอยของกระบวนการแบบเกาส์ยังคงใช้ได้ เคอร์เนลเมทริกซ์จะไม่แสดงผลขนาดใหญ่กระบวนการอย่างสมบูรณ์หรือไม่ ถ้าเป็นเช่นนั้นมีเทคนิคในการจัดการกับสิ่งนี้เช่นการสุ่มตัวอย่างจากชุดข้อมูลซ้ำ ๆ หลาย ๆ ครั้งหรือไม่ วิธีการที่ดีในการจัดการกับกรณีดังกล่าวมีอะไรบ้าง nnnnnnnnn

2
จุดประสงค์ของสัญญาณรบกวนดีริชเลต์ในกระดาษ AlphaZero
ในเอกสาร AlphaGo ZeroและAlphaZeroของ DeepMind พวกเขาอธิบายการเพิ่มสัญญาณรบกวนDirichletให้กับความน่าจะเป็นก่อนหน้าของการกระทำจากโหนดรูท (สถานะกระดาน) ใน Monte Carlo Tree Search: การสำรวจเพิ่มเติมทำได้โดยการเพิ่มเสียง Dirichlet ให้กับความน่าจะเป็นก่อนหน้านี้ในรูทโหนดโดยเฉพาะโดยที่และ ; เสียงรบกวนนี้ทำให้มั่นใจได้ว่าการเคลื่อนไหวทั้งหมดอาจถูกลองใช้ แต่การค้นหาอาจยังคงเป็นการลบล้างการเคลื่อนไหวที่ไม่ดีs0s0s_0P( s , a ) = ( 1 - ε )พีa+ εηaP(s,a)=(1−ε)pa+εηaP(s, a) = (1−\varepsilon)p_a+ \varepsilon \eta_aη~ Dir ( 0.03 )η∼Dir(0.03)\eta \sim \text{Dir}(0.03)ε = 0.25ε=0.25\varepsilon = 0.25 (AlphaGo Zero) และ: เพิ่ม Dirichlet noiseในความน่าจะเป็นก่อนหน้านี้ในโหนดรูท นี่เป็นสัดส่วนในสัดส่วนผกผันกับจำนวนการเคลื่อนไหวทางกฎหมายโดยประมาณในตำแหน่งทั่วไปค่าของสำหรับหมากรุกโชกิและโกตามลำดับDir …

5
ความน่าจะเป็นที่มีเงื่อนไข - พวกมันมีลักษณะเฉพาะกับ Bayesianism หรือไม่?
ฉันสงสัยว่าความน่าจะเป็นตามเงื่อนไขนั้นมีลักษณะเฉพาะกับ Bayesianism หรือไม่หรือเป็นแนวคิดทั่วไปที่ใช้ร่วมกันระหว่างโรงเรียนแห่งความคิดหลายแห่งในหมู่ผู้มีสถิติ / ผู้น่าจะเป็น ฉันคิดว่ามันเป็นเพราะฉันคิดว่าไม่มีใครสามารถเป็นตรรกะได้ดังนั้นฉันคิดว่าอย่างน้อยผู้เห็นบ่อย ๆ จะเห็นด้วยในทางทฤษฎีในขณะที่เตือนกับ Bayesian การอนุมานจากเหตุผลเชิงปฏิบัติไม่ใช่เพราะความน่าจะเป็นตามเงื่อนไขp(A,B)=p(A|B)p(B)p(A,B)=p(A|B)p(B)p(A,B) = p(A|B)p(B)

3
การแพร่กระจายของ
ในการออกกำลังกายเป็นประจำฉันพยายามค้นหาการกระจายของโดยที่ และเป็นอิสระจากตัวแปรสุ่มX2+Y2−−−−−−−√X2+Y2\sqrt{X^2+Y^2}XXXYYYU(0,1)U(0,1) U(0,1) ความหนาแน่นรอยต่อของคือ (X,Y)(X,Y)(X,Y)fX,Y(x,y)=10&lt;x,y&lt;1fX,Y(x,y)=10&lt;x,y&lt;1f_{X,Y}(x,y)=\mathbf 1_{0\cos^{-1}\left(\frac{1}{z}\right)cosθcos⁡θ\cos\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]zsinθ&lt;1⟹θ&lt;sin−1(1z)zsin⁡θ&lt;1⟹θ&lt;sin−1⁡(1z)z\sin\theta<1\implies\theta<\sin^{-1}\left(\frac{1}{z}\right)sinθsin⁡θ\sin\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right] ดังนั้นสำหรับเรามีขวา)1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2cos−1(1z)&lt;θ&lt;sin−1(1z)cos−1⁡(1z)&lt;θ&lt;sin−1⁡(1z)\cos^{-1}\left(\frac{1}{z}\right)<\theta<\sin^{-1}\left(\frac{1}{z}\right) ค่าสัมบูรณ์ของการแปลงจาโคเบียนคือ|J|=z|J|=z|J|=z ดังนั้นความหนาแน่นรอยต่อของจึงถูกกำหนดโดย(Z,Θ)(Z,Θ)(Z,\Theta) fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2√),θ∈(cos−1(1/z),sin−1(1/z))}fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2),θ∈(cos−1⁡(1/z),sin−1⁡(1/z))}f_{Z,\Theta}(z,\theta)=z\mathbf 1_{\{z\in(0,1),\,\theta\in\left(0,\pi/2\right)\}\bigcup\{z\in(1,\sqrt2),\,\theta\in\left(\cos^{-1}\left(1/z\right),\sin^{-1}\left(1/z\right)\right)\}} เมื่อรวมเข้ากับเราได้รับ pdf ของเป็นθθ\thetaZZZ fZ(z)=πz210&lt;z&lt;1+(πz2−2zcos−1(1z))11&lt;z&lt;2√fZ(z)=πz210&lt;z&lt;1+(πz2−2zcos−1⁡(1z))11&lt;z&lt;2f_Z(z)=\frac{\pi z}{2}\mathbf 1_{0\sqrt 2 \end{cases} ซึ่งดูเหมือนว่าการแสดงออกที่ถูกต้อง การแยกสำหรับกรณีที่ถึงแม้ว่าจะแสดงนิพจน์ซึ่งไม่ทำให้ PDF ง่ายขึ้นเท่าที่ฉันได้รับมาFZFZF_Z1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2 ในที่สุดฉันคิดว่าฉันมีภาพที่ถูกต้องสำหรับ CDF: สำหรับ :0&lt;z&lt;10&lt;z&lt;10<z<1 และสำหรับ :1&lt;z&lt;2–√1&lt;z&lt;21<z<\sqrt 2 ส่วนที่แรเงาควรระบุพื้นที่ของพื้นที่{(x,y):0&lt;x,y&lt;1,x2+y2≤z2}{(x,y):0&lt;x,y&lt;1,x2+y2≤z2}\left\{(x,y):0<x,y< 1\,,\,x^2+y^2\le z^2\right\} ภาพให้ผลตอบแทนทันที FZ(z)=Pr(−z2−X2−−−−−−−√≤Y≤z2−X2−−−−−−−√)=⎧⎩⎨⎪⎪⎪⎪πz24z2−1−−−−−√+∫1z2−1√z2−x2−−−−−−√dx, if 0&lt;z&lt;1, if 1&lt;z&lt;2–√FZ(z)=Pr(−z2−X2≤Y≤z2−X2)={πz24, if 0&lt;z&lt;1z2−1+∫z2−11z2−x2dx, if 1&lt;z&lt;2\begin{align} F_Z(z)&=\Pr\left(-\sqrt{z^2-X^2}\le Y\le\sqrt{z^2-X^2}\right) \\&=\begin{cases}\frac{\pi …

2
KL ขาดทุนด้วยยูนิตเสียน
ฉันได้ใช้ VAE และฉันสังเกตเห็นการใช้งานที่แตกต่างกันสองทางออนไลน์ของความแตกต่างที่ไม่ซับซ้อนของ gaussian KL แบบไม่ระบุตัวตน ความแตกต่างดั้งเดิมตามที่นี่คือ หากเราถือว่าก่อนหน้านี้คือหน่วย gaussian เช่นและสิ่งนี้จะลดความซับซ้อนลงเหลือ และนี่คือที่ที่ความสับสนของฉันอยู่ แม้ว่าฉันจะพบ repos github ที่คลุมเครือไม่กี่อย่างกับการใช้งานข้างต้นสิ่งที่ฉันมักจะใช้คือ:KLL o s s= บันทึก(σ2σ1) +σ21+ (μ1-μ2)22σ22-12KLล.โอss=เข้าสู่ระบบ⁡(σ2σ1)+σ12+(μ1-μ2)22σ22-12 KL_{loss}=\log(\frac{\sigma_2}{\sigma_1})+\frac{\sigma_1^2+(\mu_1-\mu_2)^2}{2\sigma^2_2}-\frac{1}{2} μ2= 0μ2=0\mu_2=0σ2= 1σ2=1\sigma_2=1KLL o s s= - บันทึก(σ1) +σ21+μ212-12KLล.โอss=-เข้าสู่ระบบ⁡(σ1)+σ12+μ122-12 KL_{loss}=-\log(\sigma_1)+\frac{\sigma_1^2+\mu_1^2}{2}-\frac{1}{2} KLL o s s= -12( 2 บันทึก(σ1) -σ21-μ21+ 1 )KLล.โอss=-12(2เข้าสู่ระบบ⁡(σ1)-σ12-μ12+1) KL_{loss}=-\frac{1}{2}(2\log(\sigma_1)-\sigma_1^2-\mu_1^2+1) = -12( บันทึก(σ1) -σ1-μ21+ 1 )=-12(เข้าสู่ระบบ⁡(σ1)-σ1-μ12+1) =-\frac{1}{2}(\log(\sigma_1)-\sigma_1-\mu^2_1+1) …

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.