สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
RNN พร้อมการทำให้เป็นมาตรฐาน L2 หยุดเรียนรู้
ฉันใช้สองทิศทาง RNN เพื่อตรวจสอบเหตุการณ์ที่เกิดขึ้นไม่สมดุลกัน ชั้นบวกเป็น 100 ครั้งน้อยกว่าชั้นลบ ในขณะที่ไม่มีการใช้งานแบบปกติฉันสามารถได้รับความถูกต้อง 100% ในชุดรถไฟและ 30% สำหรับชุดการตรวจสอบ ฉันเปิดใช้งานการทำให้เป็นปกติ l2 และผลลัพธ์นั้นมีความแม่นยำเพียง 30% ในชุดรถไฟแทนการเรียนรู้ที่ยาวนานขึ้นและความแม่นยำ 100% ในชุดการตรวจสอบความถูกต้อง ฉันคิดว่าข้อมูลของฉันอาจเล็กเกินไปดังนั้นสำหรับการทดลองฉันรวมชุดรถไฟกับชุดทดสอบซึ่งฉันไม่เคยใช้มาก่อน สถานการณ์เหมือนกันกับฉันจะใช้การทำให้เป็นมาตรฐาน l2 ซึ่งฉันไม่ได้ตอนนี้ ฉันได้รับความแม่นยำ 30% สำหรับรถไฟ + การทดสอบและการตรวจสอบ ในการใช้หน่วยที่ถูกซ่อน 128 และ 80 เวลาในการทดลองที่กล่าวถึงเมื่อฉันเพิ่มจำนวนหน่วยที่ซ่อนอยู่เป็น 256 ฉันสามารถ overfit บนรถไฟ + ชุดทดสอบอีกครั้งเพื่อให้ได้ความถูกต้อง 100% แต่ยังคงมีเพียง 30% ในชุดการตรวจสอบ ฉันลองตัวเลือกมากมายสำหรับพารามิเตอร์และเกือบจะไม่มีผลลัพธ์ บางทีเอนโทรปีของการถ่วงน้ำหนักอาจทำให้เกิดปัญหาในการทดลองที่กำหนดน้ำหนักของชั้นบวกคือ 5 ในขณะที่การลองตุ้มน้ำหนักขนาดใหญ่ผลลัพธ์มักจะแย่ลงประมาณ 20% ของความแม่นยำ ฉันลองเซลล์ LSTM …

1
การวิเคราะห์ที่ซับซ้อน, การวิเคราะห์เชิงหน้าที่เพื่อความเข้าใจเชิงลึกในการเรียนรู้ของเครื่อง
ฉันต้องการเจาะลึกลงไปในการเรียนรู้ของเครื่อง (ทฤษฎีและการประยุกต์ในด้านการเงิน) ฉันต้องการถามว่าการวิเคราะห์ที่ซับซ้อนและการวิเคราะห์เชิงหน้าที่มีความเกี่ยวข้องเป็นพื้นฐานสำหรับการเรียนรู้ของเครื่องอย่างไร ฉันจำเป็นต้องเรียนรู้วิชาเหล่านี้หรือฉันควรตั้งสมาธิกับหัวข้ออื่น ๆ (ถ้าเป็นเช่นนั้น)

3
กำลังคำนวณการแจกแจงจากค่าต่ำสุดค่าเฉลี่ยและค่าสูงสุด
สมมติว่าฉันมีชุดข้อมูลขั้นต่ำค่าเฉลี่ยและสูงสุดของชุดข้อมูลพูด 10, 20 และ 25 มีวิธีการ: สร้างการกระจายจากข้อมูลเหล่านี้และ รู้ว่าร้อยละของประชากรที่น่าจะอยู่เหนือหรือต่ำกว่าค่าเฉลี่ย แก้ไข: ตามคำแนะนำของ Glen สมมติว่าเรามีขนาดตัวอย่าง 200

4
วิธีที่ดีที่สุดในการหว่าน N ตัวสร้างตัวเลขสุ่มแบบอิสระจาก 1 ค่า
ในโปรแกรมของฉันฉันต้องรัน N แยกเธรดแต่ละตัวด้วย RNG ของตัวเองซึ่งใช้เพื่อสุ่มตัวอย่างชุดข้อมูลขนาดใหญ่ ฉันต้องสามารถหว่านกระบวนการทั้งหมดนี้ด้วยค่าเดียวดังนั้นฉันจึงสามารถทำซ้ำผลลัพธ์ได้ มันเพียงพอแล้วหรือไม่ที่จะเพิ่มเมล็ดตามลำดับสำหรับแต่ละดัชนี? ขณะนี้ฉันใช้numpyของRandomStateซึ่งใช้ตัวสร้างตัวเลขสุ่มหลอก Mersenne Twister ตัวอย่างโค้ดด้านล่าง: # If a random number generator seed exists if self.random_generator_seed: # Create a new random number generator for this instance based on its # own index self.random_generator_seed += instance_index self.random_number_generator = RandomState(self.random_generator_seed) โดยพื้นฐานแล้วฉันเริ่มต้นด้วยเมล็ดที่ผู้ใช้ป้อน (ถ้ามี) และสำหรับแต่ละอินสแตนซ์ / เธรดฉันตามลำดับเพิ่มดัชนี (0 ถึง …

2
การทดสอบสมมติฐานเกี่ยวกับอันตรายตามสัดส่วนในโมเดลพาราเมตริก
ฉันตระหนักถึงการทดสอบสมมติฐานเกี่ยวกับอันตรายตามสัดส่วนในบริบทของโมเดล Cox PH แต่ฉันไม่พบสิ่งใดที่เกี่ยวข้องกับตัวแบบพารามิเตอร์ มีวิธีที่เป็นไปได้ในการทดสอบสมมติฐาน PH ของแบบจำลองพารามิเตอร์บางตัวหรือไม่? ดูเหมือนว่าควรมีรูปแบบพาราเมตริกที่มีความแตกต่างจากโมเดลกึ่งคอคส์เล็กน้อยเท่านั้น? ตัวอย่างเช่นถ้าฉันต้องการให้พอดีกับเส้นโค้งมรณะ Gompertz (ดังด้านล่าง) ฉันจะทดสอบสมมติฐาน PH ได้อย่างไร μxHx( t )Sx( t )= a bอีa x + βZ=∫เสื้อ0μx + tdt = b (อีที- 1 )อีa x + βZ= exp ( -Hx( T ) )μx=abeax+βZHx(t)=∫0tμx+tdt=b(eat−1)eax+βZSx(t)=exp(−Hx(t))\begin{align} \mu_{x}&=abe^{ax+\beta Z}\\ H_{x}(t)&=\int_{0}^{t}\mu_{x+t}\,dt=b(e^{at}-1)e^{ax+\beta Z}\\ S_{x}(t)&=\text{exp}(-H_{x}(t)) \end{align} ฉันคิดว่าโดยทั่วไปสิ่งที่ฉันขอคือ: สำหรับแบบจำลองการเอาตัวรอดแบบ Parametric วิธีใดบ้างในการประเมินความดีของแบบจำลองและการทดสอบสมมติฐาน …

2
นิยามของความน่าจะเป็นแบบบ่อย มีคำจำกัดความที่เป็นทางการหรือไม่?
มีคำจำกัดความที่เป็นทางการ (ทางคณิตศาสตร์) ของสิ่งที่ผู้ใช้บ่อยเข้าใจภายใต้ '' ความน่าจะเป็น 'หรือไม่ ฉันอ่านว่ามันเป็นความถี่สัมพัทธ์ของการเกิด '' ในระยะยาว '' แต่มีบางวิธีที่เป็นทางการในการกำหนดหรือไม่? มีการอ้างอิงที่รู้จักที่ฉันสามารถค้นหาคำจำกัดความนั้นได้หรือไม่? แก้ไข: ด้วยผู้ใช้บ่อย (ดูความคิดเห็นโดย @whuber และความคิดเห็นของฉันต่อคำตอบ @Kodiologist และ @Graeme Walsh ด้านล่างคำตอบนั้น) ฉันหมายถึงผู้ที่เชื่อในความถี่ระยะยาวที่มีอยู่นี้ บางทีนี่ (ส่วนหนึ่ง) ตอบคำถามของ @Tim ด้วย

1
วิธีการคำนวณจากตัวอย่าง R กำลังสอง?
ฉันรู้ว่าอาจมีการพูดถึงที่อื่น แต่ฉันไม่สามารถหาคำตอบที่ชัดเจนได้ ฉันกำลังพยายามใช้สูตรเพื่อคำนวณ -ตัวอย่างของการถดถอยเชิงเส้นโดยที่คือผลรวมของส่วนที่เหลือกำลังสองและคือผลรวมของกำลังสองทั้งหมด สำหรับชุดฝึกอบรมนั้นเป็นที่ชัดเจนว่าR2=1−SSR/SSTR2=1−SSR/SSTR^2 = 1 - SSR/SSTR2R2R^2SSRSSRSSRSSTSSTSST SST=Σ(y−y¯train)2SST=Σ(y−y¯train)2 SST = \Sigma (y - \bar{y}_{train})^2 ชุดทดสอบมีอะไรบ้าง ฉันควรใช้สำหรับตัวอย่างหรือใช้แทนหรือไม่y¯trainy¯train\bar{y}_{train}yyyy¯testy¯test\bar{y}_{test} ฉันพบว่าถ้าฉันใช้ผลลัพธ์อาจเป็นลบได้ในบางครั้ง สิ่งนี้สอดคล้องกับคำอธิบายฟังก์ชั่นของ sklearn โดยที่พวกเขาใช้ (ซึ่งยังใช้โดยฟังก์ชันlinear_model ของพวกเขาสำหรับการทดสอบตัวอย่าง) พวกเขากล่าวว่า "แบบจำลองค่าคงที่ที่ทำนายค่า y ที่คาดไว้เสมอโดยไม่คำนึงถึงคุณลักษณะอินพุตจะได้รับคะแนน R ^ 2 เท่ากับ 0.0"y¯testy¯test\bar{y}_{test}R2R2R^2r2_score()y¯testy¯test\bar{y}_{test}score() อย่างไรก็ตามในที่อื่น ๆ ผู้คนใช้แบบนี้และที่นี่ (คำตอบที่สองโดย dmi3kno) ดังนั้นฉันสงสัยว่าสิ่งใดที่เหมาะสมกว่า ความคิดเห็นใด ๆ จะได้รับการชื่นชมอย่างมาก!y¯trainy¯train\bar{y}_{train}

2
การทำนายความต้องการหน่วยความจำ CPU และ GPU ของการฝึกอบรม DNN
สมมติว่าฉันมีสถาปัตยกรรมรูปแบบการเรียนรู้เชิงลึกเช่นเดียวกับขนาดมินิแบทช์ที่เลือก ฉันจะได้รับความต้องการหน่วยความจำที่คาดหวังสำหรับการฝึกอบรมรุ่นนั้นได้อย่างไร เป็นตัวอย่างให้พิจารณาโมเดล (ไม่เกิดขึ้นอีก) กับอินพุตของมิติ 1000, เลเยอร์ซ่อนเร้นเชื่อมต่อเต็ม 100 มิติ 4 และเลเยอร์เอาต์พุตเพิ่มเติมของมิติ 10 ขนาดมินิแบทช์คือ 256 ตัวอย่าง วิธีการหนึ่งกำหนดรอยเท้าหน่วยความจำโดยประมาณ (RAM) ของกระบวนการฝึกอบรมบน CPU และ GPU ถ้ามันสร้างความแตกต่างลองสมมติว่ารุ่นนั้นได้รับการฝึกฝนบน GPU ด้วย TensorFlow (เช่นใช้ cuDNN)

1
การทำนายอนุกรมเวลาโดยใช้ ARIMA กับ LSTM
ปัญหาที่ฉันจัดการคือการทำนายค่าอนุกรมเวลา ฉันกำลังดูซีรีส์ครั้งเดียวในแต่ละครั้งและตามตัวอย่างเช่น 15% ของข้อมูลอินพุตฉันต้องการทำนายค่าในอนาคต จนถึงตอนนี้ฉันเจอสองรุ่น: LSTM (หน่วยความจำระยะสั้นระยะยาวคลาสของเครือข่ายประสาทที่เกิดขึ้นอีก) ARIMA ฉันลองทั้งสองและอ่านบทความเกี่ยวกับพวกเขา ตอนนี้ฉันพยายามทำความเข้าใจให้ดีขึ้นเกี่ยวกับวิธีเปรียบเทียบทั้งสอง สิ่งที่ฉันได้พบจนถึง: LSTM ทำงานได้ดีขึ้นถ้าเราจัดการกับข้อมูลจำนวนมากและมีข้อมูลการฝึกอบรมเพียงพอในขณะที่ ARIMA จะดีกว่าสำหรับชุดข้อมูลขนาดเล็ก (ถูกต้องหรือไม่?) ARIMA ต้องการชุดพารามิเตอร์(p,q,d)ที่ต้องคำนวณตามข้อมูลในขณะที่ LSTM ไม่ต้องการตั้งค่าพารามิเตอร์ดังกล่าว อย่างไรก็ตามมีพารามิเตอร์หลายอย่างที่เราต้องปรับแต่งสำหรับ LSTM นอกเหนือจากคุณสมบัติที่กล่าวถึงข้างต้นฉันไม่สามารถหาจุดหรือข้อเท็จจริงอื่นใดที่จะช่วยให้ฉันเลือกโมเดลที่ดีที่สุดได้ ฉันจะขอบคุณจริง ๆ ถ้ามีคนช่วยฉันค้นหาบทความเอกสารหรือสิ่งอื่น ๆ (ไม่มีโชคจนถึงตอนนี้มีเพียงความคิดเห็นทั่วไปบางส่วนที่นี่และที่นั่นและไม่มีอะไรจากการทดลอง) ฉันต้องพูดถึงว่าตอนแรกฉันจัดการกับข้อมูลสตรีมมิ่ง แต่ตอนนี้ฉันกำลังใช้ชุดข้อมูล NABซึ่งรวมถึง 50 ชุดข้อมูลที่มีขนาดสูงสุด 20k จุดข้อมูล

3
วิธีที่ดีที่สุดในการประเมินวิธีการประมาณ PDF
ฉันต้องการทดสอบความคิดของฉันที่ฉันคิดว่าดีกว่าสิ่งที่ฉันได้เห็น ฉันอาจจะผิด แต่ฉันต้องการที่จะทดสอบความคิดของฉันและเอาชนะข้อสงสัยของฉันโดยการสังเกตเพิ่มเติมบางอย่าง สิ่งที่ฉันคิดที่จะทำคือ: วิเคราะห์กำหนดชุดของการแจกแจง บางส่วนเป็นแบบง่าย ๆ เช่น Gaussian, uniform, หรือ Tophat แต่สิ่งเหล่านี้ต้องยากและท้าทายเช่นการจำหน่ายซิมป์สัน ใช้งานซอฟต์แวร์ตามการแจกแจงเชิงวิเคราะห์และใช้เพื่อสร้างตัวอย่างบางส่วน เนื่องจากการแจกแจงนั้นถูกกำหนดไว้ในการวิเคราะห์ฉันจึงรู้นิยาม PDF ที่แท้จริงของพวกมันอยู่แล้ว มันเยี่ยมมาก จากนั้นฉันจะทดสอบวิธีการประมาณ PDF ต่อไปนี้กับตัวอย่างด้านบน: วิธีการประมาณค่า PDF ที่มีอยู่ (เช่น KDE ที่มีเมล็ดและแบนด์วิดท์ต่างๆ) ความคิดของฉันเองที่ฉันคิดว่าคุ้มค่าที่จะลอง จากนั้นฉันจะวัดข้อผิดพลาดของการประมาณกับ PDF จริง จากนั้นฉันจะรู้ว่าวิธีการประมาณ PDF แบบใดดีกว่า คำถามของฉันคือ: คำถามที่ 1:มีการปรับปรุงแผนของฉันข้างต้นหรือไม่ Q2:ฉันพบว่ามันยากสำหรับฉันที่จะวิเคราะห์ PDF จริงหลาย ๆ อย่าง มีรายการที่ครอบคลุมของ PDF จริงที่กำหนดไว้มากมายที่วิเคราะห์ด้วยความยากลำบากที่แตกต่างกัน (รวมถึงไฟล์ที่ยากมาก) ที่ฉันสามารถนำกลับมาใช้ใหม่ได้หรือไม่?

1
ตัวประมาณที่ลดผลรวมถ่วงน้ำหนักของอคติกำลังสองและความแปรปรวนเข้ากับทฤษฎีการตัดสินใจได้อย่างไร
ตกลง - ข้อความต้นฉบับของฉันไม่สามารถตอบสนองได้ ขอผมใส่คำถามที่ต่างออกไป ฉันจะเริ่มต้นด้วยการอธิบายความเข้าใจของฉันเกี่ยวกับการประเมินจากมุมมองทางทฤษฎีการตัดสินใจ ฉันไม่มีการฝึกฝนอย่างเป็นทางการและจะไม่ทำให้ฉันประหลาดใจถ้าความคิดของฉันมีข้อบกพร่อง สมมติว่าเรามีบางฟังก์ชั่นการสูญเสีย(x)) การสูญเสียที่คาดหวังคือความเสี่ยง (บ่อยครั้ง):L(θ,θ^(x))L(θ,θ^(x))L(\theta,\hat\theta(x)) R(θ,θ^(x))=∫L(θ,θ^(x))L(θ,θ^(x))dx,R(θ,θ^(x))=∫L(θ,θ^(x))L(θ,θ^(x))dx,R(\theta,\hat\theta(x))=\int L(\theta,\hat\theta(x))\mathcal{L}(\theta,\hat\theta(x))dx, โดยที่คือความเป็นไปได้; และความเสี่ยงของ Bayes คือความเสี่ยงที่พบบ่อย:L(θ,θ^(x))L(θ,θ^(x))\mathcal{L}(\theta,\hat\theta(x)) r(θ,θ^(x))=∫∫R(θ,θ^(x))π(θ)dxdθ,r(θ,θ^(x))=∫∫R(θ,θ^(x))π(θ)dxdθ,r(\theta,\hat\theta(x))=\int\int R(\theta,\hat\theta(x))\pi (\theta)dxd\theta, โดยที่เป็นของเราก่อนหน้าπ(θ)π(θ)\pi (\theta) โดยทั่วไปแล้วเราพบที่ย่อและสิ่งนี้ได้ผลดี; ยิ่งกว่านั้นทฤษฎีบทของ Fubini ก็นำมาใช้และเราสามารถกลับลำดับการรวมเพื่อให้ใด ๆที่ย่อเป็นอิสระจากคนอื่นทั้งหมด วิธีนี้หลักการความน่าจะเป็นไม่ได้ถูกละเมิดและเราสามารถรู้สึกดีเกี่ยวกับการเป็นแบบเบย์เป็นต้นθ^(x)θ^(x)\hat\theta(x)rrrθ^(x)θ^(x)\hat\theta(x)rrr ตัวอย่างเช่นเนื่องจากการสูญเสียข้อผิดพลาดกำลังสองที่คุ้นเคยความเสี่ยงของเราที่พบบ่อยคือความคลาดเคลื่อนกำลังสองเฉลี่ยหรือผลรวม ความเอนเอียงและความแปรปรวนและความเสี่ยงของเบย์คือผลรวมที่คาดหวังของความอคติกำลังสองและความแปรปรวนตามที่เราคาดไว้ก่อนหน้านั่นคือการสูญเสียด้านหลังL(θ,θ^(x))=(θ−θ^(x))2,L(θ,θ^(x))=(θ−θ^(x))2,L(\theta,\hat\theta(x))=(\theta- \hat\theta(x))^2, นี่ดูเหมือนจะสมเหตุสมผลสำหรับฉัน (แม้ว่าฉันอาจจะผิดมาก); แต่ไม่ว่าในกรณีใดสิ่งต่าง ๆ ทำให้ฉันรู้สึกไม่ถึงวัตถุประสงค์อื่น ๆ ตัวอย่างเช่นสมมติว่าแทนที่จะลดผลรวมของอคติและความแปรปรวนที่ถ่วงน้ำหนักเท่า ๆ กันฉันต้องการลดผลรวมน้ำหนักที่ไม่เท่ากันนั่นคือฉันต้องการที่ย่อเล็กสุด:θ^(x)θ^(x)\hat\theta(x) (E[θ^(x)]−θ)2+kE[(θ^(x)−E[θ^(x)])2],(E[θ^(x)]−θ)2+kE[(θ^(x)−E[θ^(x)])2],(\mathbb{E}[\hat\theta(x)]-\theta)^2+k\mathbb{E}[(\hat\theta(x)-\mathbb{E}[\hat\theta(x)])^2], โดยที่คือค่าคงที่จริงที่เป็นบวก (นอกเหนือจาก 1)kkk ฉันมักจะอ้างถึงผลรวมเช่นนี้เป็น "ฟังก์ชันวัตถุประสงค์" แม้ว่ามันอาจเป็นไปได้ว่าฉันกำลังใช้คำนั้นอย่างไม่ถูกต้อง คำถามของฉันไม่เกี่ยวกับวิธีค้นหาวิธีแก้ปัญหา - การค้นหาที่ลดฟังก์ชันวัตถุประสงค์นี้ให้ทำได้เป็นตัวเลข - แต่คำถามของฉันคือสองเท่า:θ^(x)θ^(x)\hat\theta(x) …

3
ข้อมูลอนุกรมเวลาพยากรณ์พร้อมตัวแปรภายนอก
ขณะนี้ฉันกำลังทำงานในโครงการเพื่อคาดการณ์ข้อมูลอนุกรมเวลา (ข้อมูลรายเดือน) ฉันใช้ R เพื่อทำการพยากรณ์ ฉันมีตัวแปรอิสระ 1 ตัว (y) และตัวแปรอิสระ 3 ตัว (x1, x2, x3) ตัวแปร y มีการสังเกต 73 ครั้งและตัวแปรอีก 3 ตัว (alos 73) ตั้งแต่เดือนมกราคม 2009 ถึงมกราคม 2015 ฉันได้ตรวจสอบความสัมพันธ์และค่า p และมันสำคัญมากที่จะนำมาเป็นแบบจำลอง คำถามของฉันคือ: ฉันจะทำให้การคาดการณ์ที่ดีโดยใช้ตัวแปรอิสระทั้งหมดได้อย่างไร ฉันไม่มีค่าในอนาคตสำหรับตัวแปรเหล่านี้ สมมติว่าฉันต้องการทำนายตัวแปร y ของฉันใน 2 ปี (ในปี 2560) ฉันจะทำสิ่งนี้ได้อย่างไร ฉันลองรหัสต่อไปนี้: model = arima(y, order(0,2,0), xreg = externaldata) …

4
มีสูตรสำหรับเส้นโค้งรูปตัว s ที่มีโดเมนและช่วง [0,1]
โดยทั่วไปฉันต้องการแปลงมาตรการความคล้ายคลึงกันเป็นน้ำหนักซึ่งใช้เป็นตัวทำนาย ความคล้ายคลึงกันจะเป็น [0,1] และฉันจะ จำกัด น้ำหนักให้เป็น [0,1] ฉันต้องการฟังก์ชั่น paramteric ที่ทำแผนที่นี้ซึ่งฉันจะปรับให้เหมาะสมโดยใช้การไล่ระดับสี ความต้องการคือ 0 แผนที่ถึง 0, 1 แผนที่ถึง 1 และจะเพิ่มขึ้นอย่างเคร่งครัด อนุพันธ์ที่เข้าใจง่ายก็ชื่นชมเช่นกัน ขอบคุณล่วงหน้า แก้ไข: ขอบคุณสำหรับคำตอบจนถึงสิ่งเหล่านี้มีประโยชน์มาก เพื่อให้วัตถุประสงค์ของฉันชัดเจนยิ่งขึ้นภารกิจคือการคาดการณ์ การสังเกตของฉันเป็นเวกเตอร์กระจัดกระจายมากด้วยมิติเดียวที่จะทำนาย ขนาดอินพุตของฉันใช้เพื่อคำนวณความเหมือนกัน การทำนายของฉันคือผลรวมถ่วงน้ำหนักของค่าการสังเกตการณ์อื่นสำหรับนักทำนายซึ่งน้ำหนักนั้นเป็นฟังก์ชันที่มีความคล้ายคลึงกัน ฉัน จำกัด น้ำหนักของฉันไว้ที่ [0,1] เพื่อความเรียบง่าย ตอนนี้มันชัดเจนแล้วว่าทำไมฉันถึงต้องการ 0 ถึงแผนที่เป็น 0, 1 ถึงแผนที่เป็น 1 และมันจะเพิ่มขึ้นอย่างเคร่งครัด เนื่องจาก whuber ได้ชี้ให้เห็นว่าการใช้ f (x) = x ตรงตามข้อกำหนดเหล่านี้และใช้งานได้ดีจริง ๆ อย่างไรก็ตามไม่มีพารามิเตอร์ที่จะปรับให้เหมาะสม ฉันมีข้อสังเกตมากมายเพื่อให้สามารถทนต่อพารามิเตอร์จำนวนมากได้ …

4
ทำไมต้องใช้การไล่ระดับสี
เมื่อเราสามารถแยกความแตกต่างของฟังก์ชั่นค่าใช้จ่ายและค้นหาพารามิเตอร์โดยการแก้สมการที่ได้จากความแตกต่างบางส่วนที่เกี่ยวกับพารามิเตอร์ทุกตัวและหาตำแหน่งที่ฟังก์ชั่นค่าใช้จ่ายต่ำสุด นอกจากนี้ฉันคิดว่ามันเป็นไปได้ที่จะหาสถานที่หลายแห่งที่อนุพันธ์เป็นศูนย์ดังนั้นเราจึงสามารถตรวจสอบสถานที่ดังกล่าวทั้งหมดและสามารถหาระดับโลกขั้นต่ำได้ ทำไมการไล่ระดับสีแทนจึงดำเนินการแทน

1
คำอธิบายที่ใช้งานง่ายของ logloss
ในการแข่งขันหลายต่อรองคะแนนอยู่บนพื้นฐานของ "logloss" เรื่องนี้เกี่ยวข้องกับข้อผิดพลาดการจัดหมวดหมู่ นี่คือคำตอบทางเทคนิคแต่ฉันกำลังมองหาคำตอบที่ใช้งานง่าย ฉันชอบคำตอบสำหรับคำถามนี้เกี่ยวกับระยะทาง Mahalanobis แต่ PCA ไม่ใช่ logloss ฉันสามารถใช้ค่าที่ซอฟต์แวร์การจำแนกประเภทออกมา แต่ฉันไม่เข้าใจจริงๆ ทำไมเราใช้มันแทนที่จะเป็นอัตราบวก / ลบจริง / เท็จ? คุณช่วยฉันได้ไหมเพื่อที่ฉันจะสามารถอธิบายเรื่องนี้กับคุณยายหรือมือใหม่ในสนามได้? ฉันชอบและเห็นด้วยกับคำพูด: คุณไม่เข้าใจอะไรจริงๆเว้นแต่คุณจะสามารถอธิบายให้คุณยายของคุณได้ - อัลเบิร์ตไอน์สไตน์ ฉันพยายามตอบคำถามนี้ด้วยตัวเองก่อนโพสต์ที่นี่ ลิงก์ที่ฉันไม่พบว่าใช้งานง่ายหรือมีประโยชน์จริงๆ ได้แก่ : http://www.r-bloggers.com/making-sense-of-logarithmic-loss/ https://www.quora.com/What-is-an-intuitive-explanation-for-the-log-loss-function https://lingpipe-blog.com/2010/11/02/evaluating-with-probabilistic-truth-log-loss-vs-0-1-loss/ https://www.kaggle.com/wiki/LogarithmicLoss เหล่านี้เป็นข้อมูลและถูกต้อง มีไว้สำหรับผู้ชมด้านเทคนิค พวกเขาไม่ได้วาดภาพอย่างง่ายหรือให้ตัวอย่างที่ง่ายและเข้าถึงได้ พวกเขาไม่ได้เขียนถึงคุณยายของฉัน

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.