สถิติและข้อมูลขนาดใหญ่

ถามตอบสำหรับผู้ที่สนใจในสถิติการเรียนรู้ของเครื่องจักรการวิเคราะห์ข้อมูลการขุดข้อมูล

1
การจัดการชุดข้อมูลขนาดใหญ่ในแบบฝึกหัดแนวปฏิบัติที่เหมาะสม ฯลฯ
ฉันเป็น Noob R ที่จำเป็นต้องทำการวิเคราะห์ชนิดต่าง ๆ บนชุดข้อมูลขนาดใหญ่ใน R ดังนั้นเมื่อมองไปรอบ ๆ ไซต์นี้และที่อื่น ๆ ปรากฏว่าสำหรับฉันมีปัญหาลึกลับและเป็นที่รู้จักน้อยมากที่เกี่ยวข้องกับที่นี่ - แพคเกจที่จะใช้เมื่อใดการแปลงเป็น (ไม่) ใช้กับข้อมูล ฯลฯ ฉันแค่สงสัยว่ามีหนังสือ / กวดวิชา / คู่มือที่ demystifies ทั้งหมดนี้และนำเสนอข้อมูลอย่างเป็นระบบหรือไม่? ฉันชอบทำสิ่งนี้แทนที่จะมองไปรอบ ๆ และรวบรวมข้อมูลจากแหล่งต่าง ๆ ทางออนไลน์ ขอบคุณล่วงหน้า.
11 r  large-data 

1
แปลงรหัส SAS NLMIXED สำหรับการถดถอยแกมม่าที่ไม่ต้องพองตัวเป็น R
ฉันพยายามเรียกใช้การถดถอยที่ไม่ต้องเสียค่าศูนย์สำหรับตัวแปรตอบสนองต่อเนื่องใน R. ฉันทราบว่ามีการใช้งาน gamlss แต่ฉันอยากลองใช้อัลกอริทึมนี้โดย Dale McLerran ซึ่งเป็นแนวคิดที่ค่อนข้างตรงไปตรงมามากกว่า น่าเสียดายที่รหัสนั้นอยู่ใน SAS และฉันไม่แน่ใจว่าจะเขียนใหม่สำหรับ nlme ได้อย่างไร รหัสดังต่อไปนี้: proc nlmixed data=mydata; parms b0_f=0 b1_f=0 b0_h=0 b1_h=0 log_theta=0; eta_f = b0_f + b1_f*x1 ; p_yEQ0 = 1 / (1 + exp(-eta_f)); eta_h = b0_h + b1_h*x1; mu = exp(eta_h); theta = exp(log_theta); r = mu/theta; …
11 r  sas  gamlss 

2
การสุ่มตัวอย่าง MCMC ของพื้นที่ต้นไม้การตัดสินใจเทียบกับป่าแบบสุ่ม
ป่าสุ่มคือชุดของต้นไม้ตัดสินใจที่เกิดขึ้นจากการสุ่มเลือกคุณสมบัติบางอย่างเท่านั้นที่จะสร้างต้นไม้แต่ละต้นด้วย (และบางครั้งการรวบข้อมูลการฝึกอบรม) เห็นได้ชัดว่าพวกเขาเรียนรู้และพูดคุยได้ดี มีใครทำการสุ่มตัวอย่าง MCMC ของพื้นที่ต้นไม้การตัดสินใจหรือเปรียบเทียบกับป่าสุ่ม? ฉันรู้ว่ามันอาจมีราคาแพงกว่าการคำนวณ MCMC และบันทึกต้นไม้ตัวอย่างทั้งหมด แต่ฉันสนใจคุณสมบัติทางทฤษฎีของรุ่นนี้ไม่ใช่ค่าใช้จ่ายในการคำนวณ สิ่งที่ฉันหมายถึงคือสิ่งนี้: สร้างแผนผังการตัดสินใจแบบสุ่ม (มันอาจจะทำงานได้อย่างน่ากลัว) โอกาส Compute ของต้นไม้กับสิ่งที่ต้องการหรือบางทีอาจจะเพิ่มระยะP P R ฉันo R ( T R อีอี)P( Tr e e | D a t a ) ∝ P( D a t a | Tr e e )P(TRอีอี|Daเสื้อa)αP(Daเสื้อa|TRอีอี)P(Tree|Data) \propto P(Data|Tree)Pp r i o r( …

2
การออกแบบการทดสอบสำหรับจิตใจที่บอกว่าเขาสามารถมีอิทธิพลต่อลูกเต๋า
สมมติว่าฉันมีเพื่อน (เรียกเขาว่า "จอร์จ") ที่บอกว่าเขาสามารถควบคุมการหมุนของลูกเต๋าโดยใช้ความคิดของเขา (เช่นทำให้ลูกเต๋ามีแนวโน้มที่จะลดลงตามจำนวนที่เขากำลังคิด) ฉันจะออกแบบการทดสอบอย่างเข้มงวดทางวิทยาศาสตร์เพื่อตัดสินว่าเขาสามารถทำสิ่งนี้ได้จริงหรือไม่? (ฉันไม่คิดว่าจริง ๆ แล้วเขาสามารถทำได้ แต่ฉันต้องการให้เขาเห็นด้วยกับรายละเอียดของการทดสอบ Amazing Randi-style ก่อนการทดสอบจะเริ่มต้น) ฉันต้องการลดข้อแก้ตัวหลังการทดสอบ (น่าจะเป็นมาก) ว่าเขาจะมาด้วย นี่คือสิ่งที่ฉันมี: กำหนดเทคนิคการทอยลูกเต๋า (ซึ่งลูกเต๋าถ้วยเชคเกอร์พื้นผิวจอด ฯลฯ ) กำหนด "เซสชั่นการทดสอบ" ประกอบด้วยXม้วนลูกเต๋า สิ่งนี้จะต้องมีขนาดเล็กพอที่จะทำในการนั่ง แต่มีขนาดใหญ่พอที่จะตรวจสอบ (หลังจากการวิเคราะห์) ภายใน 95% -99% ความมั่นใจไม่ว่าลูกเต๋าตกลงยุติธรรมหรือได้รับการสนับสนุนด้านใดด้านหนึ่ง รันเซสชันYบนลูกเต๋าที่เลือก (โดยไม่มีอิทธิพลจากจอร์จ) ในฐานะ "การควบคุม" เพื่อให้แน่ใจว่าลูกเต๋าแสดงผลลัพธ์ "ยุติธรรม" ด้วยตนเอง รันเซสชันZกับ George ก่อนที่แต่ละตัวให้หมุนตายแยกต่างหากเพื่อกำหนดว่า George จะ "จดจ่อกับ" หมายเลขใดในระหว่างเซสชันทั้งหมด รวบรวมและวิเคราะห์ผลลัพธ์ จอร์จทำข้อแก้ตัวบางอย่างสำหรับการทำงานที่น่าหดหู่ของเขา ดังนั้นคำถามของฉันสำหรับคุณ: ข้อบกพร่องหรือปัญหาเกี่ยวกับวิธีการโดยรวมของฉันได้อย่างไร สิ่งที่จอร์จมีแนวโน้มที่จะคัดค้าน? …

2
ความเหมาะสมของ Wilcoxon ลงนามทดสอบระดับ
ฉันแหย่ไปรอบ ๆ ในจดหมายเหตุตรวจสอบความถูกต้องของ Cross และดูเหมือนจะไม่พบคำตอบสำหรับคำถามของฉัน คำถามของฉันมีดังต่อไปนี้: Wikipedia ให้ข้อสมมติฐานสามข้อที่จำเป็นสำหรับการทดสอบระดับวิลคอกซันที่ลงนาม (แก้ไขเล็กน้อยสำหรับคำถามของฉัน): ให้ Zi = Xi-Yi สำหรับ i = 1, ... , n ความแตกต่างของ Zi นั้นถือว่าเป็นอิสระ (a.) Zi แต่ละคนมาจากประชากรที่ต่อเนื่องกันและ (b.) Zi แต่ละคนมีความสมมาตรเกี่ยวกับค่ามัธยฐานทั่วไป ค่าที่ตัวแทน Xi และ Yi ถูกสั่ง ... ดังนั้นการเปรียบเทียบ 'มากกว่า', 'น้อยกว่า' และ 'เท่ากับ' มีประโยชน์ เอกสารประกอบสำหรับ? wilcox.test ใน R อย่างไรก็ตามดูเหมือนว่าบ่งชี้ว่า (2.b) เป็นสิ่งที่ทดสอบโดยขั้นตอนจริง: "... หากทั้ง …

1
การอ้างอิงผลรวมและความแตกต่างของตัวแปรที่มีความสัมพันธ์สูงซึ่งเกือบจะไม่เกี่ยวข้องกัน
ในกระดาษที่ฉันเขียนฉันสร้างแบบจำลองตัวแปรสุ่มและมากกว่าและเพื่อลบปัญหาที่เกิดขึ้นเมื่อและมีความสัมพันธ์สูงและมีความแปรปรวนเท่ากัน (เหมือนที่ใช้ในแอปพลิเคชันของฉัน) ผู้ตัดสินต้องการให้ฉันอ้างอิง ฉันสามารถพิสูจน์ได้อย่างง่ายดาย แต่การเป็นวารสารแอปพลิเคชันที่พวกเขาต้องการการอ้างอิงถึงการคำนวณทางคณิตศาสตร์อย่างง่ายX+YX+YX+YX−YX−YX-YXXXYYYXXXYYY ใครบ้างมีคำแนะนำสำหรับการอ้างอิงที่เหมาะสม? ฉันคิดว่ามีบางอย่างในหนังสือ EDA ของ Tukey (1977) เกี่ยวกับผลรวมและความแตกต่าง แต่ฉันหาไม่เจอ

5
ฉันสามารถใช้“ ตาซ้าย” และ“ ตาขวา” ในตัวอย่างของฉันเป็นวิชาที่แตกต่างกันได้หรือไม่?
ข้อมูลของฉันมีดังนี้ ฉันมีผู้ป่วยสองกลุ่ม ผู้ป่วยในแต่ละกลุ่มมีการผ่าตัดตาที่แตกต่างกัน วัดตัวแปร 5 ตัวสำหรับผู้ป่วยในแต่ละกลุ่ม ฉันต้องการเปรียบเทียบตัวแปรเหล่านั้นระหว่างสองกลุ่มโดยใช้การทดสอบการเปลี่ยนรูปหรือ MANOVA ตาที่ใช้ทำการผ่าตัดนั้นไม่สำคัญในการวิเคราะห์ อย่างไรก็ตามผู้ป่วย 2 ในกลุ่ม A มีการผ่าตัดที่ตาทั้งสองข้างดังนั้นจึงมีตัวแปร 5 ตัวที่วัดสองครั้งหนึ่งครั้งต่อตา ฉันสามารถพิจารณาผู้ป่วย 2 ด้านซ้ายและผู้ป่วย 2 ได้เช่นกัน เหมือนกันสำหรับผู้ป่วย 31 ในกลุ่ม B อดทน122.วันที่ 31วันที่ 3132.ประเภทการผ่าตัดAAA.BBB.ด้านซ้ายซ้ายขวา.ซ้ายขวาขวา.V1918790908891.....................V5221923171924PatientSurgery typeSideV1…V51ALeft91…222ALeft87…192ARight90…23...31BLeft90…1731BRight88…1932BRight91…24... \begin{array} \hline \text{Patient} & \text{Surgery type} & \text{Side} & \text{V1}& \ldots & V5\\ 1 & \text{A} & \text{Left} & 91 & …
11 sampling 

2
วิธีการค้นหาการจัดกลุ่ม (วิถี) ในข้อมูลระยะยาว?
บริบท ฉันต้องการตั้งฉากก่อนที่จะขยายคำถาม ฉันมีข้อมูลตามยาวการวัดผลของอาสาสมัครทุก ๆ 3 เดือนผลลัพธ์หลักคือตัวเลข (อย่างต่อเนื่องถึง 1dp) ในช่วง 5 ถึง 14 โดยมีค่าเป็นกลุ่ม (ของจุดข้อมูลทั้งหมด) อยู่ระหว่าง 7 และ 10 ถ้าฉันทำ พล็อตสปาเก็ตตี้ (อายุบนแกน x และเส้นสำหรับแต่ละคน) เห็นได้ชัดว่ามันยุ่งเหยิงอย่างมากเมื่อฉันมีอาสาสมัครมากกว่า 1,500 คน แต่มีความชัดเจนในการก้าวไปสู่ค่าที่สูงขึ้นเมื่ออายุเพิ่มขึ้น คำถามที่กว้างกว่า:สิ่งที่เราต้องการจะทำคือการระบุกลุ่มที่มีแนวโน้ม (กลุ่มที่เริ่มต้นสูงและอยู่สูงกลุ่มที่เริ่มต่ำและอยู่ต่ำผู้ที่เริ่มต่ำและเพิ่มขึ้นสูง ฯลฯ ) จากนั้นเราสามารถ ดูปัจจัยส่วนบุคคลที่เกี่ยวข้องกับการเป็นสมาชิก 'กลุ่มแนวโน้ม' คำถามของฉันที่นี่เกี่ยวข้องกับส่วนแรกโดยเฉพาะการจัดกลุ่มตามแนวโน้ม คำถาม เราจะจัดกลุ่มวิถียาวของบุคคลได้อย่างไร ซอฟต์แวร์ใดที่เหมาะสำหรับการนำไปใช้งานนี้ ฉันได้ดู Proc Traj ใน SAS และ M-Plus ที่เพื่อนร่วมงานแนะนำซึ่งฉันกำลังดูอยู่ แต่ต้องการทราบว่าคนอื่นคิดอย่างไรกับเรื่องนี้

1
การกำหนด discretization ที่เหมาะสมของข้อมูลจากการกระจายอย่างต่อเนื่อง
สมมติว่าคุณมีชุดข้อมูลจากการแจกแจงแบบต่อเนื่องที่มีความหนาแน่นสนับสนุนบนที่ไม่รู้จัก แต่ค่อนข้างใหญ่ดังนั้นความหนาแน่นของเคอร์เนล (ตัวอย่าง) การประมาณค่อนข้างแม่นยำ สำหรับการประยุกต์ใช้โดยเฉพาะอย่างยิ่งผมต้องแปลงข้อมูลที่สังเกตในการ จำกัด จำนวนหมวดหมู่เพื่อให้ผลผลิตชุดข้อมูลใหม่ที่มีฟังก์ชั่นมวลโดยนัย(z) P ( Y ) [ 0 , 1 ] n P ( Y ) Z 1 , . . , z n g ( z )Y1,...,YnY1,...,YnY_{1}, ..., Y_{n}p(y)p(y)p(y)[0,1][0,1][0,1]nnnp^(y)p^(y)\hat{p}(y)Z1,...,ZnZ1,...,ZnZ_{1}, ..., Z_{n}g(z)g(z)g(z) ตัวอย่างง่ายๆจะเมื่อและเมื่อ1/2 ในกรณีนี้ฟังก์ชั่นมวลเหนี่ยวนำจะเป็นY ฉัน ≤ 1 / 2 Z ฉัน = 1 Y ฉัน …

1
วิธีการวาดพล็อตหินกรวดในงูหลาม? [ปิด]
ปิด. คำถามนี้เป็นคำถามปิดหัวข้อ ไม่ยอมรับคำตอบในขณะนี้ ต้องการปรับปรุงคำถามนี้หรือไม่ อัปเดตคำถามเพื่อให้เป็นไปตามหัวข้อสำหรับการตรวจสอบข้าม ปิดเมื่อปีที่แล้ว ฉันกำลังใช้การแยกตัวของเวคเตอร์เอกพจน์บนเมทริกซ์และรับเมทริกซ์ U, S และ Vt ณ จุดนี้ฉันพยายามเลือกเกณฑ์สำหรับจำนวนมิติข้อมูลที่จะเก็บไว้ ฉันแนะนำให้ดูที่แปลงหินกรวด แต่ฉันสงสัยว่าจะไปเกี่ยวกับการวางแผนในจำนวนมาก ขณะนี้ฉันกำลังทำสิ่งต่อไปนี้โดยใช้ไลบรารี numpy และ scipy ใน python: U, S, Vt = svd(A) ข้อเสนอแนะใด ๆ

2
สถิติการสั่งซื้อ (เช่นขั้นต่ำ) ของการรวบรวมตัวแปรไคสแควร์ไม่สิ้นสุด?
นี่เป็นครั้งแรกของฉันที่นี่ดังนั้นโปรดแจ้งให้เราทราบหากฉันสามารถชี้แจงคำถามของฉันไม่ว่าทางใดทางหนึ่ง (รวมถึงการจัดรูปแบบแท็ก ฯลฯ ) (และหวังว่าฉันจะสามารถแก้ไขได้ในภายหลัง!) ฉันพยายามค้นหาการอ้างอิงและพยายามแก้ไขตัวเองโดยใช้การเหนี่ยวนำ แต่ล้มเหลวทั้งสองอย่าง ฉันพยายามทำให้การกระจายง่ายขึ้นซึ่งดูเหมือนว่าจะลดลงเป็นสถิติการเรียงลำดับของตัวแปรสุ่มอิสระไม่มีที่สิ้นสุดพร้อมด้วยองศาอิสระที่แตกต่างกัน โดยเฉพาะการกระจายตัวของค่าที่เล็กที่สุดในคืออะไรระหว่าง\ chi ^ 2_2, \ chi ^ 2_4, \ chi ^ 2_6, \ chi ^ 2_8, \ ldots ?χ2χ2\chi^2mmmχ22,χ24,χ26,χ28,…χ22,χ42,χ62,χ82,…\chi^2_2,\chi^2_4,\chi^2_6,\chi^2_8,\ldots ฉันสนใจกรณีพิเศษm=1m=1m=1 : การกระจายขั้นต่ำของ (อิสระ) χ22,χ24,χ26,…χ22,χ42,χ62,…\chi^2_2,\chi^2_4,\chi^2_6,\ldotsคืออะไร? สำหรับกรณีที่น้อยที่สุดฉันสามารถเขียนฟังก์ชันการแจกแจงสะสม (CDF) เป็นผลิตภัณฑ์ที่ไม่มีที่สิ้นสุด แต่ไม่สามารถทำให้มันง่ายขึ้นอีก ฉันใช้ข้อเท็จจริงว่า CDF ของχ22mχ2m2\chi^2_{2m}คือF2m(x)=γ(m,x/2)/Γ(m)=γ(m,x/2)/(m−1)!=1−e−x/2∑k=0m−1xk/(2kk!).F2m(x)=γ(m,x/2)/Γ(m)=γ(m,x/2)/(m−1)!=1−e−x/2∑k=0m−1xk/(2kk!).F_{2m}(x)=\gamma(m,x/2)/\Gamma(m)=\gamma(m,x/2)/(m-1)!=1-e^{-x/2}\sum_{k=0}^{m-1}x^k/(2^k k!). (ด้วยm=1m=1m=1นี่เป็นการยืนยันความคิดเห็นที่สองด้านล่างเกี่ยวกับความเท่าเทียมกับการแจกแจงแบบเอ็กซ์โพเนนเชียลโดยมีความคาดหวัง 2) CDF ของขั้นต่ำสามารถเขียนเป็นFmin(x)=1−(1−F2(x))(1−F4(x))…=1−∏m=1∞(1−F2m(x))Fmin(x)=1−(1−F2(x))(1−F4(x))…=1−∏m=1∞(1−F2m(x))F_{min}(x) = 1-(1-F_2(x))(1-F_4(x))\ldots = 1-\prod_{m=1}^\infty (1-F_{2m}(x)) =1−∏m=1∞(e−x/2∑k=0m−1xk2kk!).=1−∏m=1∞(e−x/2∑k=0m−1xk2kk!).= …

2
Gaussian แบบหลายตัวแปรที่ทนทานใน R
ฉันต้องพอดีกับการแจกแจงแบบเกาส์ทั่วไปกับคลาวด์ 7-point ที่บรรจุค่าผิดปกติจำนวนมากและมีเลเวอเรจสูง คุณรู้จักแพ็คเกจ R ที่ดีสำหรับงานนี้หรือไม่?

1
ทำไมการทิ้งส่วนที่เหลือจากรูปแบบเอฟเฟกต์ผสมจึงให้ช่วงความมั่นใจในการต่อต้านอย่างอนุรักษ์นิยม?
ฉันมักจะจัดการกับข้อมูลที่แต่ละคนวัดกันหลายครั้งในแต่ละเงื่อนไขตั้งแต่ 2 ข้อขึ้นไป เมื่อไม่นานมานี้ฉันได้เล่นกับการสร้างแบบผสมเอฟเฟกต์เพื่อประเมินหลักฐานความแตกต่างระหว่างเงื่อนไขการสร้างแบบจำลองindividualเป็นเอฟเฟกต์แบบสุ่ม เพื่อให้เห็นภาพความไม่แน่นอนเกี่ยวกับการคาดการณ์จากแบบจำลองดังกล่าวฉันได้ใช้ bootstrapping ซึ่งในแต่ละการวนซ้ำของ bootstrap ทั้งบุคคลและการสังเกต - ภายใน - เงื่อนไข - ภายใน - บุคคล - ตัวอย่างจะถูกแทนที่ด้วยและแบบจำลองเอฟเฟกต์ใหม่ ได้รับ วิธีนี้ใช้งานได้ดีสำหรับข้อมูลที่ถือว่าข้อผิดพลาด gaussian แต่เมื่อข้อมูลเป็นแบบทวินามการบูตสแตรปอาจใช้เวลานานมากเนื่องจากการวนซ้ำแต่ละครั้งจะต้องคำนวณรูปแบบเอฟเฟกต์ผสมแบบทวินามที่คำนวณได้ค่อนข้างเข้มข้น ความคิดที่ฉันมีคือฉันอาจใช้ส่วนที่เหลือจากแบบจำลองเดิมแล้วใช้ส่วนที่เหลือเหล่านี้แทนข้อมูลดิบใน bootstrapping ซึ่งจะอนุญาตให้ฉันคำนวณรูปแบบเอฟเฟกต์แบบ gaussian ในการวนซ้ำของ bootstrap แต่ละครั้ง การเพิ่มการทำนายดั้งเดิมจากแบบจำลองทวินามของข้อมูลดิบไปยังการคาดการณ์ bootstrapped จากส่วนที่เหลือให้ผลตอบแทน 95% CI สำหรับการคาดการณ์ดั้งเดิม อย่างไรก็ตามฉันเพิ่งเขียนโค้ดการประเมินอย่างง่ายของวิธีการนี้การสร้างแบบจำลองไม่แตกต่างกันระหว่างสองเงื่อนไขและการคำนวณสัดส่วนของช่วงเวลาที่ความมั่นใจ 95% ล้มเหลวในการรวมศูนย์และฉันพบว่าขั้นตอนการบูตสต็อก (ไม่รวมศูนย์มากกว่า 5% ของเวลา) ยิ่งไปกว่านั้นฉันเขียนโค้ด (ลิงค์เดียวกันก่อนหน้านี้) การประเมินที่คล้ายกันของวิธีการนี้ที่นำไปใช้กับข้อมูลที่เป็นเกาส์เดิมและได้รับ CIs ต่อต้านอนุรักษ์นิยมในทำนองเดียวกัน ความคิดใด ๆ ว่าทำไมถึงเป็นเช่นนั้น?

4
มีกรณีที่ไม่มี k ที่ดีที่สุดใน k-mean
สิ่งนี้อยู่ในใจฉันอย่างน้อยสองสามชั่วโมง ฉันพยายามหา k ที่เหมาะสมที่สุดสำหรับผลลัพธ์จากอัลกอริธึม k (หมายถึงความคล้ายคลึงกันโคไซน์ ) ดังนั้นฉันจึงวางแผนการบิดเบือนเป็นฟังก์ชันของจำนวนกลุ่ม ชุดข้อมูลของฉันคือชุดเอกสาร 800 ชุดในพื้นที่ 600 มิติ จากสิ่งที่ฉันเข้าใจการหาจุดหัวเข่าหรือจุดศอกบนเส้นโค้งนี้ควรบอกฉันอย่างน้อยประมาณจำนวนของกลุ่มที่ฉันต้องใส่ข้อมูลของฉัน ฉันใส่กราฟด้านล่าง จุดที่ได้รับเส้นแนวตั้งสีแดงนั้นได้มาจากการทดสอบอนุพันธ์อันดับสองสูงสุด หลังจากทำทั้งหมดนี้ฉันติดอยู่กับสิ่งที่ง่ายกว่ามาก: กราฟนี้บอกอะไรฉันเกี่ยวกับชุดข้อมูล มันบอกฉันไหมว่ามันไม่คุ้มกับการรวมกลุ่มและเอกสารของฉันขาดโครงสร้างหรือว่าฉันต้องตั้งค่า k ที่สูงมาก? สิ่งหนึ่งที่แปลกคือแม้ว่าจะมีค่า k ต่ำฉันก็เห็นเอกสารที่คล้ายกันรวมกันเป็นกลุ่มดังนั้นฉันจึงไม่แน่ใจว่าทำไมฉันถึงได้รับเส้นโค้งนี้ ความคิดใด ๆ

5
การจัดกลุ่ม SOM สำหรับตัวแปรระบุ / แบบวงกลม
เพียงแค่สงสัยว่าถ้าใครคุ้นเคยกับการจัดกลุ่มข้อมูลเข้าเล็กน้อย ฉันได้ดู SOM เป็นวิธีแก้ปัญหา แต่เห็นได้ชัดว่ามันทำงานได้เฉพาะกับคุณลักษณะตัวเลข มีส่วนขยายใด ๆ สำหรับคุณสมบัติหมวดหมู่หรือไม่ โดยเฉพาะฉันสงสัยเกี่ยวกับ 'Days of the Week' เป็นคุณลักษณะที่เป็นไปได้ แน่นอนว่ามันเป็นไปได้ที่จะแปลงให้เป็นคุณลักษณะเชิงตัวเลข (เช่นจันทร์ - อาทิตย์สอดคล้องกับเลข 1-7) อย่างไรก็ตามจากนั้นระยะทางแบบยุคลิดระหว่างดวงอาทิตย์และจันทร์ (1 และ 7) จะไม่เหมือนกับระยะทางจากจันทร์ถึงอังคาร (1 & 2) ) ข้อเสนอแนะหรือความคิดใด ๆ ที่จะได้รับการชื่นชมมาก

โดยการใช้ไซต์ของเรา หมายความว่าคุณได้อ่านและทำความเข้าใจนโยบายคุกกี้และนโยบายความเป็นส่วนตัวของเราแล้ว
Licensed under cc by-sa 3.0 with attribution required.