Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Binning Optimal sehubungan dengan variabel respons yang diberikan
Saya sedang mencari metode binning optimal (diskritisasi) dari variabel kontinu sehubungan dengan respon yang diberikan (target) variabel biner dan dengan jumlah interval maksimum sebagai parameter. contoh: Saya memiliki satu set pengamatan orang dengan variabel "tinggi" (angka kontinu) dan "has_back_pains" (biner). Saya ingin melakukan diskritisasi tinggi menjadi 3 interval (kelompok) paling …

2
Derivasi posterior Normal-Wishart
Saya sedang mengerjakan derivasi dari posterior Normal-Wishart tapi saya terjebak di salah satu parameter (posterior dari matriks skala, lihat di bagian bawah). Hanya untuk konteks dan kelengkapan, berikut adalah model dan sisa turunannya: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} Bentuk diperluas …

2
mendapatkan derajat kebebasan dari Lmer
Saya sudah cocok dengan model lmer dengan yang berikut ini (walaupun dibuat keluaran): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 Saya benar-benar ingin membangun interval kepercayaan untuk setiap efek menggunakan rumus berikut: ( n - 1 ) s2χ2α / 2 , n - 1, …

1
Desain model efek campuran dengan variabel sampel
Saya mencoba menentukan rumus untuk model efek campuran linier (dengan lme4) untuk desain eksperimental saya, tetapi saya tidak yakin saya melakukannya dengan benar. Desain: pada dasarnya saya mengukur parameter respons pada tanaman. Saya memiliki 4 tingkat perawatan, dan 2 tingkat irigasi. Tanaman dikelompokkan dalam 16 plot, dalam setiap plot saya …

1
Bagaimana memilih yang paling cocok tanpa data yang terlalu pas? Memodelkan distribusi bimodal dengan fungsi normal N, dll
Saya memiliki distribusi nilai bimodal yang jelas, yang menurut saya cocok. Data dapat cocok dengan 2 fungsi normal (bimodal) atau dengan 3 fungsi normal. Selain itu, ada alasan fisik yang masuk akal untuk menyesuaikan data dengan 3. Semakin banyak parameter yang diperkenalkan, semakin sempurna kesesuaiannya, karena dengan konstanta yang cukup, …

3
"Terbalik" Shapiro – Wilk
Tes Sharipo-Wilk, menurut wikipedia , menguji hipotesis nol ( ) "Populasi terdistribusi secara normal".H0H0H_0 Saya mencari tes normalitas serupa dengan "Populasi tidak terdistribusi secara normal".H0H0H_0 Setelah melakukan tes seperti itu, saya ingin menghitung nilai- untuk menolak pada tingkat signifikansi iff ; membuktikan bahwa populasi saya terdistribusi secara normal.pppH0H0H_0αα\alphap&lt;αp&lt;αp < \alpha …


2
Roll die 6-sided sampai total
Inilah pertanyaannya: Anda melempar dadu 6 sisi yang adil secara iteratif sampai jumlah gulungan dadu lebih besar dari atau sama dengan M. Apa rata-rata dan standar deviasi jumlah dikurangi M ketika M = 300? Haruskah saya menulis kode untuk menjawab pertanyaan semacam ini? Tolong beri saya beberapa petunjuk tentang itu. …

1
Uji model GLM menggunakan null dan penyimpangan model
Saya telah membangun model GLM di R dan telah mengujinya menggunakan kelompok pengujian dan pelatihan sehingga saya yakin itu bekerja dengan baik. Hasil dari R adalah: Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.781e+00 1.677e-02 -165.789 &lt; 2e-16 *** Coeff_A 1.663e-05 5.438e-06 3.059 0.00222 ** log(Coeff_B) 8.925e-01 1.023e-02 87.245 …

1
ambang perhitungan untuk klasifikasi risiko minimum?
Misalkan Dua Kelas dan memiliki atribut dan memiliki distribusi dan . jika kita memiliki sebelumnya yang sama untuk matriks biaya berikut:C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} mengapa, adalah ambang batas untuk pengklasifikasi risiko (biaya) minimum?x0&lt;0.5x0&lt;0.5x_0 < 0.5 Ini adalah …

1
Bagaimana cara menafsirkan output lavaan?
Saya mencoba menggunakan analisis faktor konfirmatori (CFA) lavaan. Saya mengalami kesulitan menafsirkan output yang dihasilkan oleh lavaan. Saya memiliki model sederhana - masing-masing 4 faktor didukung oleh item dari data survei yang dikumpulkan. Faktor-faktor ini sejalan dengan apa yang diukur oleh item, sejauh tampaknya mereka dapat berfungsi sebagai pengukuran yang …


1
Yang menyatu lebih cepat, rata-rata atau median?
Jika saya menggambar variabel iid dari N (0,1), akankah rata-rata atau median bertemu lebih cepat? Seberapa cepat? Untuk lebih spesifik, misalkan menjadi urutan variabel iid yang diambil dari N (0,1). Tentukan , dan menjadi median dari . Yang mana yang menyatu dengan 0 lebih cepat, atau ?ˉ x n = …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.