Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Penyimpangan absolut rata-rata (MAD) dan SD dari distribusi yang berbeda
Untuk data yang terdistribusi normal, simpangan baku dan median simpangan absolut MAD dihubungkan oleh:σσ\sigmaMADMAD\text{MAD} σ=Φ−1(3/4)⋅MAD≈1.4826⋅MAD,σ=Φ−1(3/4)⋅MAD≈1.4826⋅MAD,\sigma=\Phi^{-1}(3/4)\cdot \text{MAD}\approx1.4826\cdot\text{MAD}, di mana adalah fungsi distribusi kumulatif untuk distribusi normal standar.Φ()Φ()\Phi() Apakah ada hubungan serupa untuk distribusi lainnya?

1
2SLS tetapi Probit tahap kedua
Saya mencoba menggunakan analisis variabel instrumental untuk menyimpulkan hubungan sebab akibat dengan data observasi. Saya telah menemukan regresi dua tahap kuadrat (2SLS) yang kemungkinan akan mengatasi masalah endogenitas dalam penelitian saya. Namun, saya ingin tahap pertama menjadi OLS dan tahap kedua agar sesuai dalam 2SLS. Berdasarkan bacaan dan pencarian saya, …

6
Apa masalah dengan pengujian post-hoc?
Profesor statistik saya mengatakan demikian, semua buku yang saya lihat nyatakan: post-hoc-test tidak ilmiah. Anda harus menurunkan hipotesis dari teori terlebih dahulu, lalu mengumpulkan data dan menganalisisnya. Tapi saya benar-benar tidak mengerti apa masalahnya. Misalkan, saya melihat angka penjualan untuk warna mobil yang berbeda dan membentuk hipotesis bahwa dari jumlah …
15 post-hoc 

2
“Variabel Dummy” versus “variabel indikator” untuk data nominal / kategorikal
"Variabel Dummy" dan "variabel indikator" adalah label yang sering digunakan istilah untuk menggambarkan keanggotaan dalam kategori dengan pengkodean 0/1; biasanya 0: Bukan anggota kategori, 1: Anggota kategori. Pada 11/26/2014 pencarian cepat di scholar.google.com (dengan kutipan terlampir) mengungkapkan "variabel dummy" digunakan di sekitar 318.000 artikel, dan "variabel indikator" digunakan di sekitar …



3
Di Kneser-Ney smoothing, bagaimana kata-kata yang tidak terlihat ditangani?
Dari apa yang saya lihat, formula smoothing Kneser-Ney (dalam urutan kedua) dalam beberapa hal diberikan sebagai P2KN(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn)PKN2(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn) \begin{align} P^2_{KN}(w_n|w_{n-1}) &= \frac{\max \left\{ C\left(w_{n-1}, w_n\right) - D, 0\right\}}{\sum_{w'} C\left(w_{n-1}, w'\right)} + \lambda(w_{n-1}) \times P_{cont}(w_n) \end{align} dengan faktor normalisasi diberikan sebagaiλ(wn−1)λ(wn−1)\lambda(w_{n-1}) λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙)λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙) \begin{align} \lambda(w_{n-1}) &= \frac{D}{\sum_{w'} C\left(w_{n-1}, w'\right)} \times N_{1+}\left(w_{n-1}\bullet\right) \end{align} dan …

4
Memperbaiki efek vs efek acak ketika semua kemungkinan termasuk dalam model efek campuran
Dalam model efek campuran, rekomendasinya adalah menggunakan efek tetap untuk memperkirakan parameter jika semua level yang memungkinkan dimasukkan (misalnya, pria dan wanita). Lebih lanjut direkomendasikan untuk menggunakan efek acak untuk menjelaskan variabel jika level yang dimasukkan hanya sampel acak dari populasi (pasien yang terdaftar dari semesta kemungkinan pasien) dan Anda …

11
Menampilkan tiga potong informasi pada grafik
Catatan: 50 titik data mentah dilampirkan sekarang. Saya ingin menampilkan berapa banyak pembelajaran yang telah saya lakukan, dan berapa banyak halaman yang telah saya selesaikan sepanjang minggu, dibagi berdasarkan hari, dan saya telah melakukannya seperti yang ditunjukkan di bawah ini: Saya memiliki orang-orang yang mengatakan kepada saya bahwa mereka tidak …


2
Mensimulasikan undian dari Distribusi Seragam menggunakan undian dari Distribusi Normal
Saya baru-baru ini membeli sumber data wawancara sains di mana salah satu pertanyaan probabilitas adalah sebagai berikut: Diberikan draw dari distribusi normal dengan parameter yang diketahui, bagaimana Anda bisa mensimulasikan draw dari distribusi yang seragam? Proses pemikiran asli saya adalah bahwa, untuk variabel acak diskrit, kita dapat memecah distribusi normal …

2
Derivasi transformasi normalisasi untuk GLM
\newcommand{\E}{\mathbb{E}} Bagaimana A ( ⋅ ) = ∫ d uV 1 / 3 ( μ )A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} transformasi normalisasi untuk keluarga eksponensial berasal? Lebih khusus : Saya mencoba mengikuti sketsa ekspansi Taylor di halaman 3, geser 1 di sini tetapi memiliki beberapa pertanyaan. Dengan XXX dari keluarga eksponensial, transformasi …

1
Haruskah saya menggunakan uji-t pada data yang sangat miring? Tolong bukti ilmiah?
Saya memiliki sampel dari set data yang sangat miring (seperti distribusi eksponensial) tentang partisipasi pengguna (misalnya: jumlah posting), yang memiliki ukuran berbeda (tetapi tidak kurang dari 200) dan saya ingin membandingkan rata-rata mereka. Untuk itu, saya menggunakan dua sampel t-tes tidak berpasangan (dan t-tes dengan faktor Welch, ketika sampel memiliki …

2
Cara menyesuaikan model campuran untuk pengelompokan
Saya memiliki dua variabel - X dan Y dan saya perlu membuat kluster maksimum (dan optimal) = 5. Mari plot variabel yang ideal adalah seperti berikut: Saya ingin membuat 5 kelompok ini. Sesuatu seperti ini: Jadi saya pikir ini adalah model campuran dengan 5 kluster. Setiap kelompok memiliki titik pusat …

2
Nilai P sama dengan 0 dalam uji permutasi
Saya memiliki dua set data dan saya ingin tahu apakah mereka berbeda secara signifikan atau tidak (ini berasal dari " Dua kelompok berbeda secara signifikan? Tes untuk digunakan "). Saya memutuskan untuk menggunakan tes permutasi, melakukan hal berikut di R: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.