Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Apa artinya sampel vektor probabilitas dari distribusi Dirichlet?
Saya pada dasarnya belajar tentang Alokasi Dirichlet Laten. Saya menonton video di sini: http://videolectures.net/mlss09uk_blei_tm/ dan macet di menit 45 ketika dia mulai menjelaskan tentang pengambilan sampel dari distribusi. Saya juga mencoba membaca buku pembelajaran mesin yang tidak memiliki pengantar terperinci tentang distribusi Dirichelt. Dalam buku yang saya baca itu disebutkan …

1
Lasso pada Model Regresi Binomial Negatif
Apakah ada yang bisa saya lakukan LASSO dengan Regresi Binomial Negatif pada R? Saya melakukan regresi binomial negatif pada dataset saya karena data terlalu tersebar untuk memaksakan regresi poisson. Sementara itu, saya juga menghadapi beberapa masalah multikolinieritas. Saya sudah mencoba menggunakan glmnetdengan family = poisson, namun data tersebut tidak pas …

2
Rasio Kemungkinan untuk distribusi Eksponensial dua sampel
Membiarkan XXXdan menjadi dua variabel acak independen dengan masing-masing pdf:YYY f(x;θi)={1θie−x/θi0&lt;x&lt;∞,0&lt;θi&lt;∞0elsewheref(x;θi)={1θie−x/θi0&lt;x&lt;∞,0&lt;θi&lt;∞0elsewheref \left(x;\theta_i \right) =\begin{cases} \frac{1}{\theta_i} e^{-x/ {\theta_i}} \quad 0<x<\infty, 0<\theta_i< \infty \\ 0 \quad \text{elsewhere} \end{cases} untuk . Dua sampel indepedent diambil untuk menguji terhadap dengan ukuran dan dari distribusi ini. Saya perlu menunjukkan bahwa LRT dapat ditulis sebagai fungsi …

1
Bagaimana cara merancang eksperimen untuk Riset Pasar (dengan twist)?
Pertimbangkan jenis lelang di mana Anda dihadapkan dengan, katakanlah, 1000 calon klien. Berdasarkan informasi tentang calon pelanggan ini - usia, jenis kelamin, ras, pendapatan, prestasi pendidikan, dan sejenisnya - Anda dapat 'mengajukan tawaran' untuk menjual produk Anda ke sebagian kecil dari mereka, katakan 250. (Abaikan biaya penawaran.) Kepada memaksimalkan peluang …

2
Mengapa hanya nilai rata-rata yang digunakan dalam metode pengelompokan (K-means)?
Dalam metode pengelompokan seperti K-means , jarak euclidean adalah metrik yang digunakan. Akibatnya, kami hanya menghitung nilai rata-rata di dalam setiap kluster. Dan kemudian penyesuaian dilakukan pada elemen-elemen berdasarkan jarak mereka ke setiap nilai rata-rata. Saya bertanya-tanya mengapa fungsi Gaussian tidak digunakan sebagai metrik? Alih-alih menggunakan xi -mean(X), kita bisa …

1
Menjelaskan dekomposisi beveridge nelson
Adakah yang bisa menjelaskan cara kerja Dekomposisi Beveridge-Nelson? Sejauh ini yang saya tahu adalah memperkirakan siklus tren dalam data deret waktu non stasioner. Saya melihat beberapa artikel jurnal dan saya masih bingung tentang cara kerjanya http://research.economics.unsw.edu.au/jmorley/bn.pdf

1
Jumlah permutasi yang diperlukan untuk nilai p berbasis permutasi
Jika saya perlu menghitung berbasis permutasi ppp-nilai dengan tingkat signifikansi αα\alpha, berapa banyak permutasi yang saya butuhkan? Dari artikel "Tes Permutasi untuk Mempelajari Kinerja Classifier" , halaman 5: Dalam praktiknya, batas atas 1/(2k−−√)1/(2k)1/(2\sqrt{k}) biasanya digunakan untuk menentukan jumlah sampel yang diperlukan untuk mencapai ketelitian tes yang diinginkan. ... dimana kkk …

1
Bagaimana cara membandingkan pengulangan (ICC) dari berbagai kelompok?
Saya telah menghitung nilai-nilai ICC untuk dua kelompok dan sekarang ingin membandingkan nilai-nilai ICC untuk menentukan apakah kelompok-kelompok tersebut berbeda dalam pengulangannya. Dalam literatur orang hanya menggunakan uji-t untuk membandingkan pengulangan tetapi tidak jelas bagi saya bagaimana melakukan ini. Misalnya, dengan data dummy: ID gr day behaviour 1 1 1 …

2
Apakah koreksi Bonferroni terlalu anti-konservatif / liberal untuk beberapa hipotesis dependen?
Saya sering membaca bahwa koreksi Bonferroni juga berfungsi untuk hipotesis dependen. Namun, saya tidak berpikir itu benar dan saya punya contoh balasan. Dapatkah seseorang tolong beri tahu saya (a) di mana kesalahan saya atau (b) apakah saya benar dalam hal ini. Menyiapkan contoh penghitung Asumsikan kita sedang menguji dua hipotesis. …

1
Bagaimana dan mengapa MLP untuk klasifikasi berbeda dari MLP untuk regresi? Backpropagation dan fungsi transfer yang berbeda?
Saya menggunakan dua 3-layer feedforward multi-layer perceptrons (MLPs). Dengan data input yang sama (14 neuron input), saya melakukan satu klasifikasi (benar / salah), dan satu regresi (jika benar, "berapa banyak") ¹. Sampai sekarang, saya sudah malas menggunakan Matlabs patternnet dan fitnet , masing-masing. Lazily, karena saya belum meluangkan waktu untuk …


2
Uji chi-squared dengan 0 nilai yang diharapkan
Tabel kontingensi saya: heterozygous homozygous.minor homozygous.major observed 2 0 3 expected 0 0 5 Populasi yang diharapkan hanya terdiri dari genotipe AA, tetapi dalam populasi yang diamati kami mengamati 2 genotipe AB. Untuk menghitung Chi-sq untuk ini saya hanya akan mengabaikan dua kasus di mana yang diharapkan = 0? Jadi …

4
Kurtosis distribusi dibuat-buat
Lihatlah gambar di bawah ini. Garis biru menunjukkan pdf normal standar. Zona merah seharusnya sama dengan jumlah area abu-abu (maaf untuk gambar yang mengerikan). Saya ingin tahu, bisakah kita membuat distribusi baru dengan puncak yang lebih tinggi dengan menggeser zona abu-abu ke atas (zona merah) dari pdf normal? Jika transformasi …

2
Penyebab singularitas dalam matriks untuk regresi kuantil
Saya melakukan regresi kuantil dalam R menggunakan paket quantreg. Dataset saya mencakup 12.328 pengamatan mulai dari 0,12 hingga 330. Titik waktu untuk data saya tidak sepenuhnya berkelanjutan; semua data masuk ke dalam satu dari beberapa lusin tempat sampah mulai dari 73 hingga 397. Ketika saya melakukan regresi linier pada data …
8 r  regression 

1
Deviance vs Pearson, demi kebaikan
Saya mencoba untuk membuat model dengan menggunakan regresi binomial negatif (GLM binomial negatif). Saya memiliki ukuran sampel yang relatif kecil (lebih dari 300), dan data tidak diskalakan. Saya perhatikan bahwa ada dua cara untuk mengukur good of fit - satu penyimpangan dan yang lainnya adalah statistik Pearson. Bagaimana saya bisa …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.