Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Haruskah saya khawatir bahwa daya uji-t relatif kecil ketika H0 sudah ditolak?
Saya punya dua sampel yang sangat kecil ( untuk masing-masing) dan saya mendapatkan dua sampel uji-t untuk mereka 0,49, yang relatif kecil (dihitung dengan R ). Namun, uji-t Welch Two Sample memberikan nilai-p sini, sehingga hipotesis nol dapat ditolak.n = 7n=7n=7power.t.test()0,0320.0320.032 Sekarang haruskah saya khawatir bahwa kekuatannya kecil? Pemahaman saya …


1
Apakah distribusi binomial memiliki varians sekecil mungkin di antara semua distribusi "masuk akal" yang dapat memodelkan pemilihan biner?
Bayangkan sebuah pemilihan di mana orang membuat pilihan biner: mereka memilih A atau menentangnya. Hasilnya adalah bahwa orang memilih untuk A, dan hasilnya A adalah .nnnmmmp = m / np=m/np=m/n Jika saya ingin memodelkan pemilihan ini, saya dapat mengasumsikan bahwa setiap orang memilih A secara independen dengan probabilitas , yang …

1
Definisi tepat dari Maxout
Saya sudah mencoba mencari tahu apa sebenarnya yang dimaksud dengan fungsi aktivasi "Maxout" di jaringan saraf. Ada pertanyaan ini , makalah ini , dan bahkan dalam buku Deep Learning oleh Bengio et al. , kecuali hanya dengan sedikit informasi dan TODO besar di sebelahnya. Saya akan menggunakan notasi yang dijelaskan …

2
Simulasikan dari Kernel Density Estimate (empiris PDF)
Saya memiliki vektor Xdari N=900pengamatan yang terbaik dimodelkan oleh estimator bandwidth yang global yang kepadatan Kernel (model parametrik, termasuk model campuran yang dinamis, ternyata tidak menjadi cocok baik): Sekarang, saya ingin mensimulasikan dari KDE ini. Saya tahu ini bisa dicapai dengan bootstrap. Dalam R, semuanya bermuara pada baris kode sederhana …

1
Apa yang setara dengan cdf dari MCMC untuk pdf?
Dalam hubungannya dengan pertanyaan yang Divalidasi Lintas dalam mensimulasikan dari kopula tertentu, yaitu, multivarian cdf didefinisikan pada , saya mulai bertanya-tanya tentang gambar yang lebih besar, yaitu bagaimana, ketika diberikan fungsi seperti itu, dapatkah seseorang mencari algoritma umum untuk disimulasikan dari distribusi probabilitas yang sesuai?C(u1,…,uk)C(u1,…,uk)C(u_1,\ldots,u_k)[0,1]k[0,1]k[0,1]^k Jelas, salah satu solusi adalah …

2
Unsur-unsur alternatif Pembelajaran Statistik
Elemen Pembelajaran Statistik (ESL) adalah buku yang memiliki luas dan kedalaman fantastis. Ini mencakup penting untuk metode yang sangat modern dengan mengutip makalah di mana studi asli ini terjadi. Namun, saya benar-benar menemukan bahasa buku itu sangat sangat mahal. Saya percaya ada cara yang lebih mudah untuk membahas konsep. Saya …

1
Memvisualisasikan PCA dalam R: titik data, vektor eigen, proyeksi, elips kepercayaan
Saya memiliki dataset 17 orang, peringkat 77 pernyataan. Saya ingin mengekstraksi komponen-komponen utama pada matriks korelasi transposisi korelasi antara orang (sebagai variabel) di seluruh pernyataan (sebagai kasus). Aku tahu, itu aneh, itu disebut Q Metodologi . Saya ingin menggambarkan bagaimana PCA bekerja dalam konteks ini, dengan mengekstraksi dan memvisualisasikan nilai …

1
Apa cara terbaik untuk memvisualisasikan regresi perbedaan-dalam-perbedaan (multi-periode)?
Apa cara terbaik untuk memvisualisasikan perbedaan-dalam-perbedaan untuk pengobatan biner dan berkelanjutan? Apakah saya regresi variabel hasil pada set kontrol tetapi mengecualikan variabel pengobatan dan plot residu di setiap kelompok (kasus biner)? Apakah ada cara untuk melihat "dinamika" dari parameter ATE dari waktu ke waktu? Saya ingin menunjukkan bahwa asumsi tren …

1
Mengapa Lucene IDF memiliki +1 yang tampaknya tambahan?
Dari dokumen Lucene IDF=1+log(numDocsdocFreq+1)IDF=1+log⁡(numDocsdocFreq+1)\text{IDF} = 1 + \log\left(\frac{\text{numDocs}}{\text{docFreq}+1}\right) Dalam referensi lain (mis. Wikipedia ), IDF biasanya dihitung sebagai atau untuk menghindari menyelam oleh 0.log(numDocsdocFreq)log⁡(numDocsdocFreq)\log\left(\frac{\text{numDocs}}{\text{docFreq}}\right)catatan(numDocsdocFreq + 1)catatan⁡(numDocsdocFreq+1)\log\left(\frac{\text{numDocs}}{\text{docFreq}+1}\right) Saya juga menyadari Lucene menggunakan daripada untuk menghitung TF, tetapi pemahaman saya adalah bahwa ini hanya transformasi yang disukai, mungkin untuk menghindari .x--√x\sqrt{x}catatan( x …


1
Mekanik di balik penyimpangan dari distribusi acak
Sistem yang kami kerjakan bersifat biologis, lebih khusus lagi distribusi peristiwa kerusakan DNA terprogram di seluruh kromosom. Ini dapat dianggap sebagai array 1D (kromosom) di mana titik dapat dipilih (situs kerusakan yang disengaja). Kami telah memetakan posisi peristiwa-peristiwa ini secara eksperimental dan pada awalnya bertanya apakah mereka cocok dengan distribusi …

1
Regulasi dan proyeksi ke
Saya mencoba memahami bagaimana regularisasi bekerja dalam hal proyeksi ke a l∗l∗l_* bola, dan proyeksi Euclidean ke simpleks. Saya tidak yakin saya mengerti apa yang kami maksud ketika kami memproyeksikan vektor bobot ke l1l1l_1 atau l2l2l_2 bola. Saya bisa mengerti konsep l1l1l_1program regularisasi, seperti dalam, kita pergi melalui setiap elemen …

2
Bagaimana seseorang menggunakan teorema Bayes dengan prior sebelumnya?
Jika prior saya dimodelkan sebagai distribusi probabilitas kontinu, katakanlah, distribusi beta condong untuk mencerminkan bias saya terhadap model-model tertentu, bagaimana saya bisa menghitung probabilitas posterior? Tantangan bagi saya adalah menghitung probabilitas model yang diberikan, karena distribusi kontinu hanya akan memberi saya perkiraan untuk interval . Tolong maafkan kenaifan pertanyaan, Saya …
8 bayesian  prior 

2
Mengapa melaporkan R kuadrat?
Jika R kuadrat yang disesuaikan lebih baik daripada R kuadrat, lalu mengapa perangkat lunak statistik terus melaporkan yang terakhir? Apakah ada situasi ketika peneliti lebih suka menggunakan R kuadrat daripada R kuadrat yang disesuaikan?

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.