Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Howler disebabkan oleh penggunaan regresi bertahap
Saya menyadari masalah pemilihan stepwise / forward / backward dalam model regresi. Ada banyak kasus para peneliti yang mengecam metode ini dan menunjukkan alternatif yang lebih baik. Saya penasaran apakah ada cerita yang ada tempat analisis statistiknya: telah menggunakan regresi bertahap; membuat beberapa kesimpulan penting berdasarkan model akhir kesimpulannya salah, …

1
Bisakah MCMC adaptif dipercaya?
Saya membaca tentang MCMC adaptif (lihat misalnya, Bab 4 dari Handbook of Markov Chain Monte Carlo , ed. Brooks et al., 2011; dan juga Andrieu & Thoms, 2008 ). Hasil utama dari Roberts dan Rosenthal (2007) adalah bahwa jika skema adaptasi memenuhi kondisi adaptasi menghilang (ditambah beberapa teknis lainnya), MCMC …

6
Menyelesaikan matriks korelasi 3x3: dua koefisien dari tiga yang diberikan
Saya ditanya pertanyaan ini dalam sebuah wawancara. Katakanlah kita memiliki matriks korelasi dalam bentuk ⎡⎣⎢10.60.80.61γ0.8γ1⎤⎦⎥[10.60.80.61γ0.8γ1]\begin{bmatrix}1&0.6&0.8\\0.6&1&\gamma\\0.8&\gamma&1\end{bmatrix} Saya diminta untuk menemukan nilai gamma, mengingat matriks korelasi ini. Saya pikir saya bisa melakukan sesuatu dengan nilai eigen, karena semuanya harus lebih besar dari atau sama dengan 0. (Matriks semidefinite positif) - tetapi saya …

3
Melakukan statistik yang benar di lingkungan kerja?
Saya tidak yakin dari mana pertanyaan ini berasal: Cross Validated, atau The Workplace. Tapi pertanyaan saya agak terkait dengan statistik. Pertanyaan ini (atau saya kira pertanyaan) muncul selama saya bekerja sebagai "magang ilmu data". Saya sedang membangun model regresi linier ini dan memeriksa plot residual. Saya melihat tanda heteroskedastisitas yang …
20 careers 

2
Bukti bahwa F-statistik mengikuti distribusi-F
Mengingat pertanyaan ini: Bukti bahwa koefisien dalam model OLS mengikuti distribusi-t dengan derajat kebebasan (nk) Saya ingin sekali memahami alasannya F=(TSS−RSS)/(p−1)RSS/(n−p),F=(TSS−RSS)/(p−1)RSS/(n−p), F = \frac{(\text{TSS}-\text{RSS})/(p-1)}{\text{RSS}/(n-p)}, di mana ppp adalah jumlah parameter model dan nnn jumlah observasi dan TSSTSSTSS total varians, RSSRSSRSS varian residual, mengikuti Fp−1,n−pFp−1,n−pF_{p-1,n-p} distribusi. Saya harus mengakui bahwa saya …

1
Proses gaussian wavelet-domain: apa itu kovarians?
Saya telah membaca Maraun et al , "Proses Gaussian Non-stasioner dalam domain wavelet: Sintesis, estimasi, dan pengujian signifikan" (2007) yang mendefinisikan kelas dokter non-stasioner yang dapat ditentukan oleh pengganda dalam domain wavelet. Realisasi dari salah satu GP tersebut adalah: mana adalah white noise, adalah transformasi wavelet kontinu sehubungan dengan wavelet …

1
Bagaimana kita bisa mensimulasikan dari campuran geometris?
Jika f1, ... , fkf1,…,fkf_1,\ldots,f_k kepadatan diketahui dari mana saya dapat mensimulasikan, yaitu, yang algoritma tersedia. dan jika produk ∏i = 1kfsaya( x )αsayaα1, ... , αk> 0∏i=1kfi(x)αiα1,…,αk>0\prod_{i=1}^k f_i(x)^{\alpha_i}\qquad \alpha_1,\ldots,\alpha_k>0 dapat diintegrasikan, apakah ada pendekatan umum untuk mensimulasikan dari kepadatan produk ini menggunakan simulator darifsayafif_i ?


4
Apa perbedaan antara belajar dan mengambil kesimpulan?
Makalah penelitian pembelajaran mesin sering memperlakukan pembelajaran dan inferensi sebagai dua tugas yang terpisah, tetapi tidak cukup jelas bagi saya apa perbedaannya. Dalam buku ini misalnya mereka menggunakan statistik Bayesian untuk kedua jenis tugas, tetapi tidak memberikan motivasi untuk perbedaan itu. Saya punya beberapa ide yang tidak jelas tentang apa …

3
Untuk memaksimalkan peluang menebak dengan benar hasil flip koin, haruskah saya selalu memilih hasil yang paling mungkin?
Ini bukan pekerjaan rumah. Saya tertarik untuk memahami apakah logika saya benar dengan masalah statistik sederhana ini. Katakanlah saya memiliki koin 2 sisi di mana kemungkinan membalik kepala adalah P(H)P(H)P(H) dan probabilitas membalik ekor adalah 1−P(H)1−P(H)1-P(H) . Mari kita asumsikan semua flips memiliki probabilitas independen. Sekarang, katakanlah saya ingin memaksimalkan …

3
Mengapa AUC = 1 bahkan classifier telah salah mengklasifikasikan setengah dari sampel?
Saya menggunakan classifier yang mengembalikan probabilitas. Untuk menghitung AUC, saya menggunakan paket-pROC. Probabilitas keluaran dari classifier adalah: probs=c(0.9865780, 0.9996340, 0.9516880, 0.9337157, 0.9778576, 0.8140116, 0.8971550, 0.8967585, 0.6322902, 0.7497237) probsmenunjukkan kemungkinan berada di kelas '1'. Seperti yang ditunjukkan, classifier telah mengklasifikasikan semua sampel di kelas '1'. Vektor label sejati adalah: truel=c(1, 1, …


4
Pengkodean Data Sudut untuk Jaringan Saraf Tiruan
Saya melatih jaringan saraf (detail tidak penting) di mana data target adalah vektor sudut (antara 0 dan 2 * pi). Saya mencari saran tentang cara menyandikan data ini. Inilah yang sedang saya coba (dengan kesuksesan terbatas): 1) Pengodean 1-of-C: I bin pengaturan kemungkinan sudut menjadi 1000 atau lebih sudut diskrit …

9
Bagaimana kita tahu bahwa kemungkinan rolling 1 dan 2 adalah 1/18?
Sejak kelas probabilitas pertama saya, saya bertanya-tanya tentang yang berikut ini. Menghitung probabilitas biasanya diperkenalkan melalui rasio "peristiwa yang disukai" dengan total peristiwa yang mungkin terjadi. Dalam hal menggulirkan dua dadu 6 sisi, jumlah peristiwa yang mungkin adalah , seperti yang ditampilkan dalam tabel di bawah ini.363636 1234561(1,1)(2,1)(3,1)(4,1)(5,1)(6,1)2(1,2)(2,2)(3,2)(4,2)(5,2)(6,2)3(1,3)(2,3)(3,3)(4,3)(5,3)(6,3)4(1,4)(2,4)(3,4)(4,4)(5,4)(6,4)5(1,5)(2,5)(3,5)(4,5)(5,5)(6,5)6(1,6)(2,6)(3,6)(4,6)(5,6)(6,6)1234561(1,1)(1,2)(1,3)(1,4)(1,5)(1,6)2(2,1)(2,2)(2,3)(2,4)(2,5)(2,6)3(3,1)(3,2)(3,3)(3,4)(3,5)(3,6)4(4,1)(4,2)(4,3)(4,4)(4,5)(4,6)5(5,1)(5,2)(5,3)(5,4)(5,5)(5,6)6(6,1)(6,2)(6,3)(6,4)(6,5)(6,6)\begin{array} {|c|c|c|c|c|c|c|} \hline …
20 probability  dice 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.