Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


1
Apakah ada analisis Faktor atau PCA untuk data ordinal atau biner?
Saya telah menyelesaikan analisis komponen utama (PCA), analisis faktor eksploratori (EFA), dan analisis faktor konfirmatori (CFA), memperlakukan data dengan skala likert (respons 5 tingkat: tidak ada, sedikit, beberapa, ..) sebagai berkelanjutan variabel. Kemudian, menggunakan Lavaan, saya mengulangi CFA mendefinisikan variabel sebagai kategori. Saya ingin tahu jenis analisis apa yang cocok …


4
Ekstrapolasi v. Interpolasi
Apa perbedaan antara ekstrapolasi dan interpolasi, dan apa cara paling tepat untuk menggunakan istilah-istilah ini? Sebagai contoh, saya telah melihat pernyataan dalam makalah yang menggunakan interpolasi sebagai: "Prosedur menginterpolasi bentuk perkiraan fungsi antara titik-titik bin" Kalimat yang menggunakan ekstrapolasi dan interpolasi adalah, misalnya: Langkah sebelumnya di mana kita mengekstrapolasi fungsi …

2
Kebisingan Putih dalam Statistik
Saya sering melihat istilah white noise muncul ketika membaca tentang model statistik yang berbeda. Namun saya harus mengakui, bahwa saya tidak sepenuhnya yakin apa artinya ini. Biasanya disingkat WN( 0 , σ2)WN(0,σ2)WN(0,σ^2) . Apakah itu berarti didistribusikan secara normal atau dapatkah ia mengikuti distribusi apa pun?

3
Brain-teaser: Berapa panjang yang diharapkan dari urutan iid yang meningkat secara monoton ketika ditarik dari distribusi seragam [0,1]?
Ini adalah pertanyaan wawancara untuk posisi analis kuantitatif, dilaporkan di sini . Misalkan kita menggambar dari distribusi yang seragam dan gambarnya adalah id, berapa panjang yang diharapkan dari distribusi yang meningkat secara monoton? Yaitu, kita berhenti menggambar jika undian saat ini lebih kecil dari atau sama dengan undian sebelumnya.[0,1][0,1][0,1] Saya …

1
Seberapa salahkah model regresi ketika asumsi tidak terpenuhi?
Ketika memasang model regresi, apa yang terjadi jika asumsi output tidak terpenuhi, khususnya: Apa yang terjadi jika residunya tidak bersifat homoseksual? Jika residu menunjukkan pola meningkat atau menurun pada Residual vs Fitted plot. Apa yang terjadi jika residu tidak terdistribusi secara normal, dan gagal dalam tes Shapiro-Wilk? Uji normalitas Shapiro-Wilk …

1
Perkiraan fungsi Kehilangan XGBoost Dengan Ekspansi Taylor
Sebagai contoh, ambil fungsi objektif dari model XGBoost pada iterasi :ttt L(t)=∑i=1nℓ(yi,y^(t−1)i+ft(xi))+Ω(ft)L(t)=∑i=1nℓ(yi,y^i(t−1)+ft(xi))+Ω(ft)\mathcal{L}^{(t)}=\sum_{i=1}^n\ell(y_i,\hat{y}_i^{(t-1)}+f_t(\mathbf{x}_i))+\Omega(f_t) di mana adalah fungsi kerugian, adalah keluaran pohon ke - dan adalah regularisasi. Salah satu (banyak) langkah utama untuk perhitungan cepat adalah perkiraan:ℓℓ\ellftftf_ttttΩΩ\Omega L(t)≈∑i=1nℓ(yi,y^(t−1)i)+gtft(xi)+12hif2t(xi)+Ω(ft),L(t)≈∑i=1nℓ(yi,y^i(t−1))+gtft(xi)+12hift2(xi)+Ω(ft),\mathcal{L}^{(t)}\approx \sum_{i=1}^n\ell(y_i,\hat{y}_i^{(t-1)})+g_tf_t(\mathbf{x}_i)+\frac{1}{2}h_if_t^2(\mathbf{x}_i)+\Omega(f_t), di mana dan adalah turunan pertama dan kedua dari fungsi loss.gigig_ihihih_i Yang saya …

2
Mengapa nilai-p menyesatkan setelah melakukan seleksi bertahap?
Mari kita pertimbangkan misalnya model regresi linier. Saya mendengar bahwa, dalam penambangan data, setelah melakukan seleksi bertahap berdasarkan kriteria AIC, adalah keliru untuk melihat nilai-p untuk menguji hipotesis nol bahwa setiap koefisien regresi yang benar adalah nol. Saya mendengar bahwa orang harus mempertimbangkan semua variabel yang tersisa dalam model memiliki …


1
Mengapa derivasi saya dari solusi laso bentuk tertutup salah?
Masalah laso βlasso=argminβ∥y−Xβ∥22+α∥β∥1βlasso=argminβ⁡‖y−Xβ‖22+α‖β‖1\beta^{\text{lasso}}= \operatorname*{argmin}_\beta \| y-X\beta\|^2_2 + \alpha \| \beta\|_1 memiliki solusi bentuk tertutup: βlassoj=sgn(βLSj)(|βLSj|−α)+βjlasso=sgn(βjLS)(|βjLS|−α)+ \beta_j^{\text{lasso}}= \mathrm{sgn}(\beta^{\text{LS}}_j)(|\beta_j^{\text{LS}}|-\alpha)^+ jika XXX memiliki kolom ortonormal. Ini ditunjukkan di utas ini: Penurunan solusi bentuk laso tertutup . Namun saya tidak mengerti mengapa tidak ada solusi formulir tertutup pada umumnya. Menggunakan subdifferensial saya memperoleh yang …


7
Konsep statistik untuk menjelaskan mengapa Anda cenderung untuk membalik jumlah kepala yang sama dengan ekor, karena jumlah flips meningkat?
Saya sedang bekerja mempelajari probabilitas dan statistik dengan membaca beberapa buku dan menulis beberapa kode, dan sambil mensimulasikan koin membalik saya perhatikan sesuatu yang menurut saya sedikit berlawanan dengan intuisi naif seseorang. Jika Anda membalik koin yang adil kali, rasio kepala ke ekor bertemu ke arah 1 saat meningkat, persis …


1
Membandingkan dendrogram pengelompokan hierarkis yang diperoleh dengan jarak & metode yang berbeda
[Judul awal "Pengukuran kesamaan untuk hierarki pohon clustering" kemudian diubah oleh @ttnphns untuk lebih mencerminkan topik] Saya melakukan sejumlah analisis kluster hierarkis pada kerangka data catatan pasien (misalnya mirip dengan http://www.biomedcentral.com/1471-2105/5/126/figure/F1?highres=y ) Saya bereksperimen dengan langkah-langkah jarak yang berbeda, bobot parameter yang berbeda dan metode hierarkis yang berbeda , untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.