Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Bagaimana menangani kesalahan seperti "Koefisien: 14 tidak didefinisikan karena singularitas" dalam R?
Ketika melakukan GLM dan Anda mendapatkan kesalahan "tidak ditentukan karena singularitas" di output anova, bagaimana cara menangkal kesalahan ini terjadi? Beberapa orang berpendapat bahwa ini disebabkan oleh kolinearitas antara kovariat atau salah satu level tidak ada dalam dataset (lihat: menafsirkan "tidak ditentukan karena singularitas" dalam lm ) Jika saya ingin …

2
Normalisasi konstan dalam teorema Bayes
Saya membaca bahwa dalam aturan Bayes, penyebut dariPr ( data )Pr(data)\Pr(\textrm{data}) Pr ( parameter ∣ data ) = Pr ( data ∣ parameter ) Pr ( parameter )Pr ( data )Pr(parameter∣data)=Pr(data∣parameter)Pr(parameter)Pr(data)\Pr(\text{parameters} \mid \text{data}) = \frac{\Pr(\textrm{data} \mid \textrm{parameters}) \Pr(\text{parameters})}{\Pr(\text{data})} disebut konstanta normalisasi . Apa itu sebenarnya? Apa tujuannya? Mengapa terlihat seperti …

4
Memperbarui regresi linier secara efisien ketika menambahkan pengamatan dan / atau prediktor di R
Saya akan tertarik untuk menemukan cara dalam R untuk memperbarui model linier secara efisien ketika pengamatan atau prediktor ditambahkan. biglm memiliki kemampuan memperbarui ketika menambahkan pengamatan, tetapi data saya cukup kecil untuk berada di memori (walaupun saya memiliki sejumlah besar contoh untuk memperbarui). Ada cara untuk melakukan ini dengan tangan …

4
Cara menentukan hipotesis nol dalam pengujian hipotesis
Apa aturan praktis yang baik untuk bagaimana memilih pertanyaan untuk hipotesis nol. Misalnya, jika saya ingin memeriksa apakah hipotesis B benar, haruskah saya menggunakan B sebagai nol, B sebagai hipotesis alternatif, atau B bukan sebagai nol? Saya harap pertanyaannya jelas. Saya tahu bahwa ini ada hubungannya dengan kesalahan yang ingin …

5
Apakah ada kemungkinan lebih daripada Bayesianisme?
Sebagai seorang mahasiswa dalam bidang fisika, saya telah mengalami kuliah "Mengapa saya seorang Bayesian" mungkin setengah lusin kali. Itu selalu sama - presenter dengan sombong menjelaskan bagaimana penafsiran Bayesian lebih unggul daripada interpretasi yang sering digunakan oleh massa. Mereka menyebutkan aturan Bayes, marginalisasi, prior dan posteriors. Apa kisah sebenarnya? Apakah …

4
Pilihan penalti yang optimal untuk laso
Apakah ada hasil analitik atau makalah eksperimental mengenai pilihan optimal dari koefisien hukuman ℓ1ℓ1\ell_1 . Secara optimal , maksud saya parameter yang memaksimalkan probabilitas memilih model terbaik, atau yang meminimalkan kerugian yang diharapkan. Saya bertanya karena seringkali tidak praktis untuk memilih parameter dengan cross-validation atau bootstrap, baik karena sejumlah besar …

2
Menerapkan regresi logistik dengan tingkat kejadian yang rendah
Saya memiliki dataset di mana tingkat kejadiannya sangat rendah (40.000 dari ). Saya menerapkan regresi logistik untuk ini. Saya telah berdiskusi dengan seseorang di mana keluar bahwa regresi logistik tidak akan memberikan matriks kebingungan yang baik pada data tingkat kejadian yang rendah. Tetapi karena masalah bisnis dan cara mendefinisikannya, saya …
15 logistic 

2
Cara menghitung varians dari partisi variabel
Saya menjalankan eksperimen di mana saya mengumpulkan sampel (independen) secara paralel, saya menghitung varian masing-masing kelompok sampel dan sekarang saya ingin menggabungkan semua untuk menemukan varian total dari semua sampel. Saya mengalami kesulitan menemukan derivasi untuk ini karena saya tidak yakin dengan terminologi. Saya menganggapnya sebagai partisi dari satu RV. …
15 variance 

3
Bagaimana memplot output data clustering?
Saya mencoba mengelompokkan satu set data (satu set tanda) dan mendapat 2 kluster. Saya ingin menggambarkannya secara grafis. Agak bingung dengan representasi, karena saya tidak punya koordinat (x, y). Juga mencari fungsi MATLAB / Python untuk melakukannya. EDIT Saya pikir memposting data membuat pertanyaan menjadi lebih jelas. Saya punya dua …

3
CDF dinaikkan menjadi kekuatan?
Jika FZFZF_Z adalah CDF, sepertinya FZ(z)αFZ(z)αF_Z(z)^\alpha ( α>0α>0\alpha \gt 0 ) adalah CDF juga. T: Apakah ini hasil standar? T: Apakah ada cara yang baik untuk menemukan fungsi ggg dengan X≡g(Z)X≡g(Z)X \equiv g(Z) st FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alpha , di mana x≡g(z)x≡g(z) x \equiv g(z) Pada dasarnya, saya memiliki CDF lain …


2
Memahami k lag dalam uji R Dickey Fuller yang ditambah
Saya bermain-main dengan beberapa unit root testing di R dan saya tidak sepenuhnya yakin apa yang harus dilakukan dari parameter k lag. Saya menggunakan tes Dickey Fuller yang ditambah dan tes Philipps Perron dari paket tseries . Jelas parameter default (untuk ) hanya bergantung pada panjang seri. Jika saya memilih …
15 r  time-series  trend 


1
Apa definisi yang tepat dari "Kasus Heywood"?
Saya telah menggunakan istilah "Heywood Case" agak informal untuk merujuk pada situasi di mana estimasi respon terbatas yang diperbarui secara iteratif dari varians menjadi negatif karena masalah presisi numerik. (Saya menggunakan varian metode Welford untuk menambah data dan menghapus data yang lebih lama.) Saya mendapat kesan bahwa itu berlaku untuk …

3
Mengapa distribusi 0 dan standar deviasi 1 selalu digunakan?
Statistik saya telah diajarkan sendiri, tetapi banyak materi yang saya baca menunjuk ke dataset yang memiliki mean 0 dan standar deviasi 1. Jika demikian, maka: Mengapa 0 dan SD 1 berarti properti yang baik untuk dimiliki? Mengapa variabel acak yang diambil dari sampel ini sama dengan 0,5? Peluang menggambar 0,001 …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.