Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data




4
Bagaimana seseorang memverifikasi sebab-akibat?
Setelah kami menunjukkan bahwa dua kuantitas berkorelasi, bagaimana kita menyimpulkan bahwa hubungan itu kausal? Dan selanjutnya yang mana yang menyebabkan apa? Sekarang dalam teori kita dapat menggunakan "tugas acak" (apa pun kata yang tepat), untuk memutus ikatan kecelakaan yang mungkin ada di antara dua variabel. Tetapi dalam beberapa kasus ini …

2
Memilih simpul untuk GAM
Saat memilih jumlah simpul yang tepat untuk GAM, orang mungkin ingin mempertimbangkan jumlah data dan peningkatan pada sumbu x. Bagaimana jika kita memiliki 100 peningkatan pada sumbu x dengan 1000 titik data pada setiap kenaikan. Info di sini mengatakan: Jika tidak disediakan maka simpul spline ditempatkan secara merata di seluruh …
9 r  gam  splines 

1
Derivatif gradien dan vektor: vektor baris atau kolom?
Cukup banyak referensi (termasuk wikipedia, dan http://www.atmos.washington.edu/~dennis/MatrixCalculus.pdf dan http://michael.orlitzky.com/articles/the_derivative_of_a_quadratic_form.php ) mendefinisikan turunan dari suatu fungsi oleh vektor sebagai turunan parsial dari fungsi yang diatur dalam satu baris (jadi turunan dari fungsi yang dinilai skalar adalah vektor baris). Dalam konvensi ini, gradien dan turunan vektor adalah transpos satu sama lain. Manfaat …

4
Bagaimana data dihasilkan dalam kerangka Bayesian dan apa sifat pada parameter yang menghasilkan data?
Saya mencoba mempelajari kembali statistik Bayesian (setiap kali saya pikir saya akhirnya mendapatkannya, sesuatu yang lain muncul yang tidak saya pertimbangkan sebelumnya ....) tetapi tidak jelas (bagi saya) apa proses pembuatan data dalam Bayesian Framework sebenarnya. Kerangka kerja frequentist jelas bagi saya. Ada beberapa parameter "true" dan parameter itu menghasilkan …

1
Interpretasi kausalitas Granger menggunakan R
Saya memiliki tiga variabel ekonomi makro (ICS - sentimen konsumen, ER - tingkat pekerjaan, DGO - pesanan barang tahan lama) dan telah menjalankan tes kausalitas Granger dalam R pada mereka. Saya tidak benar-benar tahu bagaimana menafsirkan hasil tes Granger. Adakah yang bisa membantu saya memahami hasilnya? Saya tahu bahwa kami …

1
Over-fitting jaringan saraf
Saya telah belajar bahwa over-fitting dapat dideteksi dengan merencanakan kesalahan pelatihan dan kesalahan pengujian versus zaman. Seperti di: Saya telah membaca posting blog ini di mana mereka mengatakan jaringan saraf, net5 terlalu pas dan mereka memberikan angka ini: Yang aneh bagi saya, karena kesalahan validasi dan pelatihan dari net5 terus …

1
Bisakah kita memodelkan faktor-faktor non acak sebagai acak dalam desain bertingkat / hierarkis?
Perbedaan antara variabel yang benar-benar acak (yang harus dimodelkan seperti itu) dan variabel non-acak yang beberapa orang berpendapat dapat dimodelkan sebagai acak jika itu adalah model hierarkis / bertingkat, menjadi buram bagi saya. Bates dan Bolker mencontohkan efek acak dengan kasus keacakan benar, misalnya kualitas produk dalam sampel yang dipilih …


1
Apa perbedaan antara "standar emas" dan "kebenaran dasar"?
Apa perbedaan antara "standar emas" dan "kebenaran dasar"? Dua artikel wiki (yaitu, standar emas , dan kebenaran dasar ) menghubungkan kedua konsep satu sama lain dalam hal ketepatan / akurasi model. Itu satu kemungkinan. Tetapi saya juga menemukan bahwa konsep-konsep ini digunakan secara bergantian ketika berbicara tentang kumpulan data berlabel: …

1
Goodness of fit untuk data diskrit: pendekatan terbaik
Data: Untuk keperluan pertanyaan / komunikasi ini kita dapat mengasumsikan data tampak seperti rnbinom(1000,size=0.1,prob=0.01)dalam R, yang menghasilkan sampel acak dari 1.000 pengamatan dari distribusi binomial negatif (dengan size=0.1dan probabilitas keberhasilan prob=0.01). Ini adalah parametrization di mana variabel acak mewakili jumlah kegagalan sebelum sizejumlah keberhasilan. Ekornya panjang, dan 1.000 pengamatan tidak …

3
Cara terbaik untuk mengelompokkan matriks adjacency
Saya mengalami kesulitan menafsirkan cluster yang dihasilkan dari matriks adjacency. Saya memiliki 200 matriks yang relatif besar yang mewakili mata pelajaran yang berisi korelasi parsial (skor z) dari deret waktu (data saraf). Tujuannya adalah untuk mengelompokkan 210 matriks tersebut dan mendeteksi potensi komunitas yang belum ditemukan. Jadi saya melakukan perhitungan …

1
Kesetaraan antara model anova tindakan berulang dan model campuran: lmer vs lme, dan simetri majemuk
Saya memiliki beberapa kesulitan untuk mendapatkan hasil yang setara antara aovmodel tindakan berulang antara-dalam dan lmermodel campuran. Data dan skrip saya terlihat sebagai berikut data=read.csv("https://www.dropbox.com/s/zgle45tpyv5t781/fitness.csv?dl=1") data$id=factor(data$id) data id FITNESS TEST PULSE 1 1 pilates CYCLING 91 2 2 pilates CYCLING 82 3 3 pilates CYCLING 65 4 4 pilates CYCLING …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.