Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Apa yang dilakukan perintah anova () dengan objek model lmer?
Mudah-mudahan ini adalah pertanyaan yang seseorang di sini dapat menjawab untuk saya tentang sifat dekomposisi jumlah kuadrat dari model efek campuran cocok dengan lmer(dari paket lme4 R). Pertama saya harus mengatakan bahwa saya menyadari kontroversi dengan menggunakan pendekatan ini, dan dalam praktiknya saya akan lebih cenderung menggunakan LRT bootstrap untuk …



2
lme dan lmer perbandingan
Saya bertanya-tanya apakah ada yang bisa memberi tahu saya tentang perbedaan saat ini antara kedua fungsi ini. Saya menemukan pertanyaan berikut: Bagaimana memilih perpustakaan nlme atau lme4 R untuk model efek campuran? , tapi itu berasal dari beberapa tahun yang lalu. Itu seumur hidup di lingkaran perangkat lunak. Pertanyaan spesifik …


8
Mata pelajaran matematika apa yang akan Anda sarankan untuk persiapan penambangan data dan pembelajaran mesin?
Saya mencoba menyusun kurikulum matematika mandiri untuk mempersiapkan pembelajaran penambangan data dan pembelajaran mesin. Ini dimotivasi dengan memulai kelas pembelajaran mesin Andrew Ng di Coursera dan merasa bahwa sebelum melanjutkan saya perlu meningkatkan keterampilan matematika saya. Saya lulus dari perguruan tinggi beberapa saat yang lalu sehingga aljabar dan statistik saya …



5
Data "eksplorasi" vs data "mengintai" / "menyiksa"?
Sering kali saya menemukan peringatan informal terhadap "pengintaian data" (inilah salah satu contoh yang lucu ), dan saya pikir saya memiliki ide intuitif tentang kira-kira apa artinya itu, dan mengapa itu mungkin menjadi masalah. Di sisi lain, "analisis data eksplorasi" tampaknya menjadi prosedur yang sangat terhormat dalam statistik, setidaknya dinilai …

4
Teknik pembelajaran mesin untuk string parsing?
Saya memiliki banyak string alamat: 1600 Pennsylvania Ave, Washington, DC 20500 USA Saya ingin mengurai mereka menjadi komponen-komponen mereka: street: 1600 Pennsylvania Ave city: Washington province: DC postcode: 20500 country: USA Tetapi tentu saja datanya kotor: itu berasal dari banyak negara dalam banyak bahasa, ditulis dengan cara yang berbeda, mengandung …

4
Cara melakukan pengurangan dimensionalitas dengan PCA di R
Saya memiliki dataset besar dan saya ingin melakukan pengurangan dimensionalitas. Sekarang di mana-mana saya membaca bahwa saya dapat menggunakan PCA untuk ini. Namun, saya masih belum mendapatkan apa yang harus dilakukan setelah menghitung / melakukan PCA. Dalam R ini mudah dilakukan dengan perintah princomp. Tetapi apa yang harus dilakukan setelah …
30 r  pca 

3
Rekomendasi untuk jurnal open-source peer-review?
Saya memiliki sebuah manuskrip tentang metode bootstrap untuk menguji hipotesis satu mean, dan saya ingin mengirimkannya untuk publikasi, tetapi saya memiliki dilema moral. Saya telah menandatangani protes terhadap Elsevier untuk praktik bisnis mereka yang tidak etis, dan membaca seluruh masalah itu benar-benar membuat saya mempertanyakan etika jurnal akademik nirlaba lainnya. …

3
Cara menentukan kualitas classifier multiclass
Diberikan dataset dengan instance xsayaxsayax_i bersama dengan kelas mana setiap instance persis milik satu kelasx i y iNNNxsayaxsayax_iysayaysayay_i classifier multiclass Setelah pelatihan dan pengujian saya pada dasarnya memiliki tabel dengan benar kelas dan diprediksi kelas untuk setiap instance dalam tes set. Jadi untuk setiap contoh saya memiliki kecocokan ( ) …


1
Intuisi di balik interaksi produk tensor dalam GAM (paket MGCV dalam R)
Model aditif umum adalah yang mana y=α+f1(x1)+f2(x2)+eiy=α+f1(x1)+f2(x2)+ei y = \alpha + f_1(x_1) + f_2(x_2) + e_i misalnya. fungsinya halus, dan diperkirakan. Biasanya dengan splines dihukum. MGCV adalah paket dalam R yang melakukannya, dan penulis (Simon Wood) menulis buku tentang paketnya dengan contoh-contoh R. Ruppert, dkk. (2003) menulis buku yang jauh …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.