Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



3
Bagaimana saya bisa menguji apakah pengelompokan data biner saya signifikan
Saya sedang melakukan analisis keranjang belanja dataset saya adalah kumpulan vektor transaksi, dengan item-item produk yang dibeli. Ketika menerapkan k-means pada transaksi, saya akan selalu mendapatkan beberapa hasil. Matriks acak mungkin juga akan menampilkan beberapa kluster. Apakah ada cara untuk menguji apakah pengelompokan yang saya temukan adalah signifikan, atau itu …

4
Seberapa besar sampel untuk teknik estimasi dan parameter yang diberikan?
Apakah ada aturan praktis atau bahkan cara apa pun untuk mengetahui seberapa besar sampel dalam rangka memperkirakan model dengan sejumlah parameter tertentu? Jadi, misalnya, jika saya ingin memperkirakan regresi kuadrat-terkecil dengan 5 parameter, seberapa besar seharusnya sampel itu? Apakah penting teknik estimasi apa yang Anda gunakan (mis. Kemungkinan maksimum, kuadrat …

1
Bagaimana menemukan titik sampel yang memiliki rasio outlier besar yang bermakna secara statistik antara dua nilai titik?
Sebagai contoh aplikasi, pertimbangkan dua properti berikut pengguna Stack Overflow: reputasi dan jumlah tampilan profil . Diharapkan bahwa bagi sebagian besar pengguna, kedua nilai tersebut akan proporsional: pengguna tingkat tinggi menarik lebih banyak perhatian dan karenanya mendapatkan lebih banyak tampilan profil. Karena itu, menarik untuk mencari pengguna yang memiliki banyak …
12 ratio 

1
Apa yang ditunjukkan oleh grafik autokorelasi (panda)?
Saya seorang pemula dan saya mencoba memahami apa yang ditunjukkan grafik autokorelasi. Saya telah membaca beberapa penjelasan dari sumber yang berbeda seperti halaman ini atau halaman Wikipedia terkait yang tidak saya kutip di sini. Saya memiliki kode yang sangat sederhana ini, di mana saya memiliki tanggal dalam indeks saya selama …

1
Pemahaman awam tentang perbedaan antara penyesuaian pintu belakang dan pintu depan
Saya mengacu pada penyesuaian pintu belakang dan penyesuaian pintu depan di sini : Penyesuaian pintu belakang : Masalah epidemiologis pola dasar dalam statistik adalah menyesuaikan efek pengacau yang terukur. Kriteria pintu belakang Pearl menggeneralisasikan ide ini. Penyesuaian pintu depan : Jika beberapa variabel tidak teramati maka kita mungkin perlu menggunakan …
12 causality  dag 

2
Seberapa dalam hubungan antara fungsi softmax dalam ML dan distribusi Boltzmann dalam termodinamika?
Fungsi softmax, yang biasa digunakan dalam jaringan saraf untuk mengubah bilangan real menjadi probabilitas, adalah fungsi yang sama dengan distribusi Boltzmann, distribusi probabilitas atas energi untuk ensembel partikel dalam kesetimbangan termal pada suhu T yang diberikan dalam termodinamika. Saya dapat melihat beberapa alasan heuristik yang jelas mengapa ini praktis: Tidak …

2
Mengapa kita tidak menggunakan rata-rata aritmatika tertimbang alih-alih rata-rata harmonik?
Saya bertanya-tanya apa nilai intrinsik dari penggunaan rata-rata harmonik (misalnya untuk menghitung ukuran-F), yang bertentangan dengan rata-rata aritmatika tertimbang dalam menggabungkan presisi dan daya ingat? Saya berpikir bahwa rata-rata aritmatika tertimbang dapat memainkan peran rata-rata harmonik, atau apakah saya melewatkan sesuatu?


4
Seberapa berarti hubungan antara MLE dan lintas entropi dalam pembelajaran yang mendalam?
Saya mengerti bahwa diberikan satu set pengamatan independen yang Maximum Likelihood Estimator (atau, sama, MAP dengan datar / seragam sebelumnya) yang mengidentifikasi parameter yang menghasilkan distribusi Model p_ {Model} \ kiri (\, \ cdot \,; \ mathbf {θ} \ kanan) yang paling cocok dengan pengamatan itu adalahmmmO={o(1),...,o(m)}O={o(1),...,o(m)}\mathbb{O}=\{\mathbf{o}^{(1)}, . . . …



2
Teori di balik argumen bobot dalam R saat menggunakan lm ()
Setelah satu tahun di sekolah pascasarjana, pemahaman saya tentang "kuadrat terkecil tertimbang" adalah sebagai berikut: biarkan y∈Rny∈Rn\mathbf{y} \in \mathbb{R}^n , XX\mathbf{X} menjadi beberapa matriks desain n×pn×pn \times p , menjadi parameter vektor, \ boldsymbol \ epsilon \ in \ mathbb {R} ^ n menjadi vektor kesalahan sedemikian rupa sehingga \ …

1
Transformasi kepadatan probabilitas yang berbeda karena faktor Jacobian
Dalam Pengenalan Pola Bishop dan Pembelajaran Mesin saya membaca yang berikut, tepat setelah kerapatan probabilitas diperkenalkan:p ( x ∈ ( a , b ) ) = ∫bSebuahp ( x ) d xp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x Di bawah perubahan variabel nonlinier, kepadatan probabilitas berubah secara berbeda dari fungsi sederhana, karena faktor Jacobian. Sebagai contoh, …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.