Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Apakah setiap matriks korelasi pasti positif?
Saya berbicara di sini tentang matriks korelasi Pearson. Saya sering mendengarnya mengatakan bahwa semua matriks korelasi harus semidefinit positif. Pemahaman saya adalah bahwa matriks pasti positif harus memiliki nilai eigen , sedangkan matriks semidefinit positif harus memiliki nilai eigen . Ini membuat saya berpikir bahwa pertanyaan saya dapat diulangi sebagai …

1
Apa pro dan kontra dari penerapan informasi timbal balik secara langsung pada matriks kata cooccurrence sebelum SVD?
Salah satu cara untuk menghasilkan embeddings kata adalah sebagai berikut ( mirror ): Dapatkan kopral, misalnya "Saya menikmati terbang. Saya suka NLP. Saya suka belajar dalam-dalam." Bangun kata cooccurrence matrix dari itu: Lakukan SVD pada , dan pertahankan kolom pertama U.XXXkkk Setiap baris submatrix akan menjadi kata embedding dari kata …




1
Metodologi bootstrap. Mengapa melakukan resample “dengan penggantian” alih-alih subsampling acak?
Metode bootstrap telah melihat difusi besar dalam beberapa tahun terakhir, saya juga banyak menggunakannya, terutama karena alasan di balik ini cukup intuitif. Tapi itu satu hal yang saya tidak mengerti. Mengapa Efron memilih untuk melakukan resample dengan penggantian alih-alih hanya subsampling dengan secara acak memasukkan atau tidak termasuk pengamatan tunggal? …


1
Fungsi Kerugian Deviance Binomial Scikit
Ini adalah fungsi kerugian penyimpangan binomial scikit GradientBoosting, def __call__(self, y, pred, sample_weight=None): """Compute the deviance (= 2 * negative log-likelihood). """ # logaddexp(0, v) == log(1.0 + exp(v)) pred = pred.ravel() if sample_weight is None: return -2.0 * np.mean((y * pred) - np.logaddexp(0.0, pred)) else: return (-2.0 / sample_weight.sum() …

2
Cara mensimulasikan data yang disensor
Saya bertanya-tanya bagaimana saya bisa mensimulasikan sampel dari masa distribusi Weibull yang mencakup pengamatan tipe-kanan I. Misalnya, mari kita memiliki n = 3, bentuk = 3, skala = 1 dan tingkat sensor = .15, dan waktu sensor = .88. Saya tahu cara membuat sampel Weibull tapi saya tidak tahu cara …


1
Bagaimana menafsirkan plot kotak berlekuk
Sambil melakukan beberapa EDA saya memutuskan untuk menggunakan plot kotak untuk menggambarkan perbedaan antara dua tingkat faktor. Cara ggplot membuat plot kotak cukup memuaskan, tetapi sedikit sederhana (plot pertama di bawah). Sementara meneliti karakteristik plot kotak saya mulai bereksperimen dengan takik. Saya mengerti takik menampilkan CI di sekitar median, dan …

3
Rantai Markov vs. HMM
Rantai Markov masuk akal bagi saya, saya bisa menggunakannya untuk memodelkan perubahan keadaan probabilistik dalam masalah kehidupan nyata. Lalu datanglah HMM. HMM dikatakan lebih cocok untuk memodelkan banyak masalah daripada MC. Namun, masalah yang orang sebutkan agak rumit untuk dipahami seperti pemrosesan ucapan. Jadi pertanyaan saya adalah dapatkah Anda menggambarkan …

1
Bisakah saya menggunakan ReLU di autoencoder sebagai fungsi aktivasi?
Ketika menerapkan autoencoder dengan jaringan saraf, kebanyakan orang akan menggunakan sigmoid sebagai fungsi aktivasi. Bisakah kita menggunakan ReLU saja? (Karena ReLU tidak memiliki batas pada batas atas, pada dasarnya berarti gambar input dapat memiliki pixel lebih besar dari 1, tidak seperti kriteria terbatas untuk autoencoder ketika sigmoid digunakan).

2
Mengapa fungsi stl memberikan variasi musiman yang signifikan dengan data acak
Saya diplot dengan kode berikut dengan fungsi stl (Seasonal Decomposition of Time Series by Loess): plot(stl(ts(rnorm(144), frequency=12), s.window="periodic")) Ini menunjukkan variasi musiman yang signifikan dengan data acak dimasukkan ke dalam kode di atas (fungsi rnorm). Variasi yang signifikan terlihat setiap kali dijalankan, meskipun polanya berbeda. Dua pola tersebut ditunjukkan di …

2
Bisakah meningkat ketika
Jika β∗=argminβ∥y−Xβ∥22+λ∥β∥1β∗=argminβ‖y−Xβ‖22+λ‖β‖1\beta^*=\mathrm{arg\,min}_{\beta} \|y-X\beta\|^2_2+\lambda\|\beta\|_1 , dapat ∥β∗∥2‖β∗‖2\|\beta^*\|_2 meningkat saat λλ\lambda meningkat? Saya pikir ini mungkin. Meskipun ∥β∗∥1‖β∗‖1\|\beta^*\|_1 tidak meningkat ketika λλ\lambda meningkat ( bukti saya ), ∥β∗∥2‖β∗‖2\|\beta^*\|_2 dapat meningkat. Gambar di bawah ini menunjukkan kemungkinan. Ketika λλ\lambda meningkat, jika β∗β∗\beta^* bergerak (linear) dari PPP ke QQQ , maka ∥β∗∥2‖β∗‖2\|\beta^*\|_2 meningkat sementara …
11 lasso 

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.