Literasi Data dan Penulisan Ilmiah
2026-09-14
.csv, .sav, json) dan cara membacanyaMinggu lalu Anda belajar mempresentasikan data dengan tabel. Mulai minggu ini, kita fokus pada tahapan Data Pipeline: Find (menemukan) dan Get (memperoleh) data.
Sebelum ada yang bisa ditata atau dibersihkan, harus ada data dulu di tangan Anda.
Kalau Anda benar-benar mencoba mencari dataset psikologi yang relevan dengan topik riset Anda, Anda akan menyadari betapa terbatasnya pilihan data terbuka untuk bidang psikologi kalau dibandingkan, misalnya, dengan ekonomi atau kesehatan masyarakat.
HTML, belum dikemas jadi berkas yang siap diunduh.Open-Source Psychometrics Project
openpsychometrics.org/_rawdata/
Daftar dataset psikologi/ilmu sosial
Psychological Stimulus Sets and Datasets (Brick, 2020)
Dokumen kolaboratif komunitas yang mengumpulkan berbagai sumber dataset terbuka di bidang psikologi dan ilmu sosial yang bisa menjadi pilihan untuk mengerjakan tugas UTS Anda.
Sumber lain yang layak dijelajahi
Open Science Framework (OSF), repositori data milik jurnal (banyak jurnal psikologi kini mewajibkan penulis membagikan data mentah), dan arsip data milik konsorsium riset (mis. World Values Survey, Wellcome Global Monitor untuk data lintas-negara).
Kerjakan sendiri (10 menit)
Buka salah satu sumber data terbuka yang baru saja dibahas (Open-Source Psychometrics Project atau daftar dataset komunitas).
.csv/.tsv (comma/tab-separated values) — teks polos yang menyimpan tabel; ringan, terbuka, dan bisa dibaca hampir semua perangkat lunak..xls/.xlsx — format spreadsheet Excel; menyimpan tabel plus format visual dan formula, sehingga ukurannya lebih besar dari CSV..sav — format native SPSS, paling umum Anda temui di penelitian psikologi; menyimpan data plus label variabel dan value labels (mis. 1 = Laki-laki, 2 = Perempuan)..json — format ringan berbasis struktur tree (bukan tabel), umum dipakai untuk data dari API atau media sosial..csv/.xlsx) vs. tree (.json): Apa perbedaannya?Struktur tabular
Struktur tree (JSON)
Note
Untuk sebagian besar data riset psikologi (respons survei, skor tes), struktur tabular sudah cukup. .json lebih relevan kalau Anda bekerja dengan data media sosial atau hasil ekstraksi dari API.
json.sav tanpa SPSSSPSS untuk membaca .sav karena jamovi dan JASP (keduanya gratis) bisa membukanya langsung..sav secara langsung — perlu dikonversi dulu ke .csv/.xlsx lewat jamovi/JASP.1, 2) sering kali punya label tersembunyi (Laki-laki, Perempuan) yang perlu Anda periksa di variable view, bukan hanya data view.Tidak semua data terbuka tersedia dalam format siap pakai. Kadang Anda hanya menemukan data dalam:
PDF digital — teksnya bisa disorot/disalin, tapi tabelnya sering berantakan kalau disalin langsung ke spreadsheet.PDF hasil pindai (scanned) — sebenarnya berupa gambar, kontennya tidak bisa disalin sama sekali tanpa bantuan tambahan.HTML) — data tampil sebagai tabel di browser, tapi belum ada tombol “unduh.”| Sumber | Strategi |
|---|---|
| PDF digital dengan tabel rapi | Salin manual (tabel pendek), atau software ekstraksi tabel khusus (mis. Tabula) untuk tabel panjang/berulang |
| PDF hasil pindai (scan) | Perlu Optical Character Recognition (OCR) — perangkat lunak yang “membaca” gambar menjadi teks, meski hasilnya sering perlu dikoreksi manual |
| Tabel di halaman web | Fungsi IMPORTHTML() di Google Sheets bisa langsung menarik tabel/daftar dari sebuah URL ke spreadsheet Anda. Contoh klik di sini. |
Ekstraksi otomatis tidak pernah 100% sempurna
Selalu verifikasi hasil ekstraksi terhadap sumber aslinya, karena ada kemungkinan baris yang terlewat atau kolom yang tergeser adalah kesalahan umum. Inilah kenapa tahap Verify (Pertemuan 4) dilakukan setelah Get.
Pasal 1
Note
Kalau Anda pernah bertanya-tanya kenapa formulir informed consent riset psikologi selalu menyebutkan hak partisipan untuk mengundurkan diri kapan saja — inilah dasar hukumnya.
Pasal 15 ayat (1)
Sejumlah hak subjek data, termasuk hak menghapus data dan menarik persetujuan, dikecualikan untuk beberapa kepentingan, salah satunya: “kepentingan statistik dan penelitian ilmiah.”
Pengecualian ini bukan berarti peneliti leluasa menggunakan data milik partisipan. Ia memberi ruang kerja bagi peneliti (mis. memakai data lama untuk analisis sekunder tanpa perlu melacak ulang persetujuan tiap partisipan), tapi tanggung jawab menjaga kerahasiaan dan penggunaan yang wajar tetap ada di tangan peneliti.
Dataset Big Five yang kita pakai bersifat terbuka dan sudah dianonimkan, tidak ada nama, tidak ada informasi yang bisa melacak balik ke individu tertentu. Tapi prinsip etikanya tetap relevan untuk proyek riset Anda sendiri:
Diskusikan bersama kelompok Anda (10 menit)
Coba cek kembali dataset yang Anda kumpulkan dari riset skripsi Anda. Informasi apa saja yang Anda kumpulkan dalam dataset tersebut.
.csv, .xlsx, .sav (format native SPSS), dan .json (struktur tree, bukan tabel).Ada pertanyaan?
Paparan disusun dengan menggunakan dan Quarto dengan template dari UNAIR Theme.