RANGGAEGHAPERMANA
Kembali ke daftar proyek
  • Machine Learning · NLP
  • 2025

Studi kasus · 08 / 08

Tokopedia Sentiment Analysis

Mengubah ribuan ulasan menjadi sinyal yang bisa dibaca.

Tokopedia Sentiment Analysis — tangkapan layar

Eksperimen NLP untuk mengklasifikasikan ulasan marketplace ke sentimen positif, netral, dan negatif menggunakan IndoBERT, lengkap dengan confidence score dan aplikasi Streamlit.

Peran saya
Data & ML Engineer
Status
Public research project

Pencapaian utama

Mengklasifikasikan ulasan marketplace berbahasa Indonesia dengan IndoBERT, lengkap dengan confidence score.

Lihat repository Real Streamlit UI · idle state only because the repository Git LFS model quota is unavailable
Tokopedia Sentiment Analysis — tangkapan layar

01 · Konteks

Masalah yang ingin diselesaikan.

Pengguna utama

  • Product dan research team
  • Marketplace analyst
  • Data / ML practitioner

Masalahnya

Volume ulasan produk terlalu besar untuk dibaca satu per satu. Rating bintang juga tidak selalu menangkap konteks bahasa, keluhan, atau nada netral dalam teks Indonesia.

Pendekatannya

Pipeline menyiapkan data ulasan, melakukan tokenisasi, menjalankan model IndoBERT, lalu mengembalikan kelas sentimen beserta confidence score melalui antarmuka Streamlit.

Angka kunci

  • 3kelas sentimen
  • 1IndoBERT pipeline
  • 2mode: notebook & app

02 · Peran saya

Bagian yang saya kerjakan.

Data & ML Engineer

Teknologi yang digunakan

  • Python
  • IndoBERT
  • Transformers
  • PyTorch
  • Streamlit
  • Pandas
  • scikit-learn
  • Jupyter
  • Git LFS
  1. 01

    Menyiapkan dan melabeli data ulasan untuk tiga kelas sentimen.

  2. 02

    Melakukan fine-tuning dan inferensi model IndoBERT.

  3. 03

    Membungkus model dalam aplikasi Streamlit yang menampilkan kelas dan confidence score.

  4. 04

    Mengelola model dan dataset berukuran besar lewat Git LFS.

03 · Sorotan

Beberapa tampilan pilihan.

Klik gambar untuk melihatnya lebih besar.

Geser untuk melihat semua, ketuk gambar untuk memperbesar.

Streamlit

Sentiment analyzer

Aplikasi Streamlit yang menerima ulasan untuk diklasifikasikan oleh pipeline IndoBERT.

04 · Tantangan & keputusan

Masalah teknis dan cara saya menyelesaikannya.

01 · Tantangan

Rating bintang tidak menangkap konteks

Pendekatan

Teks ulasan diproses model bahasa Indonesia, bukan pencocokan kata kunci.

Hasil

Keluhan dan nada netral lebih mudah dipisahkan.

02 · Tantangan

Prediksi tidak boleh dianggap pasti

Pendekatan

Setiap hasil disertai confidence score.

Hasil

Pembaca bisa menilai seberapa yakin model terhadap prediksinya.

01 / 02

05 · Hasil

Apa yang dihadirkan solusi ini.

Hasil klasifikasi dapat dipakai sebagai fondasi untuk memantau kecenderungan feedback, memprioritaskan keluhan, dan menemukan tema yang perlu dianalisis lebih lanjut.

Alur penggunaan

  1. 01Kumpulkan ulasan
  2. 02Bersihkan & label data
  3. 03Tokenisasi
  4. 04Fine-tune IndoBERT
  5. 05Evaluasi model
  6. 06Inferensi teks
  7. 07Kelas + confidence

Arsitektur

Data

review samples · label sentimen · preprocessing notebook

Model

IndoBERT tokenizer · PyTorch weights · three-class classifier

Inference

text input · tokenization · logits · softmax confidence

Interface

Streamlit app untuk eksplorasi prediksi

Model data

Review

text

rating

source

created_at

Label

review_id

sentiment

split

Model Artifact

checkpoint

tokenizer

version

Prediction

review_id

model_version

class

confidence

  • Review 1—1 Label (training)
  • Model Artifact 1—N Prediction
  • Review 1—N Prediction (versioned experiments)
Proyek berikutnyaDagangin POSSatu engine operasional untuk banyak pola usaha UMKM.