All MicroEvals
KONTEKS TASK: Saya membutuhkan model LLM untuk melakukan scr...
Create MicroEval
Header image for KONTEKS TASK:
Saya membutuhkan model LLM untuk melakukan scr...

KONTEKS TASK: Saya membutuhkan model LLM untuk melakukan scr...

Prompt

KONTEKS TASK: Saya membutuhkan model LLM untuk melakukan screening CV secara otomatis dengan kriteria berikut: - Input: CV terstruktur hasil parsing (rata-rata 1.500-2.000 token) - Output: JSON dengan skor 100-0 berdasarkan rubrik 5 kategori (Skill, JD Alignment, Education, YoE, Certification) - Instruksi: Sangat detail dan ketat (pre-kalkulasi wajib, pencocokan eksplisit, hard-cap rules) - Volume: 30-100 CV per batch, beberapa batch per bulan - Deadline: Real-time feedback (dijalankan via Google Apps Script, max 10 detik per CV) KRITERIA MODEL YANG DICARI: 1. INSTRUCTION-FOLLOWING (Prioritas Tertinggi) - Minimal skor BFCL v3 โ‰ฅ 75% (tool-call reliability) - Mampu menghasilkan JSON yang konsisten sesuai format yang diminta - Tidak sering "melupakan" instruksi di prompt panjang Alasan: Prompt saya berisi 2.000+ token instruksi ketat dengan pre-kalkulasi wajib 2. STRUCTURED OUTPUT QUALITY - Mendukung JSON mode atau output terstruktur - Minimal accuracy untuk arithmetic (kalkulasi YoE dari tanggal) - Consistency: output format tidak berubah-ubah antar CV Alasan: Output harus parseable dan deterministik 3. REASONING & INTELLIGENCE - Minimal Intelligence Index โ‰ฅ 30 - Kemampuan pattern-matching yang baik (cocokkan JD dengan pengalaman) - Tidak mudah memberi skor tinggi untuk soft-skill umum (perlu selektif) Alasan: Task ini bukan mere extraction, ada judgment call 4. SPEED & COST - Output speed โ‰ฅ 200 token/sec (agar tidak timeout) - Harga blended (3:1 input/output ratio) โ‰ค $0.50/1M Alasan: Volume tahunan terbatas, tapi jangan sacrifice quality untuk cost 5. STABILITY & AVAILABILITY - Status: Stable (tidak deprecated dalam 6 bulan ke depan) - Uptime & rate limit yang reliable - Sudah tested di production (tidak eksperimental) Alasan: Ini dijalankan via automasi, tidak bisa ganti model tengah jalan 6. OPTIONAL TAPI NICE-TO-HAVE: - Native Indonesian language support (CV saya mostly Bahasa Indonesia) - Long context (โ‰ฅ256K) untuk future scalability ke 20+ halaman CV - Prompt caching support (untuk masterdata kriteria yang dipakai berulang) KELUARAN YANG SAYA HARAPKAN: Rankingkan 5-8 model terbaik berdasarkan fitness score Anda, dengan: - Model name + model ID - Alasan masuk top 5 (mana kriteria yang dipenuhinya) - Estimated cost untuk 100 CV (asumsikan input 120K token, output 194K token) - Estimated cost untuk 1.000 CV per tahun - Risk / limitation (jika ada) - Implementasi: perlu perubahan kode atau plug-and-play? CONTEXT TAMBAHAN: - Stack saya: Google Apps Script + Gemini API (bisa adaptif ke provider lain) - Saat ini pakai: Gemini 2.5 Flash (Rp9.340 untuk 33 CV, akan deprecated Oktober 2026) - Preference: Open-source model OK, selama ada API provider yang reliable

Drag to resize
Drag to resize
Drag to resize