AI
Perplexity Buka Sumber Benchmark Internal WANDR untuk Agen Riset AI
Perplexity AI merilis WANDR, benchmark internal untuk agen riset AI, sebagai open source.
Oleh Tim Editorial
Perplexity AI, perusahaan mesin pencari berbasis kecerdasan buatan, mengumumkan pada Senin, 27 Juli 2026, bahwa mereka merilis WANDR sebagai open source. WANDR adalah benchmark internal yang dibangun dan digunakan perusahaan untuk mengembangkan kemampuan riset mendalam dan luas di dalam Perplexity Computer, produk andalan mereka. Pengumuman ini disampaikan melalui akun resmi Perplexity AI di platform X (sebelumnya Twitter). Dalam unggahan tersebut, perusahaan menyatakan, "We're open sourcing WANDR. WANDR is an internal benchmark we built and used for building deep and wide research capabilities inside Perplexity Computer." Unggahan itu juga menyertakan tautan ke makalah teknis yang menjelaskan benchmark tersebut. Menurut makalah teknis yang diterbitkan di laman research.perplexity.ai, WANDR merupakan singkatan dari Wide and Deep Research. Benchmark ini dirancang untuk mengevaluasi agen riset yang harus mencari secara luas dan mendalam.
Makalah tersebut menjelaskan bahwa riset luas dan mendalam memerlukan dua kemampuan utama. Pertama, agen harus mencari secara cukup luas untuk menemukan semua entitas yang memenuhi syarat. Kedua, agen harus menyelidiki cukup dalam untuk mendukung setiap klaim dengan bukti. WANDR merepresentasikan persyaratan ini sebagai catatan hierarkis yang dapat diverifikasi secara independen. Benchmark ini terdiri dari 500 tugas riset yang masing masing dirancang untuk menguji kemampuan agen dalam menyeimbangkan eksplorasi luas dengan investigasi mendalam. Setiap tugas menghasilkan catatan yang dapat diperiksa secara terpisah, memungkinkan evaluasi yang lebih granular terhadap kinerja agen. Keputusan Perplexity untuk membuka sumber WANDR menandai langkah signifikan dalam ekosistem AI terbuka. Dengan merilis benchmark ini, Perplexity tidak hanya memberikan alat evaluasi bagi komunitas riset, tetapi juga memungkinkan pengembang lain untuk menguji dan membandingkan agen riset mereka sendiri.
Ini berpotensi mempercepat inovasi dalam pengembangan agen AI yang mampu melakukan riset kompleks. Perplexity Computer, produk yang disebut dalam pengumuman, adalah platform yang memungkinkan pengguna melakukan riset mendalam dengan bantuan AI. WANDR digunakan secara internal untuk memastikan bahwa agen di dalam Perplexity Computer dapat menangani tugas tugas yang memerlukan pencarian informasi dari berbagai sumber dan verifikasi silang. Dengan membuka sumber benchmark ini, Perplexity mengundang kontribusi dari komunitas untuk meningkatkan dan memperluas kemampuan WANDR. Langkah ini juga dapat dilihat sebagai upaya Perplexity untuk membangun standar industri dalam evaluasi agen riset AI. Saat ini, belum ada benchmark yang diterima secara luas untuk mengukur kemampuan agen dalam melakukan riset luas dan mendalam. WANDR mengisi celah tersebut dengan menyediakan kerangka kerja yang sistematis dan dapat direproduksi.
Makalah teknis WANDR menjelaskan bahwa benchmark ini dirancang untuk mengatasi keterbatasan benchmark yang ada, yang cenderung fokus pada satu dimensi saja, seperti kedalaman atau keluasan, tetapi tidak keduanya. WANDR menggabungkan kedua dimensi tersebut dalam satu kerangka evaluasi, sehingga memberikan gambaran yang lebih holistik tentang kemampuan agen. Setiap tugas dalam WANDR dirancang untuk mensimulasikan skenario riset dunia nyata, di mana agen harus menavigasi sejumlah besar informasi, mengidentifikasi sumber yang relevan, dan menyusun argumen yang didukung bukti. Hasil evaluasi kemudian dapat digunakan untuk mengidentifikasi kelemahan spesifik dalam agen dan memandu pengembangan lebih lanjut. Perplexity belum mengumumkan jadwal rilis kode sumber WANDR secara detail, tetapi pengumuman open source menunjukkan bahwa kode tersebut akan tersedia dalam waktu dekat.
Komunitas pengembang dan peneliti AI diperkirakan akan menyambut baik langkah ini, karena menyediakan alat yang sangat dibutuhkan untuk membandingkan dan meningkatkan agen riset. Dengan merilis WANDR sebagai open source, Perplexity juga memperkuat posisinya sebagai pemain yang mendukung transparansi dan kolaborasi dalam pengembangan AI. Langkah ini sejalan dengan tren di industri AI, di mana perusahaan seperti Meta dan Google juga telah merilis beberapa model dan alat mereka sebagai open source. Ke depannya, WANDR berpotensi menjadi tolok ukur standar untuk mengevaluasi agen riset AI, mirip dengan peran GLUE dan SuperGLUE dalam pemahaman bahasa alami. Jika diadopsi secara luas, benchmark ini dapat mendorong pengembangan agen yang lebih canggih dan andal, yang pada gilirannya akan meningkatkan kualitas riset yang didukung AI.