HereSay ভয়েস AI শ্রেণিবিন্যাস ডেটাসেট

ভার্সন 2026-Q2-v2 · ODC-BY 1.0

54টি নামহীন ভয়েস AI কথোপকথন থেকে গণনা করা 10টি সমষ্টিগত শ্রেণিবিন্যাস ডেটাসেট (2,334 টার্ন)। এতে OpenAI-এর Asking/Doing/Expressing ত্রিবিভাজন, ভয়েস-নির্দিষ্ট ফিচার, প্রতি-টার্ন সেন্টিমেন্ট (VADER), প্রশ্নের ধরন ও সর্বনাম বণ্টন, কথোপকথনের অগ্রগতির পরিবর্তন, এবং দিনের সময়ভিত্তিক প্যাটার্ন অন্তর্ভুক্ত আছে। কাঁচা কথোপকথনের লেখা অন্তর্ভুক্ত নয়।

লাইসেন্স: ODC-BY 1.0

বিনামূল্যে ব্যবহার করুন, বিনামূল্যে পুনর্বিতরণ করুন, তবে অ্যাট্রিবিউশন প্রয়োজন। আপনি যখন গবেষণা, সাংবাদিকতা, বা বাণিজ্যিক কাজে এই ডেটাসেট ব্যবহার করবেন, তখন অন্তর্ভুক্ত করুন:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

ডাউনলোড করতে আপনার একটি বিনামূল্যের HereSay অ্যাকাউন্ট লাগবে। এতে ডাউনলোডের সময় আপনি লাইসেন্সটি দেখতে পারবেন।

সাইন ইন করুন বা একটি বিনামূল্যের অ্যাকাউন্ট তৈরি করুন

ZIP-এর ভেতরে কী আছে

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • সঙ্গে আছে README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

মূল findings সহ ব্লগ পোস্টটি পড়ুন →