مجموعة بيانات تصنيفات HereSay الصوتية للذكاء الاصطناعي

الإصدار 2026-Q2-v2 · ODC-BY 1.0

10 مجموعات بيانات تصنيفية مجمعة محسوبة من 54 محادثة صوتية مجهولة الهوية مع الذكاء الاصطناعي (2,334 تبادلاً). تتضمن ثلاثية OpenAI: السؤال/القيام/التعبير، وسمات خاصة بالصوت، وتحليل المشاعر لكل تبادل (VADER)، وتوزيع أنواع الأسئلة والضمائر، وانتقالات مسار المحادثة، وأنماط وقت اليوم. نص المحادثات الخام غير مشمول.

الترخيص: ODC-BY 1.0

مجاني للاستخدام، ومجاني لإعادة التوزيع، مع اشتراط الإسناد. عند استخدامك هذه المجموعة في البحث أو الصحافة أو العمل التجاري، أدرج:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

تحتاج إلى حساب HereSay مجاني للتنزيل. وذلك كي ترى الترخيص عند وقت التنزيل.

سجّل الدخول أو أنشئ حسابًا مجانيًا

ما الذي يتضمنه ZIP

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • بالإضافة إلى README وMETHODOLOGY وDATASHEET وCODEBOOK وCITATION.cff وLICENSE وCHANGELOG

اقرأ تدوينة المدونة مع أبرز النتائج →