مجموعه‌داده طبقه‌بندی‌های هوش مصنوعی صوتی HereSay

نسخه 2026-Q2-v2 · ODC-BY 1.0

10 مجموعه‌داده طبقه‌بندی تجمیعی که از 54 گفتگوی ناشناس هوش مصنوعی صوتی (2,334 نوبت) محاسبه شده‌اند. شامل سه‌گانه Asking/Doing/Expressing متعلق به OpenAI، جنبه‌های ویژه صوت، احساس‌سنجی هر نوبت (VADER)، توزیع نوع پرسش و ضمیر، انتقال‌های قوس گفتگو، و الگوهای زمانِ روز است. متن خام گفتگوها در این مجموعه گنجانده نشده است.

مجوز: ODC-BY 1.0

استفاده آزاد، بازنشر آزاد، با الزام ذکر منبع. هنگام استفاده از این مجموعه‌داده در پژوهش، روزنامه‌نگاری یا کار تجاری، این موارد را ذکر کنید:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

برای دانلود، به یک حساب رایگان HereSay نیاز دارید. این کار برای آن است که هنگام دانلود، مجوز را ببینید.

وارد شوید یا یک حساب رایگان ایجاد کنید

محتویات داخل ZIP

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • همچنین README، METHODOLOGY، DATASHEET، CODEBOOK، CITATION.cff، LICENSE، CHANGELOG

مطالعه پست وبلاگ با یافته‌های اصلی →