Bộ dữ liệu phân loại AI giọng nói của HereSay

Phiên bản 2026-Q2-v2 · ODC-BY 1.0

10 bộ dữ liệu phân loại tổng hợp được tính từ 54 cuộc trò chuyện AI giọng nói đã ẩn danh (2.334 lượt trao đổi). Bao gồm bộ ba Asking/Doing/Expressing của OpenAI, các khía cạnh đặc thù của giọng nói, cảm xúc theo từng lượt (VADER), phân bố kiểu câu hỏi và đại từ xưng hô, chuyển tiếp theo mạch hội thoại, và mô hình theo thời điểm trong ngày. Không bao gồm văn bản thô của cuộc trò chuyện.

Giấy phép: ODC-BY 1.0

Dùng miễn phí, phân phối lại miễn phí, cần ghi nguồn. Khi bạn sử dụng bộ dữ liệu này trong nghiên cứu, báo chí hoặc công việc thương mại, hãy ghi:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

Bạn cần một tài khoản HereSay miễn phí để tải xuống. Điều này giúp bạn thấy giấy phép ngay lúc tải.

Đăng nhập hoặc tạo tài khoản miễn phí

Bên trong ZIP có gì

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • Kèm theo README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

Đọc bài blog với những phát hiện nổi bật →