HereSay音声AI分類データセット
バージョン
2026-Q2-v2
· ODC-BY 1.0
54件の匿名音声AI会話(2,334ターン)から算出した10件の集計分類データセットです。OpenAIのAsking/Doing/Expressingの3分類、音声特有の要素、各ターンの感情分析(VADER)、質問タイプと代名詞の分布、会話の流れの遷移、時間帯パターンを含みます。会話の生テキストは含まれていません。
ライセンス: ODC-BY 1.0
自由に利用、再配布できますが、帰属表示が必要です。このデータセットを研究、報道、商用利用する場合は、次を含めてください:
"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."
ダウンロードには無料のHereSayアカウントが必要です。ダウンロード時にライセンスを確認していただくためです。
サインインするか無料アカウントを作成ZIPの内容
-
01_conversation_stats.csv— workhorse table (turns, char counts, redactions) -
02_asking_doing_expressing.csv— OpenAI taxonomy label per conversation -
03_voice_facets.csv— mic_test / practice / casual / emotional / info_seeking -
04_turn_lengths.csv— char + word counts per turn -
05_voice_signals.csv— filler words, mic-check phrases, ASR garble -
06_question_types.csv— what / how / why / yes-no question counts -
07_pronoun_usage.csv— 1st / 2nd / 3rd person counts per role -
08_arc_transitions.csv— opening facet -> closing facet (Sankey input) -
09_sentiment.csv— VADER compound score per turn -
10_time_of_day.csv— UTC hour bucket counts - ほかにREADME、METHODOLOGY、DATASHEET、CODEBOOK、CITATION.cff、LICENSE、CHANGELOG