HereSay 语音AI分类数据集
版本
2026-Q2-v2
· ODC-BY 1.0
基于 54 段匿名语音AI对话(2,334 轮)计算出的 10 组汇总分类数据集。包含 OpenAI 的 Asking/Doing/Expressing 三分法、语音特定维度、逐轮情绪(VADER)、问题类型和代词分布、对话走向转换,以及一天中不同时段的模式。不包含原始对话文本。
许可:ODC-BY 1.0
可免费使用、免费再分发,需注明来源。若你在研究、新闻报道或商业工作中使用这个数据集,请包含:
"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."
你需要一个免费的 HereSay 账号才能下载。这样你可以在下载时看到许可条款。
登录或创建免费账号ZIP 里包含什么
-
01_conversation_stats.csv— workhorse table (turns, char counts, redactions) -
02_asking_doing_expressing.csv— OpenAI taxonomy label per conversation -
03_voice_facets.csv— mic_test / practice / casual / emotional / info_seeking -
04_turn_lengths.csv— char + word counts per turn -
05_voice_signals.csv— filler words, mic-check phrases, ASR garble -
06_question_types.csv— what / how / why / yes-no question counts -
07_pronoun_usage.csv— 1st / 2nd / 3rd person counts per role -
08_arc_transitions.csv— opening facet -> closing facet (Sankey input) -
09_sentiment.csv— VADER compound score per turn -
10_time_of_day.csv— UTC hour bucket counts - 以及 README、METHODOLOGY、DATASHEET、CODEBOOK、CITATION.cff、LICENSE、CHANGELOG