Датасет содержит результат парсинга анекдотов, наскрапленных с разных сайтов.
Каждый сэмпл содержит четыре поля:
"context" - контекст диалога, включая все недиалоговые вставки. Обратите внимание, что контекст содержит как предшествующие реплики, так и прочий сопутствующий текст, так как он определяет общий сеттинг, необходимый для генерации реплики. Из реплики удалены маркеры косвенной речи.
"utterance" - диалоговая реплика.
"hash" - хэш-код исходного полного текста для связывания сэмплов.
"reply_num" - порядковый номер диалоговой реплики. Часто последняя реплика является "пайнчалайном", в ней сконцентрирована суть шутки.
Один исходный текст может дать несколько сэмплов, если в нем было много реплик.
3 commits
2 commits
Датасет содержит результат парсинга анекдотов, наскрапленных с разных сайтов.
Каждый сэмпл содержит четыре поля:
"context" - контекст диалога, включая все недиалоговые вставки. Обратите внимание, что контекст содержит как предшествующие реплики, так и прочий сопутствующий текст, так как он определяет общий сеттинг, необходимый для генерации реплики. Из реплики удалены маркеры косвенной речи.
"utterance" - диалоговая реплика.
"hash" - хэш-код исходного полного текста для связывания сэмплов.
"reply_num" - порядковый номер диалоговой реплики. Часто последняя реплика является "пайнчалайном", в ней сконцентрирована суть шутки.
Один исходный текст может дать несколько сэмплов, если в нем было много реплик.
3 commits
2 commits