• Главная
  • Контакты
Подписаться:
  • Twitter
  • Facebook
  • RSS
  • VK
  • PushAll
logo

logo

  • Все
    • Положительные
    • Отрицательные
  • За сегодня
    • Положительные
    • Отрицательные
  • За вчера
    • Положительные
    • Отрицательные
  • За 3 дня
    • Положительные
    • Отрицательные
  • За неделю
    • Положительные
    • Отрицательные
  • За месяц
    • Положительные
    • Отрицательные
  • За год
    • Положительные
    • Отрицательные
  • Сортировка
    • По дате (возр)
    • По дате (убыв)
    • По рейтингу (возр)
    • По рейтингу (убыв)
    • По комментам (возр)
    • По комментам (убыв)
    • По просмотрам (возр)
    • По просмотрам (убыв)
Главная
  • Все
    • Положительные
    • Отрицательные
  • За сегодня
    • Положительные
    • Отрицательные
  • За вчера
    • Положительные
    • Отрицательные
  • За 3 дня
    • Положительные
    • Отрицательные
  • За неделю
    • Положительные
    • Отрицательные
  • За месяц
    • Положительные
    • Отрицательные
  • Главная
  • GoTo Data Science Challenge 2: гранты на летнюю школу

GoTo Data Science Challenge 2: гранты на летнюю школу +5

24.04.2017 10:17
bibilov 0 1800 Источник
Промышленное программирование*, Программирование*, Машинное обучение*, Python*, Блог компании Школа GoTo

Мы анонсируем конкурс для получения грантов в рамках направления по анализу данных и машинному обучению летних школ GoTo. К участию приглашаем школьников и младшекурсников. В качестве задания предлагается kaggle-соревнование от Quora, в котором необходимо построить модель для определения вопросов-дубликатов.


image


Под катом описание условий задачи, ссылки на полезные материалы и пример простого решения.



Модель по определению одинаковых по сути вопросов можно использовать в форумах, техподдержке, онлайн-консультациях и т.д., например, чтобы не плодить одинаковые темы или автоматически отвечать на популярные вопросы. Собственно говоря, довольно полезная история.


В первом приближении эту задачу можно решать в постановке бинарной классификации – по паре вопросов учиться предсказывать, являются ли они дубликатами или нет. Тогда начинает работать стандартный сеттинг машинного обучения – обучение с учителем. Размеченные пары для обучения предоставлены организаторами соревнования, и нам достаточно выполнить два шага: сгенерировать по парам вопросов признаки, а затем выбрать их и обучить классификатор.


Одно из самых простых решений — поверить, что вопросы являются дубликатами, если они состоят из почти одних и тех же слов (модель bag of words). Тогда признаковое описание для одного вопроса – вектор из частот вхождений слов.
Пример решения с такими признаками и логистической регрессией можно найти по здесь.


Дальнейшее развитие решения ограничено только вашей фантазией:


  • можно по-разному предобрабатывать текст (выбрасывать частотные слова, использовать стемминг);
  • использовать не частоты, а tfidf, брать представления слов из предобученного word2vec;
  • обучать на этом всем деревья, нейросети, строить ансамбли моделей.

Больше примеров можно найти ниже:


  • Форум данного соревнования на Kaggle,
  • Описание возможностей библиотеки NLTK,
  • Вводные материалы по машинному обучению от нашей школы, возможно, тоже помогут тем, кто только начинает разбираться в этих темах.

Чтобы подать заявку на грант нужно выполнить следующие шаги:


  • Подать заявку на участие до 20 мая на сайте школы с пометкой "Хочу грант" и получить детали проведения конкурса.
  • Принять участие в kaggle-соревновании, в нике для рейтинговой таблицы добавить суффикс [GoTo].
  • Постараться оказаться как можно выше в итоговой таблице.
  • До 4 июня отправить свой ник в таблице и исходный код в формате jupyter тетрадки с комментариями о том, что и почему вы сделали, какие идеи улучшили качество модели, а какие нет, и как вы это проверяете. Если претендуете на денежный приз от Quora, код можете выслать по окончанию конкурса.

По итогам несколько участников получат полные гранты (бесплатное участие), показавшие достойные результаты – частичные гранты. Подробнее в письме, которое будет выслано после регистрации.


О школах:


image


13 – 26 июня, 1 – 14 июля, 16 – 29 августа в 100 км от Москвы пройдут летние проектные школы GoTo для старшеклассников и младшекурсников, интересующихся прикладным программированием, анализом данных, биоинформатикой, информационной безопасностью, интернетом вещей с робототехникой. Участник каждой школы получает возможность реализовать проект или провести исследование, работу над проектами курируют преподаватели лучших университетов и эксперты ведущих компаний.
В рамках отбора проводятся конкурсы на бесплатное участие по каждому направлению: прикладное программирование, hardware, анализ данных, информационная безопасность, биоинформатика. Анонсы остальных конкурсов выкатим в ближайшее время.


Все вопросы или предложения можно присылать на school@goto.msk.ru.

Поделиться с друзьями
-->

Комментарии (0)

МЕТКИ

  • Хабы
  • Теги

Промышленное программирование

Программирование

Машинное обучение

Python

Блог компании Школа GoTo

анализ данных

машинное обучение

летняя школа

проектный подход

хакатон

Kaggle

обучение

грант

конкурс

школьники

студенты

СЕРВИСЫ
  • logo

    CloudLogs.ru - Облачное логирование

    • Храните логи вашего сервиса или приложения в облаке. Удобно просматривайте и анализируйте их.
Все публикации автора
  • GoTo Data Science Challenge 2: гранты на летнюю школу +5

    • 24.04.2017 10:17

    Гантель как орудие ума +4

    • 28.03.2017 09:23

    Весеннее обострение: проектная школа в Иннополисе, методический интенсив и митап по инфобезу +6

    • 22.03.2017 10:00

    «Программист — Аналитическое мышление = 1С программист» и другие результаты GoToHack +4

    • 27.12.2016 12:10

    Проекты школы GoTo: рекомендательная система для новостного портала +10

    • 19.10.2016 11:45

    Городской АД: школьники и студенты +6

    • 14.07.2016 10:10

Подписка


ЛУЧШЕЕ

  • Сегодня
  • Вчера
  • Позавчера
09:01

Как Европа топит DIY-разработчиков и микропредпринимателей +48

13:01

ЭВМ в народном хозяйстве: Госбанк, медицина и образование +23

12:39

Точечное внедрение Linux на производстве: опыт одного начальника склада +21

08:00

Снятся ли трансформерам электроовцы +21

06:01

Смерть сабагентов в Claude и Codex +21

15:23

Нейросети как дофаминовая яма для взрослых +20

11:31

Куда уходит время: вот уже девять месяцев я трекаю работу и почти всю жизнь +16

19:48

Спустя год разработки приложения для изучения иностранных слов — я наконец нащупал его главную концепцию +14

12:20

Как возникает жизнь там, где почти нет света? +13

09:00

Сокровище эпохи интернет-энтузиастов: как мод-мод Orbis переписал Civilization IV и уперся в тупик Civilization V +13

18:58

Релиз ReactOS 0.4.16 +12

11:30

«Боинг-367»: промежуточное звено +11

09:00

Одну и ту же выгрузку получили сорок подрядчиков. Утекла одна копия. Определить источник можно точно +11

08:06

Отличная игра — и точка: истории франшиз, оборвавшихся на первой части +10

18:21

Непротиворечивая классификация IoC +8

20:52

Почему мне больше не весело делать игры +7

17:47

Физики впервые сгенерировали сертифицированно идеальную случайность из ненадёжных сигналов +7

15:18

Долго запускается qt creator, долго переходит между вкладками (проект, отладка, редактор), не работает масштабирование +6

12:41

Влияние кэша L4 i7-5775C на производительность в Minecraft: Java Edition в воспроизводимых серверных тестах +6

13:21

Я ломал свою платформу мониторинга. Первым сломалось не то, что я тестировал +5

13:02

Луна — сложная цель +50

09:01

Как изобрели письменность? Часть 7. Путь китайской иероглифики через тысячелетия и династии +47

14:05

«Первое» устройство BlackBerry: уникальный КПК с x86-процессором от Intel. Изучаем диковинку +34

19:22

Claude, GPT, Qwen, DeepSeek, GigaChat и YandexGPT: какая LLM лучше подходит для создания алго-трейдинг бота +26

09:02

LLM уверенно врёт про ваш микроконтроллер +25

08:00

Откуда взялся ИИ и причем тут слово перцептрон +19

11:59

Шесть миллиардов прогонов ради одной галочки: как устроено ревью научного софта на GitHub +18

10:49

Правильная сажа — потенциальный источник углеродных нанотрубок. Guest Post +16

09:00

Игры для Sega Mega Drive, в которые я играю до сих пор +16

09:15

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090 +14

14:23

Полмиллиона словоформ для ингушского языка, у которого не было ни анализатора, ни корпуса +13

20:13

Как я увеличил производительность своего сервера для LLM-вычислений почти в два раза и причем здесь six-seven +12

12:03

«Я знаю, что ты не знаешь»: три задачи о спрятанном призе +11

10:15

Распилили монолит на 6 сервисов — и случайно собрали распределённый монолит: где мы ошиблись с границами +10

14:06

Автономное ПО для велокомпьютера +9

12:16

Чтение на выходные: «Разумный инвестор» Бенджамина Грэма +9

08:25

Я написал программу для записи экрана, которой не нужен мощный ПК +9

08:04

Необанк своими руками. Какие провайдеры нужны для запуска крипто-финтеха в 2026 году? +9

07:38

Как песни могут помочь облегчить боль — и даже лечить симптомы инсульта +9

07:01

Превращаем сгенерированные ассеты в анимации часть 2 +9

ОБСУЖДАЕМОЕ

  • Бенчмарк на AGI. Если ARC‑AGI-3 решён, есть ли у нас AGI? +8

    • 57   10000

    Отличие языковой модели LLM от человека +5

    • 51   9500

    Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090 +14

    • 35   62000

    Claude, GPT, Qwen, DeepSeek, GigaChat и YandexGPT: какая LLM лучше подходит для создания алго-трейдинг бота +26

    • 33   14000

    «Первое» устройство BlackBerry: уникальный КПК с x86-процессором от Intel. Изучаем диковинку +34

    • 32   11000

    Нейросети как дофаминовая яма для взрослых +19

    • 31   7500

    Мой сайт грузился две секунды, потому что каждый CSS-файл писал в базу данных -2

    • 24   11000

    Спустя год разработки приложения для изучения иностранных слов — я наконец нащупал его главную концепцию +14

    • 23   3900

    Я написал программу для записи экрана, которой не нужен мощный ПК +9

    • 23   8300
  • Главная
  • Контакты
© 2026. Все публикации принадлежат авторам.