Загружаем научный разбор
Подготавливаем текст, источники и редакционные примечания без изменения разметки страницы.
Подготавливаем текст, источники и редакционные примечания без изменения разметки страницы.
Практический маршрут поиска исследований по программированию и ML: OpenAlex, Semantic Scholar, DBLP, arXiv, ACM, IEEE и проверка DOI через Crossref.
Одной «базы всех научных статей» не существует. В программировании и машинном обучении полезные записи распределены между библиографическими индексами, репозиториями препринтов, цифровыми библиотеками издателей и графами цитирования. Поэтому надёжный поиск — это не ввод одного русского запроса в одно окно, а короткий воспроизводимый процесс: сформулировать вопрос, собрать англоязычные термины, найти стартовые работы в широком индексе, пройти ссылки в обе стороны и подтвердить версию на странице репозитория или издателя.
Главное различие между сервисами — не дизайн поиска, а объект, который они хранят. Crossref прежде всего отдаёт метаданные, зарегистрированные издателями и другими участниками; arXiv хранит версии рукописей; DBLP курирует библиографию по computer science; ACM Digital Library и IEEE Xplore показывают материалы конкретных издательских экосистем; OpenAlex и Semantic Scholar связывают работы, авторов и цитирования. Одна и та же работа может присутствовать сразу в нескольких местах, но полнота полей, число цитирований и ссылка на доступный текст будут отличаться.
Запрос «статьи про нейросети для кода» слишком широк: в него попадут генерация программ, поиск дефектов, repair, code review, представления исходного кода и образовательные исследования. До открытия каталога запишите вопрос в виде четырёх полей:
| Поле | Пример |
|---|---|
| Объект | автоматическое исправление программ |
| Метод | machine learning, neural model или large language model |
| Свидетельство | эксперимент, benchmark, dataset, comparison |
| Граница | работы с 2021 года; статьи и конференционные papers |
Из этой карточки получается рабочий вопрос: «Какие ML-методы применялись для automated program repair с 2021 года и на каких наборах ошибок их сравнивали?» Он всё ещё допускает уточнение, но уже задаёт критерии включения. Рядом полезно записать исключения: например, не брать материалы только о completion, если в них нет исправления дефекта, и не считать блог пересказом научной работы.
Искать почти всегда стоит по английским терминам. Перевод названия области редко совпадает с лексикой title и abstract. Соберите группы синонимов, не превращая их сразу в одну гигантскую строку:
automated program repair, program repair, bug fixing;machine learning, neural, large language model, LLM;benchmark, evaluation, dataset, empirical study.Сначала объедините предмет и метод. Слова про оценку добавляйте, только если выдача остаётся слишком большой: требование benchmark в заголовке или аннотации способно скрыть полезную экспериментальную работу, авторы которой использовали другое слово.
OpenAlex удобен для первичного охвата и программно повторяемых запросов. В официальной документации поиск работ охватывает title, abstract и доступный системе full text; поддерживаются AND, OR, NOT, точные фразы, фильтры и сортировка. Запись может содержать DOI, год, источник публикации, связанные работы и сведения о вариантах доступа.
Это поисковый граф, а не сертификат качества. Автоматическая релевантность учитывает текстовое совпадение и цитирования, поэтому старые популярные статьи могут подниматься выше точных новых работ. Для первого просмотра оставляйте сортировку по relevance, а отдельный проход по дате делайте позже. Не принимайте cited_by_count за оценку корректности: показатель годится как один из сигналов для навигации, но не заменяет чтение метода и эксперимента.
Semantic Scholar Academic Graph API позволяет искать papers и получать их references и citations. Практически это полезно после нахождения одной подходящей работы: список references ведёт к предшественникам, а citations — к последующим проверкам, расширениям и критике. Фильтры по году и типу публикации помогают сократить очередь на чтение.
Автоматические TLDR и признаки influential citations используйте только для сортировки кандидатов. В официальном FAQ Semantic Scholar указывает, что определение influential citation зависит в том числе от доступности полного текста цитирующей работы. Следовательно, отсутствие такого ярлыка не означает, что ссылка не важна, а краткое машинное резюме нельзя цитировать вместо paper.
DBLP полезен, когда нужно проверить автора, название conference или journal, год, том, страницы и связь записи с электронной версией. Сервис позиционирует себя как курируемый источник библиографических метаданных по основным публикациям computer science. Это особенно удобно для областей, где конференционные proceedings являются важной частью научной коммуникации.
Но DBLP обычно не располагает полным текстом и прямо предупреждает, что его собственный поиск основан главным образом на title и части метаданных. Поэтому нулевая выдача по термину из середины статьи ничего не доказывает. Для поиска «внутри» текста перейдите в другой индекс, а в DBLP вернитесь для проверки библиографической записи и экспорта BibTeX.
arXiv быстро показывает рукописи в категориях вроде cs.SE, cs.LG, stat.ML, cs.AI, cs.CL и cs.CV. Категории пересекаются: работу о генерации кода можно встретить одновременно рядом с software engineering и language models. На странице abstract проверяйте дату первой подачи, номер версии v1/v2/…, комментарий автора, journal reference и DOI, если они заполнены.
Модерация arXiv проверяет тематическую уместность и соблюдение правил, но не превращает каждую запись в рецензированную публикацию. У рукописи могут появляться новые версии, а опубликованная conference или journal version может отличаться. Поэтому при фиксации источника пишите не просто «arXiv», а точный идентификатор и версию, например arXiv:YYMM.NNNNNv2, и отдельно ищите version of record по DOI. Официальная страница о версиях объясняет, как arXiv различает и рекомендует цитировать версии.
ACM Digital Library и IEEE Xplore нужны не только для нового поиска. На странице конкретного результата удобно подтвердить название venue, тип материала, окончательный список авторов, DOI, страницы и дату публикации. IEEE Xplore документирует поиск по metadata, exact phrase, полям и булевым операторам; отдельно можно выбирать поиск по full text там, где он доступен. В ACM DL полезны conference proceedings, journals, references и связанные artifacts. С 1 января 2026 года ACM объявила свои публикации в Digital Library открытыми для чтения, хотя дополнительные исследовательские функции платформы могут относиться к отдельному уровню доступа.
Страница издателя обычно является лучшим местом для подтверждения опубликованной версии, но издательский каталог по определению не покрывает работы других издателей и препринты без публикации. Поэтому начинать и заканчивать поиск только в ACM или только в IEEE не стоит.
Crossref REST API полезен, когда найдено название без устойчивого идентификатора или нужно проверить DOI. Crossref отдаёт метаданные, которые вносят его members и доверенные источники: авторов, название, тип, даты, издателя, ссылки, а иногда сведения о лицензии, references и post-publication updates. Полный текст Crossref не хранит; ссылка из записи ведёт к внешнему ресурсу.
Запрос по библиографическим данным помогает сопоставить неполную ссылку с DOI, но совпадение нужно проверить по нескольким полям. Одинаковые или близкие названия, early-access дата и дата выпуска тома создают ложные совпадения. Сверьте хотя бы title, первого автора, venue и год, затем откройте https://doi.org/<DOI>.
Ниже минимальный сценарий без сторонних Python-пакетов. Он отправляет зафиксированный запрос в OpenAlex, исключает помеченные как retracted записи, ограничивает нижнюю дату и печатает DOI, год, число цитирований в текущем снимке индекса и title. Число результатов и порядок со временем изменятся — воспроизводится стратегия поиска, а не навечно замороженная выдача.
import json
import sys
from urllib.parse import urlencode
from urllib.request import Request, urlopen
params = {
"search": '"automated program repair" AND '
'(neural OR "machine learning" OR LLM)',
"filter": "from_publication_date:2021-01-01,is_retracted:false",
"sort": "relevance_score:desc",
"per_page": 25,
"select": (
"id,doi,title,publication_year,cited_by_count,primary_location"
),
}
url = "https://api.openalex.org/works?" + urlencode(params)
print(url, file=sys.stderr)
request = Request(
url,
headers={"User-Agent": "literature-search-example/1.0"},
)
with urlopen(request, timeout=30) as response:
payload = json.load(response)
for work in payload["results"]:
identity = work["doi"] or work["id"]
print(
work["publication_year"],
work["cited_by_count"],
identity,
work["title"],
sep=" ",
)Запуск:
python3 search_papers.py > candidates.tsv 2> search.logЧтобы результат можно было проверить позднее, сохраните рядом не только candidates.tsv, но и четыре элемента протокола:
include, exclude или uncertain с короткой причиной.Дальше обработайте первые релевантные записи по одному и тому же маршруту.
Если есть DOI, запросите https://api.crossref.org/works/<DOI> и откройте резолвер DOI. Сверьте title, авторов, venue, год и тип публикации. Если есть только arXiv ID, зафиксируйте номер версии и проверьте поля DOI и journal reference на странице abstract. Не склеивайте записи только по похожему названию: conference paper, расширенная journal article и препринт могут быть разными объектами.
Запишите одно из значений: preprint, peer-reviewed conference paper, journal article, thesis или technical report. Сам факт наличия DOI не доказывает peer review, а наличие в arXiv не доказывает его отсутствие у другой версии. Статус устанавливается по странице venue или издателя для конкретной версии.
Прочитайте title, abstract и keywords первой действительно релевантной работы. Добавьте встреченные названия задачи, benchmark и baseline в словарь. Например, общий термин program repair может привести к более узким neural program repair, test-suite based repair или названию набора ошибок. Новые термины запускайте отдельными запросами и сохраняйте отдельно: так видно, какой запрос нашёл каждый кандидат.
References отвечают на вопрос «на чём строится эта работа?», citations — «что сделали после неё?». Просмотрите обе стороны в Semantic Scholar или OpenAlex. Для важной ссылки снова подтвердите DOI и версию на первичной странице. Цепочка цитирования помогает найти работы с другой терминологией, которые не попали в keyword search.
Повторите ключевые термины в DBLP и проверьте подходящие proceedings в ACM DL и IEEE Xplore. Этот проход обнаруживает ошибки нормализации venue, пропущенный DOI и соседние papers из того же выпуска. Он также показывает, не ограничился ли широкий индекс одной издательской экосистемой.
Для небольшого обзора достаточно CSV или таблицы со следующими колонками:
| Колонка | Что записывать |
|---|---|
work_id | DOI; если его нет — стабильный arXiv или OpenAlex ID |
title | название проверенной версии |
version | arXiv vN, conference version или version of record |
status | preprint, conference, journal, thesis, report |
venue_year | название площадки и год |
found_by | точный запрос, seed paper или citation edge |
decision | include/exclude/uncertain и причина |
artifact | ссылка на код или данные, найденная в самой работе |
checked_at | дата ручной проверки |
DOI удобно привести к нижнему регистру и форме без префикса https://doi.org/ перед дедупликацией. Для записей без DOI храните отдельные идентификаторы, а не пытайтесь получить ключ из title: даже небольшое изменение пунктуации разрушит такое совпадение. Если препринт и опубликованная версия явно связаны, оставьте связь между строками или поля для обоих IDs; не удаляйте историю версии ради «чистой» таблицы.
Первое место не означает лучшую работу. Ранжирование отражает модель конкретного сервиса, доступные ему поля и накопленные цитирования. Для нового узкого направления полезная статья может находиться далеко от начала.
Большое число цитирований не доказывает корректность. Статью цитируют как основу, пример ошибки, набор данных или объект критики. Причина видна только из контекста и текста citing paper.
Отсутствие результата не доказывает отсутствие исследования. Индекс мог не покрыть venue, не получить abstract, не связать варианты имени автора или ещё не обновиться. Проверьте второй широкий индекс и профильный каталог.
Открытый PDF не сообщает статус версии. Это может быть препринт, accepted manuscript или version of record. Сравните DOI, дату, номер версии и страницу издателя.
AI-summary не является источником утверждения. Краткая карточка помогает решить, что читать первым, но числа, метод, ограничения и выводы нужно сверять с самой работой.
Фильтр по свежести отрезает основания области. После прохода по новым материалам обязательно посмотрите references одного-двух хороших обзоров или сильных seed papers без нижней границы года.
Хороший поиск заканчивается не папкой из десятков PDF, а проверяемым набором записей: понятно, какой вопрос задавался, какими строками искали, когда выполняли поиск, почему включили каждую работу и какую именно версию прочитали. Такой протокол можно повторить после обновления индексов и честно объяснить другому человеку.
---
Текст — самостоятельная инструкция редакции ЯдроКода по официальной документации перечисленных сервисов. Возможности интерфейсов и API проверены 20 августа 2026 года. Счётчики, ранжирование, покрытие, тарифы и элементы интерфейса меняются; перед систематическим обзором или автоматизацией нужно повторно сверить актуальную документацию. Логотипы, скриншоты, тексты карточек и программный код сервисов не воспроизводятся.
Самостоятельная инструкция редакции ЯдроКода по официальной документации Crossref, OpenAlex, Semantic Scholar, arXiv, dblp, ACM и IEEE. Формулировки, структура, поисковый сценарий и код примера созданы редакцией; тексты, код и изображения источников не воспроизводятся.
Логотипы, скриншоты и элементы интерфейсов сервисов не копируются. Таблицы, запрос и Python-пример созданы редакцией.