信息检索与推荐 · 论文 · 第 1 组
待复核本分块共 53 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| ANCE — 让模型自己挖训练负例,对比学习的”自给自足” | ance-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Anh-Moffat 2005 — 让倒排表压到接近熵下限还能 SIMD 解码 | anh-moffat-2005 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Anserini — 把工业搜索引擎 Lucene 改造成学术 IR 实验台 | anserini-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BERT4Rec — 把 BERT 的 MLM 搬进序列推荐做双向建模 | bert4rec-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Block-Max WAND — 给倒排索引加分块上界,跳过算不过 top-k 的整块 | block-max-wand-2011 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BM25 — 用概率框架给搜索结果排队 | bm25 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BM25 — 给文档打分的”老配方” | bm25-okapi | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BPR — 用『i 比 j 更受欢迎』替代『i 是正例 j 是负例』 | bpr-2009 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Brill-Moore 2000 — 把拼写纠错的编辑操作从单字符扩成任意子串 | brill-moore-2000 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| coCondenser — 让 BERT 的 [CLS] 在预训练就学会”代表整段话” | cocondenser-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ColBERT — 让 BERT 检索既准又能扛大规模 | colbert-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ColBERTv2 — 让向量检索既精又能扛百万文档 | colbert-v2 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Contriever — 不用人工标注也能训练稠密检索器 | contriever-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Croft-Harper 1979 — 没有相关性反馈也能跑概率检索 | croft-harper-1979 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DCN — 在 DNN 旁边并联一条专门学特征交叉的网络 | dcn-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DIN — 让推荐模型按你看的广告决定该激活你哪段历史 | din-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DLRM — Meta 把工业推荐模型拆成 4 个标准积木 | dlrm-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| doc2query — 让模型替文档预想”会被怎么搜”再写进倒排表 | doc2query-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DPR — 用 BERT 双塔把检索从 BM25 时代拉进稠密向量时代 | dpr-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DRMM — 检索里的匹配是相关性不是语义相似 | drmm-2016 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DSSM — 把 query 和文档各编码成 128 维向量再算余弦 | dssm-2013 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| E5 — 用海量”自然出现的文本对”训通用 embedding | e5-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GBRank — 把决策树堆起来学排序,一棵树纠正一处错排 | gbrank-2007 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Google 1998 — 把整个网络爬下来、压扁、再用一秒查到 | google-1998 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| HITS — 给网页同时打两个分:权威页 + 索引页 | hits-1999 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Indri 2005 — 把语言模型、推断网络、结构化查询拼成一个搜索引擎 | indri-2005 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| K-NRM — 用核函数把交互矩阵变成可微排序信号 | knrm-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Koren-Bell-Volinsky 2009 — 把推荐系统的 MF 写成 8 页教科书 | koren-mf-2009 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LambdaRank — 跳过定义损失函数,直接把梯度写出来 | lambdarank-2006 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LSH — 让相似点撞同一个桶,把高维最近邻查询从线性变成亚线性 | lsh-indyk-1998 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Maron-Kuhns 1960 — 检索不是匹配,是猜”对你有用的概率” | maron-kuhns-1960 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MinHash — 用最小哈希值估算两个集合的重叠度 | minhash-broder-1997 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MS MARCO — 约百万 Bing 真实查询喂饱神经检索的标准评测集 | ms-marco-2016 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BellKor Netflix Prize 2009 — 集成学习赢下 100 万美金的工程实录 | netflix-bellkor-2009 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| NeuMF — 用神经网络替掉推荐系统的内积 | neumf-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Robertson-Walker 1994 — 把 2-Poisson 压成一行能算的公式 | okapi-bm25-1994 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PageRank — 用随机游走给整个网络的页面打分 | pagerank-1998 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Personalized PageRank — 给每个人一份属于自己的网页排名 | personalized-pagerank-2003 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RankNet — 让搜索引擎学会比较两个结果谁更好 | ranknet-2005 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RM3 — 让搜索引擎自己看一眼结果再重搜一次 | rm3-2001 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RocketQA — 把稠密检索的训练拧到工业级 | rocketqa-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RRF — 把多个搜索结果列表合并成一个的最简单办法 | rrf-cormack-2009 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Salton VSM 1975 — 把文档变成向量再用余弦比相似度 | salton-vsm-1975 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SASRec — 用 Transformer 的 self-attention 替 RNN 做下一步推荐 | sasrec-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Scaling HNSWs — antirez 把向量图做成 Redis 数据结构的工程笔记 | scaling-hnsws-antirez | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SimHash — 用随机超平面把余弦相似度变成汉明距离 | simhash-charikar-2002 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SimRank — 两个节点相似当且仅当它们的邻居相似 | simrank-2002 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SLIM — 让数据自己学一张稀疏的”看了又看”权重表 | slim-2011 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SPLADE — 让神经网络学出稀疏向量,直接复用倒排索引 | splade-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| TF-IDF Classic — 给搜索词分清轻重缓急 | tfidf-classic | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| TrustRank — 用一小撮可信种子把整张 Web 的信誉算出来 | trustrank-2004 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Wide & Deep — 让模型同时学会”记住”和”举一反三” | wide-deep-2016 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| YouTube 双塔召回 — 把 DSSM 搬进推荐并补上两件工业关键 | youtube-two-tower-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |