FEATURED · 精选文章

SPECTER2_aug2023refresh_base完全指南:科学文献嵌入的终极解决方案

发布时间 / 2026/8/7 21:24:32
来源 / 创域科博编辑部
栏目 / 资讯中心
SPECTER2_aug2023refresh_base完全指南:科学文献嵌入的终极解决方案 SPECTER2_aug2023refresh_base完全指南科学文献嵌入的终极解决方案【免费下载链接】specter2_aug2023refresh_base项目地址: https://ai.gitcode.com/hf_mirrors/LLM-Research/specter2_aug2023refresh_baseSPECTER2_aug2023refresh_base是科学文献嵌入的终极解决方案作为SPECTER模型的继任者它能为科学任务生成特定任务嵌入是科研工作者处理文献数据的得力助手。一、SPECTER2_aug2023refresh_base模型简介SPECTER2_aug2023refresh_base属于SPECTER2模型家族是用于与相关特定任务适配器配合使用的基础编码器。它基于allenai/scibert模型进行微调模型类型为bert - base - uncased adapters。该模型在包含更多近期论文的扩展引文数据集上对基础 transformer 编码器进行了预训练。值得注意的是对于一般嵌入用途请使用allenai/specter2要在下游任务类型上获得最佳性能请加载相关适配器与基础模型配合使用。二、SPECTER2_aug2023refresh_base的训练与优势一训练数据与过程SPECTER2_aug2023refresh_base的训练分为两个阶段基础模型训练首先在超过600万科学论文引文三元组上训练基础模型这些三元组形式为查询论文、正引文和负引文可能来自与查询或引文的引文相同/不同的研究领域。适配器训练此后在SciRepEval训练任务上训练特定任务格式的适配器其中也从上述数据中采样了60万三元组添加到训练数据中。二模型优势该模型在SciRepEval一个大规模科学嵌入任务评估基准其中包含[SciDocs]作为子集上进行了评估还在MDCR一个大规模引文推荐基准上评估并建立了新的最先进水平。在相关评估中SPECTER2 - Adapters表现出色部分指标达到62.3、59.2、71.2、(38.4, 33.0)等优秀成绩。三、SPECTER2_aug2023refresh_base适配器类型及用途SPECTER2_aug2023refresh_base有多种适配器类型适用于不同的下游任务Proximityallenai/specter2_aug2023refresh将论文编码为查询和候选例如链接预测、最近邻搜索。对于上述未提及的下游任务类型Proximity模型应该足够使用。Adhoc Queryallenai/specter2_aug2023refresh_adhoc_query为搜索任务编码短原始文本查询候选论文可以使用Proximity适配器编码。Classificationallenai/specter2_aug2023refresh_classification编码论文以作为特征输入到线性分类器。Regressionallenai/specter2_aug2023refresh_regression编码论文以作为特征输入到线性回归器。四、SPECTER2_aug2023refresh_base使用示例一安装必要库首先需要确保安装了最新版本的transformers和adaptersadapter - transformers的最新发布更新库。二加载模型和适配器示例from adapters import AutoAdapterModel from transformers import AutoTokenizer # load model and tokenizer tokenizer AutoTokenizer.from_pretrained(allenai/specter2_aug2023refresh_base) # load base model model AutoAdapterModel.from_pretrained(allenai/specter2_aug2023refresh_base) # load the adapter(s) as per the required task, provide an identifier for the adapter in load_as argument and activate it model.load_adapter(allenai/specter2_aug2023refresh, sourcehf, load_asproximity, set_activeTrue) papers [{title: BERT, abstract: We introduce a new language representation model called BERT}, {title: Attention is all you need, abstract: The dominant sequence transduction models are based on complex recurrent or convolutional neural networks}] text_batch [d[title] tokenizer.sep_token (d.get(abstract) or ) for d in papers] inputs tokenizer(text_batch, paddingTrue, truncationTrue, return_tensorspt, max_length512) output model(** inputs) # take the first token in the batch as the embedding embeddings output.last_hidden_state[:, 0, :]三评估和下游使用对于评估和下游使用请参考https://github.com/allenai/scirepeval/blob/main/evaluation/INFERENCE.md。五、相关资源与引用一相关链接Repository:https://github.com/allenai/SPECTER2Demo:Usage二引用如果使用SPECTER2请引用以下著作SPECTER paperSciRepEval paper【免费下载链接】specter2_aug2023refresh_base项目地址: https://ai.gitcode.com/hf_mirrors/LLM-Research/specter2_aug2023refresh_base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻