DFM Mimir v1:1B参数小模型如何通过合规后训练实现前沿性能
最近在开源大模型社区,一个现象级的讨论正在升温:当大家都在追逐千亿、万亿参数规模时,一个仅10亿参数的模型,却声称能达到“前沿性能”(Frontier Performance)。这听起来像是一个营销噱头,还是技术路线的根本性转变?
这个模型就是DFM Mimir v1。它的核心卖点非常清晰:用极小的参数量(1B),通过一种创新的“仅使用许可后训练数据”(Only Permissible Post-Training Data)的方法,实现了接近甚至超越某些更大模型的性能。
如果你是一名开发者或研究者,看到这里可能会产生几个疑问:
- “1B参数”真的够用吗?在动辄百亿参数的今天,10亿参数能做什么?
- “许可后训练数据”是什么?这和我们熟知的预训练、微调有什么区别?它如何解决数据版权和合规这个“老大难”问题?
- 它的性能“前沿”在哪里?是代码生成、数学推理,还是通用对话?它适合我用来做本地部署、API集成,还是作为研究基线?
这篇文章将为你彻底拆解 DFM Mimir v1。我们不会停留在新闻稿式的复述,而是深入探讨其背后的技术逻辑、实际部署方法、性能验证手段,以及它给开发者带来的真正价值。你会发现,这不仅仅是一个新模型发布,更可能预示着大模型开发范式的一次重要转向:从“大力出奇迹”的规模竞赛,转向更精细、更合规、更高效的数据利用和模型架构设计。
1. 这篇文章真正要解决的问题:为什么小模型突然又“香”了?
在过去两年,大模型的叙事主线一直是“更大、更强”。更多的参数、更长的上下文、更复杂的MoE架构,似乎成了性能提升的唯一路径。但这带来了几个尖锐的痛点:
- 部署成本高:百亿级模型对GPU显存的要求极高,推理延迟大,让许多中小团队和个人开发者望而却步。
- 数据合规风险:模型的优异表现很大程度上依赖于海量的、来源复杂的互联网数据。这引发了日益严峻的版权、隐私和地域合规问题。许多企业因此不敢将大模型用于核心业务。
- 可解释性与可控性差:超大模型如同黑盒,其知识来源、推理过程难以追溯和干预。
DFM Mimir v1 的出现,正是试图正面回应这些痛点。它的核心主张可以概括为:“在严格的数据合规边界内,通过极致的算法和工程优化,让小模型迸发出大能量。”
具体来说,它解决了以下问题:
- 对资源受限的开发者:提供了一个在消费级显卡(如RTX 4090)上就能流畅运行的高性能选择,极大降低了实验和部署门槛。
- 对关注合规的企业和研究者:展示了如何仅使用明确获得许可的数据进行后训练,依然能达到优异效果,为合规AI应用提供了可行路径。
- 对技术趋势的观察者:揭示了模型性能提升的另一个关键维度——数据质量与训练策略,可能比单纯的参数规模更重要。
因此,本文的目标读者是:希望寻找高性能、易部署、合规风险低的开源模型的应用开发者;关注模型效率与数据伦理的算法工程师/研究者;以及任何想了解大模型领域最新技术动向的技术爱好者。
2. 基础概念与核心原理拆解
在深入实操之前,我们必须厘清几个关键概念,否则很容易产生误解。
2.1 DFM, Mimir 与 HRM:它们分别代表什么?
- DFM (DataForge Models):这应该是发布该模型的研究机构或团队名称。类似于 Meta 的 LLaMA、Google 的 Gemma。它暗示了该团队可能专注于数据锻造(Data Forging)或高效数据利用技术。
- Mimir:这是该系列模型的具体名称。在北欧神话中,Mimir 是智慧之神,以拥有无尽的知识而闻名。这个名字寓意该模型虽小,但“智慧”含量高。
- HRM (Hybrid Reward Model? High-Resolution Model?):这是一个需要根据上下文推断的缩写。在强化学习从人类反馈中学习(RLHF)的语境中,Reward Model 是关键组件。但结合“1B参数”和“前沿性能”,“High-Resolution Model”(高分辨率模型)的可能性更大。这可能意味着模型在理解细微语义差别、处理复杂指令方面有独特设计。另一种可能是Hybrid Reasoning Model(混合推理模型),指融合了多种推理能力。目前公开资料未明确定义,我们将其理解为一种能达到高性能的混合/高效模型架构。在后续使用中,我们应关注其实际表现而非缩写本身。
2.2 1B Parameters (10亿参数) 到底意味着什么?
- 对比尺度:1B(10亿)参数,大约是 LLaMA-3 8B 模型的1/8,是 GPT-3 175B 的约1/175。这是一个典型的“小模型”范畴。
- 硬件需求:使用 FP16 精度,1B 参数模型加载所需显存约为
2 bytes/param * 1B = 2 GB。加上激活(Activation)和缓存(KV Cache)开销,在 8GB 显存的显卡(如 RTX 3070/4060 Ti)上即可进行推理,在 16GB 显存(如 RTX 4080/4090)上可以进行高效的微调。这使其具备了极强的本地部署可行性。 - 性能预期:传统观念认为参数少则能力弱。但 Mimir 挑战了这一观念,其关键在于后训练数据和训练策略的质量。
2.3 核心突破:Permissible Post-Training Data (仅使用许可的后训练数据)
这是 Mimir v1 最核心、也最具争议性的技术宣称。我们需要拆解清楚:
- 预训练 vs. 后训练:
- 预训练 (Pre-training):模型从零开始,在海量无标注文本(如网页、书籍、代码)上学习语言的基本规律和世界知识。这是最耗时耗力、数据需求最大且版权最模糊的阶段。
- 后训练 (Post-training):在一个已经预训练好的基础模型上,使用特定数据(如指令数据、对话数据、代码数据)进行继续训练,以赋予模型执行特定任务(如遵循指令、进行对话)的能力。SFT(监督微调)是后训练的一种。
- “仅使用许可的后训练数据”的含义:
- 它可能有一个“干净”的预训练基础:Mimir 的基础模型(Base Model)可能本身就是在相对干净、许可明确的数据集上预训练的(例如,使用 The Stack、Wikipedia 等)。或者,它直接基于一个已有的、开源许可明确的基础模型(如 Gemma 2B)进行构建。
- 其后训练阶段的数据全部“可许可”:团队声称,在将基础模型转化为能对话、能推理的 Mimir v1 的过程中,所使用的所有数据(指令数据、思维链数据、代码数据等)都获得了明确的授权或许可,不存在版权争议。
- 技术重点在后训练策略:这表明 Mimir 的核心创新可能不在于预训练,而在于如何用高质量、合规的有限数据,最大化地激发一个小模型的潜力。这可能涉及高级的微调技术(如DPO、ORPO)、课程学习、数据混合策略等。
简单来说,Mimir v1 的叙事是:我们不需要在灰色地带的庞大数据海洋里预训练,也能通过精妙的“后期加工”,让一个小模型变得非常聪明和有用。
3. 环境准备与部署实践
理论说得再多,不如实际跑起来看看。下面我们以在 Linux 服务器(或 WSL2)上使用 Hugging Facetransformers库进行推理为例,展示如何快速体验 DFM Mimir v1。
3.1 基础环境配置
首先确保你的 Python 环境(推荐 3.9+)和 PyTorch 已安装。我们将使用transformers和accelerate(用于优化加载)。
# 创建并激活虚拟环境(可选但推荐) python -m venv mimir_env source mimir_env/bin/activate # Linux/macOS # mimir_env\Scripts\activate # Windows # 安装核心依赖 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 # 请根据你的CUDA版本调整 pip install transformers accelerate bitsandbytes # bitsandbytes用于量化加载 pip install sentencepiece protobuf # 可能需要的tokenizer依赖3.2 模型下载与加载
假设模型已发布在 Hugging Face Hub,模型ID可能为DataForge/Mimir-v1-1B。我们可以使用以下代码加载模型和分词器。
# 文件:load_mimir.py from transformers import AutoTokenizer, AutoModelForCausalLM import torch # 指定模型路径(请替换为实际HF模型ID) model_id = "DataForge/Mimir-v1-1B" # 此为示例,实际ID需确认 # 加载分词器和模型 tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype=torch.float16, # 使用半精度减少显存占用 device_map="auto", # 自动将模型层分配到可用GPU/CPU trust_remote_code=True # 如果模型需要自定义代码,则需开启 ) # 将模型设置为评估模式 model.eval() print(f"模型 {model_id} 加载完成,设备分布:{model.hf_device_map}")关键参数解释:
torch_dtype=torch.float16:FP16精度,在几乎不损失性能的情况下将显存占用减半。device_map=“auto”:让accelerate库自动处理模型在多个GPU或GPU与CPU之间的分片,对于小模型,通常能全部放入一张GPU。trust_remote_code=True:如果模型使用了非标准transformers架构,需要此参数。对于新模型,建议先尝试不加,若报错再添加。
3.3 运行你的第一个推理
加载模型后,我们来生成一段文本。这里使用一个简单的提示词模板。
# 接上段代码,或新建一个推理脚本 def generate_response(prompt, max_new_tokens=150): # 编码输入 inputs = tokenizer(prompt, return_tensors="pt").to(model.device) # 生成配置 with torch.no_grad(): # 禁用梯度计算,节省显存 outputs = model.generate( **inputs, max_new_tokens=max_new_tokens, temperature=0.7, # 控制随机性:越低越确定,越高越有创意 top_p=0.9, # 核采样 (nucleus sampling) 参数 do_sample=True, # 启用采样生成,而非贪婪解码 repetition_penalty=1.1, # 避免重复 pad_token_id=tokenizer.eos_token_id # 设置填充token ) # 解码输出 response = tokenizer.decode(outputs[0], skip_special_tokens=True) # 只返回新生成的部分(去除输入提示) return response[len(prompt):] # 测试一个指令跟随任务 prompt = """Below is an instruction that describes a task. Write a response that appropriately completes the request. ### Instruction: Explain the concept of quantum entanglement in simple terms. ### Response: """ response = generate_response(prompt) print("模型回复:") print(response)4. 性能评测与对比分析
“前沿性能”需要事实检验。由于 Mimir v1 是较新的模型,全面的第三方评测可能尚不充分。但我们可以从设计思路和已有信息出发,建立自己的评估框架。
4.1 如何客观评估一个小模型?
不要只看总分,要分维度看。建议从以下几个与开发者息息相关的维度进行测试:
- 指令遵循能力 (Instruction Following):模型是否能准确理解并执行复杂、多步骤的指令?
- 测试用例:
“写一个Python函数,接收一个列表,返回去重后逆序排列的结果。请添加详细的文档字符串和类型注解。”
- 测试用例:
- 推理与逻辑能力 (Reasoning):模型能否进行基础数学计算、逻辑推理和常识推理?
- 测试用例:
“如果三只猫三天能抓三只老鼠,那么九只猫九天能抓几只老鼠?请分步骤解释你的推理过程。”
- 测试用例:
- 代码生成与理解 (Coding):这是许多小模型的强项,也是实用价值最高的部分。
- 测试用例:
“用React写一个简单的计数器组件,有增加、减少和重置按钮。”
- 测试用例:
- 知识准确性 (Knowledge):模型对事实性知识的掌握程度。小模型知识容量有限,这是其天然短板。
- 测试用例:
“简述牛顿三大定律的内容。”(对比权威来源)
- 测试用例:
- 对话与安全性 (Chat & Safety):对话是否自然、连贯?是否容易产生有害或偏见输出?
- 测试用例:进行多轮对话,或尝试一些常见的“越狱”提示词(在安全环境下测试)。
4.2 与同规模模型对比
我们可以将 Mimir v1 与一些知名的 1B-3B 级别开源模型进行对比,例如:
- Google Gemma 2B
- Microsoft Phi-2 (2.7B)
- Qwen1.5-1.8B
- TinyLlama-1.1B
一个简单的对比表示例(需实际测试填充):
| 模型名称 | 参数量 | 代码能力 (HumanEval) | 常识推理 (MMLU) | 指令遵循 (MT-Bench) | 显存占用 (FP16) | 备注 |
|---|---|---|---|---|---|---|
| DFM Mimir v1 | 1B | 待测试 | 待测试 | 待测试 | ~2.2 GB | 宣称使用合规后训练数据 |
| Gemma 2B | 2B | 45.1% | 55.1% | 6.5 | ~4.2 GB | Google出品,通用性强 |
| Phi-2 | 2.7B | 61.0% | 69.5% | 7.0 | ~5.4 GB | 专注于推理和逻辑 |
| Qwen1.5-1.8B | 1.8B | 32.3% | 58.8% | 6.2 | ~3.6 GB | 中文能力突出 |
| TinyLlama-1.1B | 1.1B | 25.6% | 52.5% | 5.1 | ~2.2 GB | 纯预训练,作为基线 |
如何进行快速测试?你可以编写一个简单的脚本,用同一组测试题(如上文的指令、推理、代码题)批量测试这些模型,并主观评价其回答的质量、准确性和流畅度。
5. 高级应用:使用 LoRA 进行定制化微调
Mimir v1 的1B参数规模使其成为微调的绝佳候选。全参数微调成本低,而使用 LoRA (Low-Rank Adaptation) 等技术则能进一步降低资源消耗,实现个性化定制。
5.1 为什么选择 LoRA?
- 参数高效:只训练注入的少量低秩矩阵,而非整个模型。
- 显存友好:大幅减少训练时所需的显存,可能在 12GB 显存的 GPU 上就能完成。
- 模块化:可以保存多个 LoRA 适配器,针对不同任务快速切换,无需保存多个完整模型副本。
5.2 使用 PEFT 库进行 LoRA 微调
以下是一个使用 Hugging Facepeft和trl库进行监督微调(SFT)的简化示例。
# 文件:finetune_mimir_lora.py from datasets import load_dataset from transformers import ( AutoTokenizer, AutoModelForCausalLM, TrainingArguments, Trainer, DataCollatorForLanguageModeling ) from peft import LoraConfig, get_peft_model, TaskType import torch # 1. 加载模型和分词器 model_id = "DataForge/Mimir-v1-1B" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.float16) # 添加填充token(如果tokenizer没有) if tokenizer.pad_token is None: tokenizer.pad_token = tokenizer.eos_token # 2. 配置 LoRA lora_config = LoraConfig( task_type=TaskType.CAUSAL_LM, # 因果语言模型任务 r=8, # LoRA 秩 lora_alpha=32, # 缩放参数 lora_dropout=0.1, # Dropout 概率 target_modules=["q_proj", "v_proj"] # 针对注意力层的查询和值投影矩阵 # 对于不同架构,target_modules需调整,常见还有 "k_proj", "o_proj", "gate_proj", "up_proj", "down_proj" ) # 应用 LoRA 配置到模型 model = get_peft_model(model, lora_config) model.print_trainable_parameters() # 查看可训练参数数量,应该远小于1B # 3. 准备数据集(示例:使用一个简单的指令数据集) def format_instruction(example): # 将数据格式化为模型接受的提示格式 prompt = f"### Instruction:\n{example['instruction']}\n\n### Response:\n{example['output']}" return {"text": prompt} # 假设我们有一个本地的JSONL文件 dataset = load_dataset('json', data_files='my_instructions.jsonl') dataset = dataset.map(format_instruction) # 对文本进行tokenization def tokenize_function(examples): return tokenizer(examples["text"], truncation=True, padding="max_length", max_length=512) tokenized_datasets = dataset.map(tokenize_function, batched=True) # 4. 设置训练参数 training_args = TrainingArguments( output_dir="./mimir-lora-finetuned", num_train_epochs=3, per_device_train_batch_size=4, # 根据GPU显存调整 gradient_accumulation_steps=4, # 模拟更大的batch size logging_steps=10, save_steps=500, learning_rate=2e-4, fp16=True, # 使用混合精度训练 remove_unused_columns=False, ) # 5. 创建 Trainer 并开始训练 trainer = Trainer( model=model, args=training_args, train_dataset=tokenized_datasets["train"], data_collator=DataCollatorForLanguageModeling(tokenizer=tokenizer, mlm=False), ) trainer.train() trainer.save_model() # 保存融合了LoRA权重的模型,或单独保存LoRA权重 tokenizer.save_pretrained(training_args.output_dir)关键点说明:
target_modules:需要根据 Mimir v1 的实际架构进行调整。通常对于类 LLaMA 架构,目标模块是注意力层的q_proj,v_proj等。你需要查看模型配置或尝试常见设置。- 数据集格式:你需要将自己的指令-输出对数据整理成合适的格式。
my_instructions.jsonl文件每行应是一个 JSON 对象,如{"instruction": "写一首关于春天的诗", "output": "春风拂面百花开,..."}。 - 训练后,你可以加载微调后的模型进行推理,方法同第3节。
6. 部署优化:量化与推理加速
为了让 Mimir v1 在资源更受限的环境(如边缘设备、低配云服务器)中运行,量化是关键技术。
6.1 使用 bitsandbytes 进行 4-bit 量化加载
transformers库集成了bitsandbytes,可以轻松实现量化加载,无需事先转换模型。
# 文件:load_mimir_4bit.py from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig import torch model_id = "DataForge/Mimir-v1-1B" # 配置 4-bit 量化 bnb_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_compute_dtype=torch.float16, # 计算时使用 FP16 bnb_4bit_use_double_quant=True, # 双重量化,进一步压缩 bnb_4bit_quant_type="nf4", # 量化类型:NF4 ) tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, quantization_config=bnb_config, device_map="auto", trust_remote_code=True ) # 现在模型以4-bit精度加载,显存占用极低(约 ~0.6 GB),可以像普通模型一样使用generate函数6.2 使用 vLLM 或 llama.cpp 进行高性能推理
对于生产环境或需要高吞吐量的场景,专门的推理引擎是更好的选择。
vLLM:适用于 GPU 服务器,以其高效的 PagedAttention 和连续批处理闻名。
# 安装 vLLM pip install vllm # 启动一个 OpenAI 兼容的 API 服务器 python -m vllm.entrypoints.openai.api_server \ --model DataForge/Mimir-v1-1B \ --served-model-name mimir-v1 \ --max-model-len 4096 \ --tensor-parallel-size 1 # 1B模型单卡即可然后你就可以通过
http://localhost:8000/v1/completions发送请求了。llama.cpp:适用于 CPU/GPU 混合环境,特别擅长在 Apple Silicon (M系列芯片) 或纯 CPU 上运行。
# 1. 将模型转换为 GGUF 格式(需要先下载原始模型) # 使用 llama.cpp 仓库中的 `convert.py` 脚本 python convert.py ../models/DataForge-Mimir-v1-1B --outfile mimir-v1-1b.q4_0.gguf --outtype q4_0 # 2. 使用 llama.cpp 进行推理 ./main -m mimir-v1-1b.q4_0.gguf -p "### Instruction:\nWhat is AI?\n\n### Response:" -n 128
7. 常见问题与排查思路
在尝试部署和使用 Mimir v1 时,你可能会遇到以下问题:
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
OSError: Unable to load weights... | 1. 模型ID错误或不存在。 2. 网络问题无法从HF Hub下载。 | 1. 访问 Hugging Face 网站确认模型ID。 2. 检查网络连接和代理设置。 | 1. 使用正确的模型ID。 2. 设置HF镜像或使用 snapshot_download离线下载后从本地加载。 |
RuntimeError: CUDA out of memory | 1. 模型未量化,显存不足。 2. 生成序列长度 ( max_new_tokens) 设置过长。 | 1. 使用nvidia-smi查看显存占用。2. 检查代码中的批次大小和序列长度。 | 1. 使用bitsandbytes4-bit量化加载。2. 减小 per_device_train_batch_size或max_new_tokens。3. 使用 device_map=“auto”和offload_folder启用CPU卸载。 |
KeyError: ‘q_proj’(LoRA微调时) | target_modules配置与模型实际结构不匹配。 | 打印model.model的结构或查看模型的config.json。 | 根据模型架构调整target_modules。对于未知架构,可尝试target_modules=“all-linear”(但会略微增加参数量)。 |
| 模型输出乱码或重复 | 1. 生成参数(temperature,top_p)设置不当。2. 提示词格式不符合模型训练时的格式。 | 1. 调整temperature(降低) 和repetition_penalty(提高)。2. 查阅模型卡(Model Card),使用其推荐的提示模板。 | 1. 尝试temperature=0.1,repetition_penalty=1.2。2. 严格使用类似 ### Instruction:\n...\n\n### Response:\n的格式。 |
| 推理速度慢 | 1. 使用CPU进行推理。 2. 未使用优化过的推理引擎。 | 检查model.device确认模型是否在GPU上。 | 1. 确保CUDA可用,并使用.to(‘cuda’)。2. 考虑使用vLLM或TGI(Text Generation Inference) 部署。 |
| 微调后模型“失忆”或表现变差 | 1. 学习率过高。 2. 训练数据质量差或量太少。 3. 过拟合。 | 1. 检查训练损失曲线,是否震荡或早早就降到很低。 2. 在保留的验证集上评估。 | 1. 降低学习率(如1e-5到5e-5)。2. 增加高质量数据。 3. 增加 num_train_epochs或使用早停(Early Stopping)。 |
8. 最佳实践与工程建议
基于对小模型和合规数据的理解,提出以下实践建议:
明确需求,选择匹配的模型:
- 如果你需要极强的代码能力:可以优先测试 Mimir v1 在 HumanEval 或 MBPP 上的表现,并与 Phi-2、CodeGemma 对比。
- 如果你的场景强依赖最新知识:小模型的知识截止日期可能较早,且容量有限。对于需要实时信息的任务,应搭配 RAG(检索增强生成)系统使用。
- 如果你极度关注数据合规:Mimir v1 的“许可后训练数据”特性是其核心优势。务必仔细阅读其模型许可证(License)和数据使用条款,确认是否符合你的项目要求。
提示工程是关键:
- 遵循模型预设格式:像 Mimir 这类经过指令微调的模型,对提示词格式很敏感。使用其训练时的格式(如 Alpaca、ChatML 格式)能获得最佳效果。
- 具体化指令:模糊的指令得到模糊的回答。将任务分解,给出明确步骤和输出格式要求。
- 使用系统提示(System Prompt):如果模型支持,使用系统提示来设定角色、行为和输出规范。
量化部署策略:
- 开发/实验阶段:使用
transformers+bitsandbytes的 4-bit 量化,快速验证想法。 - 生产 API 服务:使用vLLM或TGI,它们能提供高吞吐、低延迟的并发推理能力。
- 边缘/终端部署:将模型转换为GGUF格式,使用
llama.cpp或相关绑定库,在资源受限设备上运行。
- 开发/实验阶段:使用
微调前的数据准备:
- 质量优于数量:对于小模型,1000条高质量、多样化的指令-输出对,远胜于10万条低质数据。
- 模拟真实分布:你的微调数据应尽可能贴近你最终应用场景的用户查询分布。
- 严谨的数据清洗:去除错误、矛盾、带有偏见或有害内容的数据。
建立有效的评估体系:
- 不要只依赖公开基准分数。建立你自己的测试集,包含核心业务场景的典型问题。
- 进行A/B 测试,将 Mimir v1 的输出与现有方案(或其他模型)进行人工或自动化评估对比。
- 监控生产环境中的模型输出,设立人工审核通道,持续收集反馈以迭代模型。
DFM Mimir v1 的出现,与其说是一个“屠榜”的SOTA模型,不如说是一个重要的技术风向标。它清晰地指向了两个趋势:第一,在特定优化下,小模型的性能天花板远比我们想象的高;第二,数据合规性正在从一个边缘顾虑变成核心设计原则。
对于大多数开发者而言,它的价值在于提供了一个高性能、低门槛、合规前景更清晰的实验和生产基座。你可以在单张消费级显卡上完成从测试、微调到部署的全流程,快速验证AI想法,而无需担忧庞大的基础设施成本和潜在的数据法律风险。
下一步,你可以:
- 亲自部署并测试:按照本文的指南,在本地或云端实例上运行 Mimir v1,用你自己的问题去考验它。
- 探索其边界:尝试它在你的专业领域(如法律文本分析、医疗问答、金融报告生成)的表现,看看这个“小巨人”的潜力究竟有多大。
- 关注其生态发展:留意是否有基于 Mimir 的衍生模型、量化版本或领域微调版发布,这些都可能进一步降低你的使用成本。
在参数规模竞赛之外,一场关于模型效率、数据质量和工程落地的竞赛已经悄然开始。DFM Mimir v1 是这场新竞赛中一个不容忽视的选手。
