当前位置:

首页 > 编程开发 > 如何高效将 JSON 数据批量导入 Django 模型(SQL 数据库)

如何高效将 JSON 数据批量导入 Django 模型(SQL 数据库)

如何高效将 JSON 数据批量导入 Django 模型(SQL 数据库) 本文详解 Django 中将 JSON 文件数据批量写入数据库的正确方法,重点解决单次循环中仅保存最后一条记录的问题,并推荐使用 bulk_create() 实现高性能、低开销的一次性批量插入。 在 Django 开发中,从外

如何高效将 JSON 数据批量导入 Django 模型(SQL 数据库)

本文详解 Django 中将 JSON 文件数据批量写入数据库的正确方法,重点解决单次循环中仅保存最后一条记录的问题,并推荐使用 bulk_create() 实现高性能、低开销的一次性批量插入。

在 Django 开发中,从外部 JSON 文件导入数据到数据库,是个高频操作。但不少新手容易踩一个坑:在循环里创建了模型实例,却把保存操作放错了位置,结果数据库里只孤零零躺着最后一条记录,前面的数据全丢了。

比如下面这段典型的“问题代码”:

for item in data:
    my_model_instance = MyModel(...)  # 每次覆盖引用
my_model_instance.sa ve()  # ❌ 只保存最后一次迭代的对象

问题出在哪?关键在于,.sa ve() 必须放在循环内部,每创建一个实例就立刻保存。但更优的方案是:先把所有实例“攒”起来,然后一次性入库。这正是 Django ORM 的 bulk_create() 方法大显身手的地方。

这个方法会把成百上千条记录,打包成一条或极少数几条 SQL INSERT 语句发送给数据库。比起在循环里调用 N 次 .sa ve()(意味着 N 次数据库连接和事务),性能提升可不是一星半点,尤其是在处理大量数据时,效率差异能达到数十倍。

那么,具体该怎么写呢?下面是一个优化后的、可直接使用的视图函数示例:

from django.shortcuts import render
import json
from .models import MyModel
import os

def display(request):
    # 构建 JSON 文件绝对路径(注意:建议使用 settings.BASE_DIR 更健壮)
    json_file_path = os.path.join(
        os.path.dirname(__file__), '..', '..', 'jsondata.json'
    )

    try:
        with open(json_file_path, 'r', encoding='utf-8') as f:
            data = json.load(f)

        # ✅ 使用列表推导式批量构建模型实例
        model_instances = [
            MyModel(
                end_year=item.get('end_year'),
                intensity=item.get('intensity'),
                sector=item.get('sector'),
                topic=item.get('topic'),
                insight=item.get('insight'),
                url=item.get('url'),
                region=item.get('region'),
                start_year=item.get('start_year'),
                impact=item.get('impact'),
                added=item.get('added'),
                published=item.get('published'),
                country=item.get('country'),
                relevance=item.get('relevance'),
                pestle=item.get('pestle'),
                source=item.get('source'),
                title=item.get('title'),
                likelihood=item.get('likelihood'),
            )
            for item in data
        ]

        # ✅ 批量写入数据库(自动跳过空列表,支持 batch_size 参数分批)
        MyModel.objects.bulk_create(model_instances, batch_size=1000)

    except FileNotFoundError:
        data = []
        # 可选:记录日志或抛出自定义异常
        # import logging; logging.error("JSON file not found: %s", json_file_path)
    except json.JSONDecodeError as e:
        data = []
        # 处理 JSON 格式错误
        raise ValueError(f"Invalid JSON format: {e}") from e
    except Exception as e:
        # 建议捕获更具体的异常(如 IntegrityError),便于调试
        raise

    return render(request, 'display.html', {'data': data})

代码写好了,但魔鬼藏在细节里。想让这段代码足够健壮,能上生产环境,有几个关键点必须注意:

  • ✅ 使用 .get(key) 替代直接 item[‘key’]:这能有效避免因为 JSON 里某个字段意外缺失而导致的 KeyError 崩溃,让程序更从容。
  • ✅ 指定 encoding=‘utf-8’:处理包含中文或其他非 ASCII 字符的数据时,这行代码能救命,确保不会出现乱码。
  • ✅ 善用 batch_size 参数:当数据量极大(比如超过一万条)时,设置 batch_size=1000 可以分批插入,既能避免单条 SQL 语句过长导致数据库报错,也能防止内存被瞬间吃光。
  • ⚠️ bulk_create() 不触发 sa ve() 方法和信号:这是个重要的限制。如果你在模型的 sa ve() 方法里写了自定义逻辑,或者依赖 pre_sa ve/post_sa ve 信号来做点事情(比如自动更新某个时间戳),那么 bulk_create() 会绕过它们。这种情况下,就需要考虑其他方案,比如使用 model_to_dict() 配合表单保存,或者手动在批量创建后触发相关逻辑。
  • ⚠️ 留意主键与默认值:对于自增主键(AutoField),bulk_create() 会自动处理好。但是,对于模型中字段定义的 default 值(例如 default=timezone.now),bulk_create() 不会自动计算并填充。你需要在创建实例时,就显式地传入这些值。
  • ✅ 路径安全是底线:示例中使用了相对路径来定位 JSON 文件,这在开发中或许方便,但在生产环境是隐患。最佳实践是,通过 settings.BASE_DIR 来构建绝对路径,将数据文件放在项目结构内明确的位置进行管理。

把这些要点都做到位,你的 JSON 数据导入流程就不仅仅是“能用”,而是具备了生产环境所需的健壮性、可维护性与高性能。从源头避免数据丢失,让批量操作真正快起来,这才是高效开发该有的样子。

如何高效将 JSON 数据批量导入 Django 模型(SQL 数据库)

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
抖音官网入口网页
抖音官网入口网页

抖音官网入口的正确打开方式 如果你在寻找抖音网页版的入口,那么直接访问 https://www.douyin.com 就是了。这不仅是通往海量短视频世界的门户,更是一个功能越来越专业的媒体素材库和创作工具箱。为什么这么说?看看它最近在功能上的深度拓展就知道了。 简单一个网址背后,其实是一个日益精密的

在小说搜搜找不到想看的小说怎么办?小说搜搜换源功能使用详解【必学】
在小说搜搜找不到想看的小说怎么办?小说搜搜换源功能使用详解【必学】

小说搜搜搜索不到结果?五种实用解决方法帮你搞定 在小说搜搜里搜不到想看的书?这事儿其实挺常见。问题多半出在书源上——要么是默认的书源还没来得及收录,要么是原先的源数据失效了,更新没跟上。别急,下面这五条解决路径,基本能覆盖绝大多数情况,操作起来也不复杂。 一、通过阅读页调出换源入口手动切换 这个方法

蓝海搜书搜书攻略及入口指南免费分享
蓝海搜书搜书攻略及入口指南免费分享

蓝海搜书提供超三百万部小说资源,覆盖十余类题材;具备毫秒级搜索响应、四套主题引擎、跨端加密同步及全文索引等核心功能,入口为lanhaizw.com。 关于蓝海搜书的免费资源入口和核心功能,一直是许多读者关注的焦点。今天,我们就来深入拆解一下这个平台,看看它在资源、体验和功能上究竟有哪些门道。 官方入

using namespace 使用中遇到的问题怎么解决
using namespace 使用中遇到的问题怎么解决

命名空间的基本概念与常见引入问题在C++等编程语言中,命名空间(namespace)是一种将代码标识符(如变量、函数、类名)封装在特定名称下的机制,其主要目的是避免命名冲突,尤其是在大型项目或使用多个第三方库时。使用“using namespace”指令可以将指定命名空间中的所有名称引入当前作用域,

c语言函数递归 实操经验总结:这些技巧很实用
c语言函数递归 实操经验总结:这些技巧很实用

理解递归的基本原理在C语言中,递归是一种函数调用自身的编程技术。要掌握它,首先需要理解其核心思想:将一个复杂的大问题,分解为一个或几个与原问题相似但规模更小的子问题,直到子问题足够简单,可以直接求解。这个过程通常包含两个关键部分:递归出口和递归体。递归出口定义了问题何时不再继续分解,即最简单、可直接

c语言函数递归 怎么选?常见方案对比分析
c语言函数递归 怎么选?常见方案对比分析

递归函数的基本概念与适用场景在C语言编程中,递归是一种函数调用自身的编程技巧。它并非适用于所有问题,但在处理某些具有自相似结构的问题时,能提供极其清晰和优雅的解决方案。递归的核心思想是将一个大规模问题分解为一个或多个同类型但规模更小的子问题,直到子问题简单到可以直接求解。典型的适用场景包括树形结构的

Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解
Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解

理解内存管理的基石在Objective-C的编程世界中,内存管理是开发者必须掌握的核心技能之一。它直接关系到应用的性能、稳定性与资源利用效率。与一些采用自动垃圾回收机制的语言不同,Objective-C在很长一段时间里,依赖一套基于引用计数的、需要开发者部分介入的管理规则。这套规则的核心思想是明确的

如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏
如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏

理解 dealloc 的角色与时机在 iOS 应用开发中,内存管理是保障应用性能与稳定性的基石。dealloc 方法是 Objective-C 中对象生命周期结束时的关键回调,它标志着对象即将被系统回收内存。正确理解其触发时机至关重要:当一个对象的引用计数降为零时,运行时系统会自动调用该对象的 de

深入理解 Objective-C 中的 dealloc 方法:内存管理核心机制
深入理解 Objective-C 中的 dealloc 方法:内存管理核心机制

内存管理的基石在Objective-C的世界里,内存管理是开发者必须掌握的核心技能之一。作为一门在手动引用计数(MRC)时代诞生的语言,Objective-C要求程序员对对象的生命周期有清晰的认识。dealloc方法正是这一生命周期中至关重要的终点站。它是一个实例方法,当对象的引用计数降为零时,系统

理解 native2ascii:Java 国际化开发中的字符编码工具
理解 native2ascii:Java 国际化开发中的字符编码工具

native2ascii 工具的基本定位在Ja va应用程序的国际化与本地化开发过程中,处理非拉丁字符集是一个常见且关键的环节。Ja va内部使用Unicode字符集来统一表示全球各种语言的文字,但其属性文件(.properties)在历史上要求使用ASCII编码,或者更准确地说,要求非ASCII字

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。