展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > Java读取Excel保持列顺序的技巧

Java读取Excel保持列顺序的技巧

当从Excel文件中读取数据并将其存储到List<Map>结构中时,标准的HashMap无法保证键值对的插入顺序,导致列顺序混乱。本教程将详细介绍如何利用LinkedHashMap来有效解决这一问题,确保数据在内存中保持与Excel源文件一致的列顺序,为后续的数据处理或写回Excel提供便利,并提供完整的Java代码示例。

Java读取Excel数据并保持列顺序的实用指南

当从Excel文件中读取数据并将其存储到List结构中时,标准的HashMap无法保证键值对的插入顺序,导致列顺序混乱。本教程将详细介绍如何利用LinkedHashMap来有效解决这一问题,确保数据在内存中保持与Excel源文件一致的列顺序,为后续的数据处理或写回Excel提供便利,并提供完整的Java代码示例。

1. 问题背景:HashMap与数据顺序

在Java中,HashMap是一种基于哈希表的Map实现,它提供了高效的键值对存储和检索能力。然而,HashMap的设计初衷是为了优化性能,而不是为了维护元素的插入顺序。这意味着当你向HashMap中添加键值对时,它们在内部的存储顺序是不确定的,并且可能会随着哈希冲突的解决或内部扩容而改变。

对于Excel这类结构化数据源,列的顺序通常是固定的且具有业务意义。例如,一个Excel表格可能有“姓名”、“年龄”、“城市”三列,如果使用HashMap存储每一行数据,那么读取后,Map中键值对的顺序可能是“年龄”->“姓名”->“城市”,而非原始的“姓名”->“年龄”->“城市”。当需要将这些数据写回Excel或进行依赖列顺序的进一步处理时,这种顺序的丢失就会成为一个严重的问题。

2. 解决方案:LinkedHashMap与TreeMap

为了解决HashMap不保留插入顺序的问题,Java提供了两种特殊的Map实现:

  • LinkedHashMap: LinkedHashMap是HashMap的子类,它通过维护一个双向链表来记录键值对的插入顺序。这意味着当你遍历LinkedHashMap时,元素的返回顺序将与它们被插入时的顺序完全一致。这正是我们从Excel读取数据并希望保留列顺序时所需要的特性。
  • TreeMap: TreeMap是基于红黑树实现的Map,它会根据键的自然顺序(或者通过构造函数提供的Comparator)对键值对进行排序。如果你希望Map中的列按照字母顺序或其他自定义顺序排列,TreeMap是一个选择。但对于保留Excel原始列顺序的需求,LinkedHashMap更为直接和适用。

考虑到我们的目标是保留Excel中“从左到右”的原始列顺序,LinkedHashMap是最佳选择。

3. 实现细节:使用LinkedHashMap读取Excel数据

下面我们将修改原始代码,将每一行数据的存储容器从HashMap替换为LinkedHashMap,以确保列顺序的保留。

import org.apache.poi.ss.usermodel.*;
import java.util.*;
import java.util.stream.Collectors;

public class ExcelDataReader {

    /**
     * 从Excel工作表中读取数据,并将其存储为List>。
     * 每个Map代表一行数据,键为列标题,值为单元格内容。
     * 使用LinkedHashMap确保列的顺序与Excel中一致。
     *
     * @param sheet 要读取的Excel工作表对象。
     * @return 包含所有行数据的List,每行数据是一个LinkedHashMap。
     *         如果工作表为空,则返回一个空列表。
     */
    public static List> readExcelSheet(Sheet sheet) {
        Iterator rows = sheet.iterator();

        // 检查工作表是否为空
        if (!rows.hasNext()) {
            return Collections.emptyList();
        }

        // 读取表头(第一行)以获取列名和它们的顺序
        Row headerRow = rows.next();
        List columnHeaders = new ArrayList<>();
        // 遍历表头单元格,获取所有非空列名
        for (Cell cell : headerRow) {
            String headerValue = cell.getStringCellValue().trim(); // 获取并清理列名
            if (!headerValue.isEmpty()) {
                columnHeaders.add(headerValue);
            } else {
                // 如果遇到空列名,认为后续没有有效列,停止读取表头
                // 实际应用中可能需要更复杂的逻辑来处理空列名或合并单元格
                break;
            }
        }

        List> allRowsData = new ArrayList<>();

        // 遍历剩余的行(数据行)
        while (rows.hasNext()) {
            Row dataRow = rows.next();
            // 使用LinkedHashMap来保证列的插入顺序与表头一致
            Map rowDataMap = new LinkedHashMap<>();

            // 遍历已识别的列头,按顺序获取对应单元格的值
            for (int i = 0; i < columnHeaders.size(); ++i) {
                String columnName = columnHeaders.get(i);
                // 获取单元格,如果单元格不存在则创建为空白单元格
                Cell cell = dataRow.getCell(i, Row.MissingCellPolicy.CREATE_NULL_AS_BLANK);
                String cellValue = getCellValueAsString(cell); // 统一处理单元格值

                rowDataMap.put(columnName, cellValue);
            }

            // 仅添加非空行到结果列表
            // 判断行是否为空的逻辑:如果所有值都为空字符串,则认为是空行
            if (!rowDataMap.values().stream().allMatch(String::isEmpty)) {
                allRowsData.add(rowDataMap);
            }
        }

        return allRowsData;
    }

    /**
     * 辅助方法:将单元格内容统一转换为字符串。
     * 处理不同类型的单元格,避免toString()直接调用可能带来的问题。
     *
     * @param cell 单元格对象。
     * @return 单元格内容的字符串表示。
     */
    private static String getCellValueAsString(Cell cell) {
        if (cell == null) {
            return "";
        }
        switch (cell.getCellType()) {
            case STRING:
                return cell.getStringCellValue().trim();
            case NUMERIC:
                if (DateUtil.isCellDateFormatted(cell)) {
                    // 处理日期类型
                    return cell.getDateCellValue().toString(); // 或者使用SimpleDateFormat格式化
                } else {
                    // 处理数字类型,避免科学计数法或精度问题
                    return String.valueOf(cell.getNumericCellValue());
                }
            case BOOLEAN:
                return String.valueOf(cell.getBooleanCellValue());
            case FORMULA:
                // 对于公式单元格,尝试获取其计算结果
                try {
                    return String.valueOf(cell.getNumericCellValue()); // 假设公式结果为数字
                } catch (IllegalStateException e) {
                    try {
                        return cell.getStringCellValue().trim(); // 假设公式结果为字符串
                    } catch (IllegalStateException ex) {
                        return ""; // 无法获取结果
                    }
                }
            case BLANK:
                return "";
            default:
                return cell.toString().trim(); // 其他类型直接转字符串
        }
    }

    // 示例用法
    public static void main(String[] args) {
        // 假设你有一个Excel文件 "example.xlsx"
        // 这里只是一个模拟,实际使用需要引入Apache POI库并加载Workbook
        // Workbook workbook = new XSSFWorkbook(new FileInputStream("example.xlsx"));
        // Sheet sheet = workbook.getSheetAt(0);

        // 为了演示,我们创建一个模拟的Sheet对象
        // 在实际项目中,你需要使用Apache POI加载真实的Excel文件
        // 以下代码仅为概念性演示,不能直接运行,需要POI库支持
        // 假设 sheet 对象已经通过 Workbook.getSheetAt(0) 或其他方式获得

        // 模拟一个简单的Excel工作表
        Workbook mockWorkbook = new org.apache.poi.xssf.usermodel.XSSFWorkbook();
        Sheet mockSheet = mockWorkbook.createSheet("SampleData");

        // 创建表头
        Row header = mockSheet.createRow(0);
        header.createCell(0).setCellValue("column1");
        header.createCell(1).setCellValue("column2");

        // 创建数据行1
        Row row1 = mockSheet.createRow(1);
        row1.createCell(0).setCellValue("value1");
        row1.createCell(1).setCellValue("value2");

        // 创建数据行2
        Row row2 = mockSheet.createRow(2);
        row2.createCell(0).setCellValue("value3");
        row2.createCell(1).setCellValue("value4");

        List> data = readExcelSheet(mockSheet);

        System.out.println("读取到的数据 (LinkedHashMap 保持顺序):");
        for (int i = 0; i < data.size(); i++) {
            Map rowMap = data.get(i);
            System.out.println(i + " = " + rowMap);
            // 验证顺序
            rowMap.forEach((key, value) -> System.out.println("    \"" + key + "\" -> " + value));
        }

        // 预期输出:
        // 0 = {column1=value1, column2=value2}
        //     "column1" -> value1
        //     "column2" -> value2
        // 1 = {column1=value3, column2=value4}
        //     "column1" -> value3
        //     "column2" -> value4
    }
}

代码解释:

  1. Map rowDataMap = new LinkedHashMap<>();: 这是核心改动。通过将HashMap替换为LinkedHashMap,我们确保了在向rowDataMap中添加键值对(即列名和单元格值)时,它们的插入顺序会被保留。
  2. columnHeaders列表: 在读取表头时,我们首先将所有列名按照它们在Excel中的出现顺序存储在一个List中。这个列表充当了“模板”,确保后续在填充LinkedHashMap时,我们总是按照正确的索引i和列名columnHeaders.get(i)来添加数据。
  3. getCellValueAsString(Cell cell)辅助方法: 为了提高代码的健壮性,我们引入了一个辅助方法来统一处理不同类型的单元格内容,将其转换为字符串。这比直接调用cell.toString()更安全和准确,因为toString()在不同单元格类型上可能返回不期望的结果(例如,数字可能会带有.0,日期会是原始格式)。
  4. 空行判断: if (!rowDataMap.values().stream().allMatch(String::isEmpty))这行代码用于判断当前行是否所有单元格都为空,如果是则不将其添加到结果列表中,这有助于过滤掉Excel中的空白行。

4. 注意事项与最佳实践

  • Apache POI依赖: 上述代码使用了Apache POI库来处理Excel文件。在实际项目中,你需要确保项目中已添加相应的Maven或Gradle依赖,例如:
    
    
        org.apache.poi
        poi
        5.2.3 
    
    
        org.apache.poi
        poi-ooxml
        5.2.3 
    
  • 单元格类型处理: getCellValueAsString方法提供了一个基础的单元格类型处理。在更复杂的场景中,你可能需要根据业务需求对日期、数字格式、公式结果等进行更精细的控制(例如,使用DataFormatter来格式化单元格值)。
  • 空列名处理: 示例代码在遇到空列名时会停止读取表头。如果你的Excel文件可能存在中间的空列名但后面仍有有效列的情况,你需要调整表头读取逻辑。
  • 错误处理: 在生产环境中,应该增加更完善的错误处理机制,例如文件不存在、文件损坏、权限问题等。
  • 性能考量: LinkedHashMap相比HashMap会占用稍多的内存,因为它需要维护额外的链表结构。但对于常见的Excel数据量,这种开销通常可以忽略不计。
  • 内存管理: 对于非常大的Excel文件,一次性将所有数据加载到内存中可能会导致内存溢出。在这种情况下,可以考虑使用Apache POI的SAX解析器(XSSF and HSSF Eventmodel)进行流式读取,或者分批处理数据。

5. 总结

通过将存储每行数据的Map实现从HashMap替换为LinkedHashMap,我们可以轻松解决Java读取Excel数据时列顺序混乱的问题。LinkedHashMap能够完美地保留键值对的插入顺序,这对于依赖列顺序的Excel数据处理至关重要。结合对表头列名的有序提取和单元格内容的健壮处理,我们可以构建出高效且准确的Excel数据读取器,为后续的数据操作提供可靠的基础。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。