// PORTFOLIO · 2026

你好,我是 邱鑫宇

|

Python 爬虫工程师 · 数据采集与处理 · AI 应用开发 · 数据可视化。 善于把杂乱的非结构化数据,变成可决策的业务资产。

Python 爬虫 数据采集 Selenium Requests Pandas SpringBoot SpringAI RAG PgVector Redis ECharts 数据可视化
到岗时间 一周内到岗
期望薪资 6K - 8K / 月
所在城市 河北
查看作品集
  • 手机
  • 邮箱
邱鑫宇

邱鑫宇

Python 爬虫工程师

ABOUT

关于我

软件工程本科背景,2 年 Python / 爬虫 / 数据处理一线经验。 曾参与百度移动抓取与收录研发,在高并发分布式采集与正文解析方向有扎实沉淀。

熟悉 HTTP 协议、Cookie 与会话维持、请求头模拟与动态网页渲染抓取; 熟练使用 Requests、Selenium、PySpider、Pandas 完成采集、清洗、结构化与可视化全链路。 具备 RAG、向量数据库与数据驾驶舱类 AI 应用的落地经验, 坚持「采集 → 清洗 → 分析 → 可视化 → 决策」的工程化闭环。

0 工程经验
0% 正文抽取准确率
0%+ 抓取覆盖提升
0%+ 采集效率提升
SKILLS

技术栈

🎨

前端

  • HTML
  • CSS
  • JavaScript
  • ECharts
  • Chart.js
  • 响应式布局
⚙️

后端

  • Python
  • Java
  • SpringBoot
  • SpringAI
  • REST API
🕸️

爬虫与自动化

  • Requests
  • Selenium
  • PySpider
  • Headless Chrome
  • Cookie / Headers 模拟
  • 动态页面抓取
  • 反爬策略处理
  • RPA / 影刀
🧹

数据处理

  • Pandas
  • CSV
  • 数据清洗
  • 数据去重
  • 数据结构化
  • 数据可视化
🗄️

数据库与缓存

  • MySQL
  • MongoDB
  • PostgreSQL
  • PgVector
  • Redis
🤖

AI 与工程化

  • RAG
  • 向量数据库
  • 文档解析
  • PDF / TXT 报告生成
  • Git
  • Linux
EXPERIENCE

工作经历

  1. 2026-02 至今 在职

    Python 爬虫工程师

    北京汇创思拓数字科技有限公司河北分公司

    • 基于影刀 RPA 构建电商数据采集系统,抓取抖音达人、商品与短视频内容数据
    • 覆盖粉丝量、带货能力、销售数据等核心指标,支撑运营选品与达人筛选
    • 实现登录、翻页、动态加载与详情页解析全链路
    • 用 Python / Pandas 完成数据清洗、去重与结构化输出,服务市场分析与业务决策
  2. 2025-07 ~ 2025-10 大厂

    移动抓取与收录研发工程师

    百度在线网络技术(北京)有限公司

    • 参与海量数据分布式爬虫采集系统建设,落地高并发、高可用场景
    • 构建数据质量监控与反馈系统,正文抽取准确率 88% → 97%
    • 推动传统 HTTP 爬虫向 Headless Chrome 渲染爬虫 架构演进
    • 动态内容覆盖率提升至 95%+,移动端成功抓取与索引量提升约 40%
  3. 2025-01 ~ 2025-06 爬虫

    爬虫工程师

    北京国信创新科技股份有限公司

    • 分析网页结构与接口规律,使用 PySpider / Selenium / Requests 采集数据
    • 完成数据源排查、新增与栏目 URL 维护,保障采集稳定性
    • 引入代理 IP 池与爬虫策略,数据获取效率提升 50%+
    • 支持 API 接口调用与社交媒体内容抓取
PROJECTS

项目经验

01
RequestsPandasMatplotlib

电影市场票房分析与可视化系统

2024-01 ~ 2024-07

通过 API 获取中国大陆电影票房排行榜,使用 Requests 采集、CSV 落库、 Pandas 清洗分析,Matplotlib 绘制饼图与折线图,量化年度票房占比与趋势。

亮点:年度票房占比、票价与场次趋势多维分析,输出可复用分析脚本。

02
SpringBootSpringAI RAGPgVector

AI 智能面试辅助平台 Interview-Guide

2026-02 至今

基于 SpringBoot + SpringAI 对接大模型,使用 RAG 检索增强生成面试评测, PgVector 存储向量知识库,Redis 缓存高频题目,输出 PDF / TXT 评测报告。

亮点:简历解析 → 知识库检索 → 面试报告生成闭环,支持 MySQL 存档。

03
CloudflareECharts Chart.jsSheetJS

睿选商务数据驾驶舱

2026-02 至今

解析 Excel 原始商务数据,构建品牌消耗、达人合作与业绩统计看板, 支持多时间维度,部署于 Cloudflare Pages,ECharts 驱动可视化。

亮点:品牌 TOP5、达人合作、负责人业绩排行,近半年/当月/当天增量灵活切换。

DASHBOARD

程序员能力仪表盘

技术能力雷达

技能熟练度

  • 爬虫与数据采集92%
  • Python90%
  • 数据清洗与分析85%
  • 工程化与文档82%
  • 前端可视化80%
  • 数据库与缓存80%
  • AI / RAG 应用78%
  • Java / SpringBoot75%
0% 数据采集能力
0 落地项目
0 技术栈分类
0% 最高抽取准确率