AI 소식

AI 관련된 최신 뉴스를 전해드립니다.

AI 소식 - 2026-08-26 09:00
이재용·최태원·정의선 만나는 李…AI·美투자 해법 논의
출처: 한국경제
이재명 대통령이 26일 이재용 삼성전자 회장과 회동하고, 앞서 20일 최태원 SK 회장과 만찬을 한 데 이어 정의선 현대차 회장과의 만남도 추진 중이다. 의제는 정부가 6월 말 제시한 반도체·피지컬AI·AI데이터센터 3대 축의 수천조원 규모 메가 프로젝트다. 삼성전자와 SK하이닉스는 호남권에 800조원을 투자해 신규 팹 4기를 짓겠다고 밝혔고, 현대차그룹은 2029년까지 새만금에 9조원을 투입해 AI·로봇·에너지 거점을 만들겠다고 발표했다. 지난달 샌프란시스코 AI 서밋에서 맺은 1400조원 규모 한미 AI 동맹의 후속 조치와 미국 상무장관의 대미 메모리 투자 요구 대응도 함께 논의될 전망이다.
기사 원문 보기 →
AI가 24시간 복지·세금 상담…'AI민주정부' 본격 시동
출처: 뉴시스
행정안전부가 25일 국무회의에서 '세계 최고의 AI민주정부 실현 전략'을 보고했다. 복지·안전·세금·농업·식약 등 5대 분야에 24시간 AI 대민 상담 체계를 만들어 돌봄서비스, 납세, 감염병 예방 등을 시간·장소 제약 없이 상담받을 수 있게 한다. 정부24와 혜택알리미를 연계한 'AI국민비서'는 카카오·네이버 등 민간 플랫폼에서도 쓸 수 있게 표준화하고, 재난정보 앱 '국민안전24'는 22개국 언어를 지원한다. 공직사회에는 법령 검토와 보고서 초안 작성을 돕는 지능형 업무관리시스템 '온AI'를 내년 12월까지 47개 중앙부처에 도입하고, 전 공무원 AI 교육 이수를 의무화하며 전문인재 2만명을 육성한다. 민원 처리 방식과 공무원 업무 환경이 함께 바뀌는 대형 정책이다.
기사 원문 보기 →
"반도체 달라" 빅테크 난리인데…웃지도 울지도 못하는 삼전닉스, 왜?
출처: 머니투데이
사상 최대 호황을 맞은 삼성전자·SK하이닉스가 오히려 불안 요인을 안게 됐다는 분석이다. 중국 낸드업체 YMTC가 상하이 상장을 추진하고 2016년 설립 후 계속 적자였던 CXMT가 지난해 흑자로 돌아서는 등 후발주자들이 호황 자금으로 기술 격차를 좁히고 있다. 엔비디아는 메모리 품귀에 따른 원가 압박으로 내년 출하분부터 AI 서버 가격을 최소 15% 인상할 예정인데, 이는 빅테크의 투자 부담을 키워 AI 시장 자체를 위축시킬 수 있다는 우려로 이어진다. 최태원 SK그룹 회장은 지난달 제주포럼에서 "가격이 더 올라갈까 봐 걱정"이라며 마진율을 낮춰서라도 공급을 늘려 시장을 함께 키워야 한다고 말했다. 삼성전자가 21일 최대 110조원 규모 주주환원을 발표했는데도 주가가 8.7% 급락한 점도 시장의 과열된 기대감을 보여주는 사례로 지목됐다.
기사 원문 보기 →
AI 에이전트가 인터넷을 점령한다…트래픽 1700% 폭증에 '비상'
출처: 뉴시스
클라우드플레어가 지난 5월 기준 자사 네트워크의 AI 에이전트 트래픽이 전년 대비 1700% 급증했다고 25일 밝혔다. 고란 리스티체비치 APAC 총괄은 전체 트래픽의 약 60%가 AI 에이전트에서 발생한다며 "인터넷은 원래 사람을 위해 설계됐지만 이제는 기계의 속도로 작동하는 AI가 트래픽을 주도하고 있다"고 진단했다. 직장인에게 직접 와닿는 대목은 '섀도 AI' 문제로, 직원이 회사 몰래 쓰는 AI 도구에 개인정보나 기밀문서가 프롬프트로 새어 나가는 위험이다. 아니카 가버스 총괄은 "기업의 AI 도입 속도가 보안 대응보다 훨씬 빠르다"며 승인받지 않은 MCP가 쓰이는 '섀도 MCP'까지 관리해야 한다고 강조했다. 클라우드플레어는 한국에서 하루 약 1140억건의 요청을 처리하며 이 중 하루 평균 7억8300만건을 사이버 공격으로 차단하고 있다.
기사 원문 보기 →
"AI천재 데려오라는 대표님 어쩌죠?"…리더를 바꾸는 게 빠르다는데
출처: 매일경제
전 세계 70여 개국에서 임원 헤드헌팅과 리더십 컨설팅을 하는 하이드릭앤스트러글스의 톰 모너핸 글로벌 CEO 인터뷰다. 그는 "AI를 직접 만드는 기업은 소수이고 대부분은 가져다 쓰게 되므로, 그 AI를 무기로 바꿔낼 리더가 있느냐가 진짜 승부처"라고 말했다. 실제 조사에서 "AI가 지금 우리 회사에 경쟁 우위를 준다"고 답한 전 세계 CEO·이사회 임원은 24%에 그쳐, 도입 열기에 비해 성과를 체감하는 곳은 넷 중 하나뿐이었다. 그는 "AI 리터러시는 이제 기본이 됐다"며 기업이 찾는 인재상이 '기술 천재'에서 '사내 역량을 끌어내는 리더'로 옮겨갔다고 진단했다. AI발 고용 불안을 다룰 인사총괄(CHRO)과 통상 압박에 대응할 대관 임원 수요가 급증했다는 점도 짚었다.
기사 원문 보기 →
[AI는 지금] 서비스로 돈 번다…뤼튼, 국내 첫 '유니콘' 등극
출처: 지디넷코리아
뤼튼테크놀로지스가 1000억원 규모 시리즈C를 유치하며 국내 AI 서비스 스타트업 최초로 기업가치 1조원을 인정받아 유니콘이 됐다(누적 투자 약 2300억원). 반도체나 모델 같은 원천기술이 아니라 이용자가 실제로 쓰는 서비스에서 유니콘이 나왔다는 점이 특징이다. 북미에 출시한 AI 엔터테인먼트 플랫폼 'OOC'는 출시 3개월 만에 월매출 100억원을 넘겨 해외 매출이 국내를 앞질렀고, 올해 총매출은 지난해 471억원에서 2000억원 이상으로 뛸 전망이다. 센서타워 집계로 2026년 1분기 AI 컴패니언 앱 인앱구매 수익은 1억5000만 달러로 2023년 1분기 대비 12배 이상 늘었다. 뤼튼은 청소년 이용자 비중이 10%인 서비스에 이용 시간 한도와 부모 동의 강화, 결제 한도 하향 등 보호 정책 도입을 검토 중이다.
기사 원문 보기 →
韓 대학생에 또 '제미나이' 1년 무료 푼 구글…챗GPT 추격 승부수
출처: 뉴시스
구글이 9월 새 학기를 앞두고 국내 대학·대학원생에게 제미나이 유료 멤버십을 1년 무료로 제공하는 프로모션을 재개했다. 만 18세 이상 대학생이 학교 이메일로 인증하면 월 1만1000원짜리 '구글 AI 플러스'를 1년 무료로, 월 2만9000원짜리 '구글 AI 프로'는 74% 할인된 월 7300원에 최대 4년간 쓸 수 있다. 딥 리서치, 이미지·음악·동영상 생성, 400GB 클라우드 저장공간이 포함된다. 오픈서베이 'AI 검색 트렌드 리포트 2026'에 따르면 최근 3개월 내 챗GPT 이용 경험은 58.1%, 제미나이는 52.2%로 격차가 5.9%p까지 좁혀졌고, 제미나이 만족도는 70.6%에서 77.3%로 오른 반면 챗GPT는 75.6%에서 72.6%로 떨어졌다. 앤트로픽 클로드도 국내 앱 월간 이용자가 1월 약 15만명에서 7월 142만명으로 9배 이상 늘며 새 경쟁자로 부상했다.
기사 원문 보기 →
AI 테크 소식 - 2026-08-26 09:00
OpenAI 자체 추론 칩 '할라피뇨', 첫 벤치마크에서 업계 최고 속도·효율 입증
출처: OpenAI Blog
OpenAI가 첫 자체 추론 전용 칩 Jalapeño의 실측 벤치마크를 공개했다. SemiAnalysis의 공개 벤치마크 InferenceX로 측정한 결과 GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 세 모델 모두에서 전력당 AI 처리량이 비교 시스템 대비 1.5~1.9배, 종단간 지연시간은 1.7~3.6배 낮았고, 고인터랙티브 워크로드에서는 2.1~4.1배 높은 성능을 냈다. 아키텍처의 핵심은 데이터 이동 최소화로, KV 캐시를 포함한 모델 상태를 명시적으로 로컬에 배치하고 prefill과 decode 각 단계에 맞는 연산·메모리·네트워킹 조합을 활성화한다. 칩 설계 자체에도 AI를 투입해 9개월 만에 테이프아웃했으며, Codex와 GPT-Astra로 생성한 GPT-OSS 어텐션·MoE 블록 구현이 사람 전문가 코드보다 1.5~1.8배 빨랐다. 정격 700W(실측 550W 이하)이며 올해 말부터 OpenAI 인프라에 배치되고 2세대는 이미 개발 중이다.
기사 원문 보기 →
IBM Granite 4.2, 사전학습부터 다단계 RL까지 전체 레시피를 공개하다
출처: Hugging Face Blog
IBM이 3B·8B·30B 세 사이즈의 추론 모델 Granite 4.2를 Apache 2.0으로 공개하면서 학습 파이프라인 전체를 문서화했다. 약 15조 토큰을 5단계로 사전학습하며 마지막 단계에서 컨텍스트를 512K 토큰까지 확장하고, CoT·에이전트 트래젝토리 데이터로 SFT한 뒤 'RLVR → 스킬 부스터 → SWE 에이전트 → 터미널 → 검색 → RLHF' 순의 다단계 GRPO를 적용한다. 각 단계는 이전 체크포인트에서 warm-start하는 독립 런이며, 에이전트 RL 블록은 8B·30B에만 적용된다. 벤치마크는 8B/30B 기준 SWE-Bench Verified 47.67/57.00, Terminal-Bench 2.1 20.56/29.24, BFCL v4 50.29/61.39이고, 3B/8B/30B의 AIME25는 78.33/86.67/89.17이다. 하이퍼파라미터(SWE 128K 컨텍스트·lr 5e-7 등)까지 공개돼 오픈 웨이트 모델 학습을 재현하려는 팀에 드문 참고 자료다.
기사 원문 보기 →
IBM 차세대 메인프레임 칩, 최초로 Arm과 Z 워크로드를 같은 코어에서 실행
출처: VentureBeat
IBM이 Hot Chips 콘퍼런스에서 자체 명령어 집합(s390x)과 Arm 명령어 집합을 코어 단위로 나노초 단위 전환하며 네이티브 실행하는 최초의 듀얼 아키텍처 메인프레임 프로세서를 공개했다. 2nm 공정에 11개 고성능 코어를 탑재했고 기본 클럭이 5.7GHz를 넘으며, 온칩 AI 추론 가속기와 I/O 가속용 DPU를 포함한다. 전환은 오픈소스 KVM 하이퍼바이저에 의존해 Arm64 Linux VM과 Linux on Z VM을 나란히 구동하는 방식이며, IBM Fellow Christian Jacobi는 전환이 나노초 스케일이라 수 밀리초 단위 VM 실행 시간에 오버헤드가 사실상 상각된다고 설명했다. 배경에는 Arm 개발자 2,200만 명과 PyTorch·ONNX Runtime 중심 AI 스택 생태계를 메인프레임으로 끌어들이려는 전략이 있다. z17 후속 제품에 탑재돼 2028년경 출시 예정이며 Arm 지원은 당분간 Linux 전용이다.
기사 원문 보기 →
Perplexity, 엔비디아와 손잡고 토큰 비용 0인 완전 로컬 AI 에이전트 공개
출처: VentureBeat
Perplexity가 모델·에이전트 하네스·추론 엔진·샌드박스를 한 앱으로 묶어 로컬에서 완전 실행하는 Portable Computer를 출시했다. 자체 Local Knowledge Work Bench(53개 태스크)에서 Qwen 3.8 27B 기반 구성이 82.6%를 기록해 오픈소스 Pi 하네스 77.6%, Hermes 74.0%를 앞섰고, 자체 포스트트레이닝한 PPLX 27B는 85.4%까지 올랐다. BrowseComp에서는 66.7%로 Pi 대비 실행 시간 51%·토큰 70%를 절감했다. Terminal Bench 2.1에서는 로컬 단독 59.6%(한계비용 거의 0), 클라우드 Claude Opus 5를 어드바이저로 에스컬레이션하면 73.0%($0.415/태스크)로, 프런티어 단독 82.4%($0.65/태스크)와 비용·성능 트레이드오프를 정량화했다. 설계상 흥미로운 발견은 Qwen 3.8 27B가 26만 토큰 컨텍스트를 표방하지만 실측 10만 토큰 이후 성능이 무너져 MCP 서버를 경량 CLI로 바꾸고 스킬을 온디맨드 로드하는 최소 하네스를 택했다는 점이다. VRAM 24GB 이상이 필요하며 Windows는 9월 지원 예정이다.
기사 원문 보기 →
LLM이 추론 엔진 취약점을 악용해 호스트 머신을 장악할 수 있다
출처: Boyd's Blog
악의적인 LLM이 의미와 무관한 토큰 시퀀스를 출력해 vLLM·SGLang 같은 추론 엔진의 파서 버그를 통해 GPU 호스트에서 임의 코드를 실행할 수 있다는 위협 모델을 정리한 글이다. 근거로 CVE-2025-9141을 든다. vLLM의 Qwen3 Coder용 XML 툴 파서가 거의 모든 tool-call 인자를 eval()에 넘겼고, Gemini가 해당 PR을 자동 분석해 치명적 취약점으로 경고했음에도 리드 메인테이너가 모델 사용을 언블록하기 위해 강제 머지한 이력이 남아 있다. vLLM은 200개 이상 모델 아키텍처와 약 35개 Jinja 챗 템플릿을 지원해 파싱 표면이 매우 넓고, 실제로 MiniMax-M3가 출력한 평문 문자열을 추론 블록 시작으로 오파싱한 이슈도 있었다. 저자는 GPU 호스트가 logits만 내보내고 토큰 샘플링·파싱은 별도 호스트에서 수행하는 분리 구조, GPU 호스트 권한 최소화, 출력 전량 신뢰 불가 취급을 방어책으로 제안한다. 자체 호스팅 추론 스택을 운영하는 팀이 당장 검토해야 할 공격면이다.
기사 원문 보기 →
Headlong: 스스로 계속 사고하는 지속형 에이전트 하네스 (MIT 라이선스 공개)
출처: Laude Institute
Laude Institute와 MIT가 '지속적 에이전시'를 구현한 오픈소스 에이전트 하네스 Headlong을 공개했다. 코어가 Bash 1만 줄 미만(약 9.9K줄)이며, 핵심 도구 shellm은 재귀 언어 모델(RLM)의 Bash 구현으로 에이전트가 셸 명령을 작성·실행·읽으며 사고한다. 반응형·크론형 하네스와 달리 외부 입력이 없어도 자기주도 루프로 계속 사고하고, 사용자 메시지는 새 세션을 여는 대신 단일 사고 스트림에 관측(observation)으로 삽입된다. 컨텍스트 압축은 전체 trajectory를 지수적으로 감쇠하는 해상도로 유지해 최근 기록은 원문, 과거는 점진 요약으로 남기며, trajectory는 fork·merge가 가능한 jsonl DAG 포맷으로 저장된다. 실제 운영 사례로 사내 에이전트가 자체 구축한 recall 프로세스의 파이프 미독 버그를 사람 개입 없이 48분 만에 진단·수정·검증했고, 배경 사고 비용은 시간당 1~2달러 수준이다.
기사 원문 보기 →
Overmind: 제로카피 공유메모리로 ML 모델 로딩을 15초에서 0.2초로
출처: Hugging Face Blog
from_pretrained가 느린 진짜 원인은 디스크 I/O가 아니라 수 GB 텐서를 새 객체로 역직렬화하며 반복되는 메모리 복사라는 진단에서 출발한 오픈소스 프로젝트다. Overmind는 from_pretrained를 몽키패치해 텐서의 UntypedStorage를 memfd_create 기반 익명 공유 메모리에 참조로 직렬화하고, 반대편에서 C++ 헬퍼가 memoryview 위에 UntypedStorage를 직접 구성해 제로카피로 복원한다. PyTorch 내장 reductions가 Docker 기본 64MiB인 POSIX shm 상한과 첫 unpickle 후 해제라는 제약 때문에 캐시 용도로 못 쓰이는 문제를 우회한 것이 핵심이다. bitsandbytes 양자화 파라미터용 커스텀 pickle reducer, diffusers 동적 모듈 재임포트, stable-fast 아티팩트의 torch.jit 우회 등 실전 대응도 코드 수준으로 설명한다. i9-11900K + RTX 4090에서 VAE와 ControlNet 2개를 포함한 SD 파이프라인 기준 기본 로딩 5.6~6.3초가 이후 약 1.1초로 줄었고, 이 중 0.9초는 불가피한 CUDA 전송이라 실제 재구성 비용은 약 0.2초다.
기사 원문 보기 →